חזרה
PAC-Bench: כמה טוב מודלים בונים משחק Pac-Man מפרומפט אחד
SiTech AI Team2 წთ. საკითხავი

PAC-Bench: כמה טוב מודלים בונים משחק Pac-Man מפרומפט אחד

מהנדס ביקש מ-30 שילובים של מודלים וסביבות הרצה לבנות משחק Pac-Man מפרומפט קצר אחד, בלי הנחיות נוספות ובלי תיקונים. השיא עומד על 99 מתוך 100 נקודות, והרשומה החלשה ביותר קיבלה רק 2 נקודות.

מהנדס פרסם את PAC-Bench, מבחן ציבורי שמציב למודלי AI מובילים שאלה אחת: האם הם מצליחים לבנות משחק Pac-Man עובד מפרומפט קצר אחד, בלי הנחיות נוספות ובלי התערבות אנושית. המשימה זהה לכולם: „Create a Pac-Man game in a single html page“. את התוצאות אפשר לשחק זו לצד זו בעמוד הפרויקט.

מה המבחן מודד

המאמר מדרג 30 רשומות, שנוצרו משילובים שונים של מודלים וסביבות הרצה. כל משחק נשפט מתוך 100 נקודות בחמישה מדדים: שליטה (20), רוחות (25), היתקעות של Pac-Man (20), מבוך (20) וצליל (15). לפי המחבר, את הניקוד נתן Opus 5.5 לאחר סקירה של המשחקים החיים ב-28 בספטמבר 2026, ולא המודלים עצמם.

הרשומות נוצרו בסביבות מקוריות כמו Claude Code, Codex, Cursor Cloud ו-Grok Build, ב-Claude Code שהופנה ל-OpenRouter, וב-Antigravity יחד עם Gemini. זמני הריצה וספירת הטוקנים נלקחו מתמלולי הסביבות; כשהריצה לא תיעדה מספר, בטבלה מופיע מקף.

התוצאות

בראש הטבלה שולטים מודלים של Anthropic. Claude Opus 5.5 סיים ראשון עם 99 נקודות, כשהסקירה מייחסת לו את הצליל הטוב בקבוצה: פתיחה דו-משפטית מלאה עם קו בס, סירנה רציפה שמתגברת עם ההתקדמות וצליל מוות בסגנון ארקייד. Claude Fable 5.1 שני עם 96, ואילו Claude Fable 5 ו-Claude Sonnet 5.5 שהורץ ב-OpenRouter חולקים 95. Grok 4.7 של xAI קיבל 94, ו-GPT-5.6 Sol של OpenAI הגיע ל-90.

מתחת לזה הפיזור רחב. רק שש רשומות הגיעו ל-90 נקודות או יותר, החציון עומד על 58, והרשומה החלשה ביותר, MiniMax M3, קיבלה 2 בלבד. כמה משחקים לא רק גסים אלא בלתי ניתנים להשלמה: אצל Grok 4.5 נותרו עשרה גלולות בלתי נגישות, ואצל Kimi K2.7 Code של Moonshot אף אחת מ-270 הגלולות אינה נגישה מנקודת הפתיחה.

היכן המודלים נכשלים

החולשה הנפוצה ביותר היא התנהגות הרוחות. ב-17 מתוך 30 רשומות נרשם פגם חמור במדד הרוחות: כל ארבע הרוחות חולקות אותו היגיון, רוחות שנאכלו אינן חוזרות הביתה, או רוחות מצוירות על הקירות. תשע רשומות סבלו מפגם חמור במבוך, ממספר רב של מבויים סתומים ועד פריסות שאינן מבוך Pac-Man כלל.

גם המחיר והמהירות משתנים מאוד. GPT-6 Luna היה הזול ביותר, כ-$0.013, ואילו Claude Fable 5 היה היקר ביותר, כ-$17.28. Qwen 3.8 Max היה האיטי עם 44 דקות, ואילו גרסת Grok Bot שנכתבה ישירות בצ'אט הסתיימה בפחות מדקה.

למה זה חשוב

ציונים כאלה הם אות צר. משחק ארקייד עובד אינו מדד כללי לחשיבה, והמחבר מדגיש זאת. מה שהמבחן כן מראה הוא עד כמה תוצאת משימה חד-פעמית תלויה בסביבת ההרצה שסביב המודל, ובאיזו תדירות קוד שנוצר נראה נכון אך אי אפשר לשחק בו עד הסוף.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.