Վերադառնալ
PAC-Bench-ը ստուգում է, թե որքան լավ են մոդելները մեկ հուշումից ստեղծում Pac-Man
SiTech AI Team3 წთ. საკითხავი

PAC-Bench-ը ստուգում է, թե որքան լավ են մոդելները մեկ հուշումից ստեղծում Pac-Man

Ինժիները 30 մոդելների և միջավայրերի համակցության խնդրել է մեկ կարճ հուշումից ստեղծել Pac-Man խաղ։ Լավագույն արդյունքը 100-ից 99 միավոր է, իսկ ամենաթույլ գրառումը հավաքել է ընդամենը 2 միավոր։

Ինժիները հրապարակել է PAC-Bench-ը՝ հանրային չափանիշ, որը առաջատար AI մոդելներին մեկ հարց է տալիս. կարո՞ղ են նրանք մեկ կարճ հուշումից ստեղծել աշխատող Pac-Man խաղ՝ առանց լրացուցիչ ցուցումների և մարդու միջամտության։ Առաջադրանքը բոլորի համար նույնն է՝ «Create a Pac-Man game in a single html page»։ Արդյունքները կարելի է խաղալ նախագծի էջում։

Ինչ է չափում չափանիշը

Նյութը գնահատում է 30 գրառում, որոնք ստեղծվել են մոդելների ու միջավայրերի տարբեր համակցություններով։ Յուրաքանչյուր խաղ գնահատվել է 100 միավորով՝ ըստ հինգ չափանիշի՝ կառավարում (20), ուրվականներ (25), Pac-Man-ի խրվելը (20), լաբիրինթոս (20) և ձայն (15)։ Հեղինակի բացատրությամբ՝ գնահատումը կատարել է Opus 5.5-ը՝ 2026 թվականի սեպտեմբերի 28-ին դիտելով ուղիղ խաղերը, ոչ թե մոդելներն իրենք։

Գրառումները ստեղծվել են Claude Code-ի, Codex-ի, Cursor Cloud-ի և Grok Build-ի միջավայրերում, OpenRouter-ին ուղղված Claude Code-ով և Gemini-ի հետ Antigravity-ով։ Ժամանակն ու թոքենների քանակը վերցված են միջավայրերի արձանագրություններից. եթե գրառումը թիվ չի պահել, աղյուսակում դատարկ է մնացել։

Արդյունքները

Աղյուսակի գլխամասում Anthropic-ի մոդելներն են։ Claude Opus 5.5-ը զբաղեցրել է առաջին տեղը 99 միավորով. գնահատականը նրան վերագրում է հավաքածուի լավագույն ձայնը՝ երկարտահայտություն ներածություն բասի գծով, անընդհատ սիրենա, որը բարձրանում է առաջընթացի հետ, և արկադային մահվան ձայն։ Claude Fable 5.1-ը երկրորդն է 96 միավորով, իսկ Claude Fable 5-ը և OpenRouter-ով գործարկված Claude Sonnet 5.5-ը կիսում են 95-ը։ xAI-ի Grok 4.7-ը ստացել է 94, իսկ OpenAI-ի GPT-5.6 Sol-ը՝ 90։

Ներքևում տարբերությունը մեծ է։ Առնվազն 90 միավոր վերցրեց միայն վեց գրառում, միջինը՝ 58 է, իսկ ամենաթույլը՝ MiniMax M3-ը, հավաքեց ընդամենը 2 միավոր։ Մի քանի խաղ ոչ միայն կոպիտ են, այլև անավարտելի. Grok 4.5-ում 10 գունդ մնաց անհասանելի, իսկ Moonshot-ի Kimi K2.7 Code-ում մեկնարկից 270 գնդից ոչ մեկը հասանելի չէ։

Որտեղ են մոդելները ձախողվում

Ամենահաճախ թույլ կետը ուրվականների վարքն է։ 30 գրառումից 17-ում գնահատումը արձանագրել է լուրջ թերություն ուրվականների չափանիշով. չորս ուրվականներն օգտագործում են նույն տրամաբանությունը, կերված ուրվականները տուն չեն վերադառնում, կամ ուրվականները պատերի վրա են նկարված։ Ինը գրառում ուներ լաբիրինթոսի լուրջ թերություն՝ բազմաթիվ փակուղիներից մինչև դասավորություններ, որոնք ընդհանրապես Pac-Man-ի լաբիրինթոս չեն։

Գինը և արագությունը նույնքան փոփոխական են, որքան որակը։ GPT-6 Luna-ն ամենաէժանն էր՝ մոտ 0,013 դոլար, իսկ Claude Fable 5-ը՝ ամենաթանկը՝ մոտ 17,28 դոլար։ Qwen 3.8 Max-ը ամենադանդաղն էր՝ 44 րոպե, իսկ չատում գրված Grok Bot-ի տարբերակը ավարտվեց մեկ րոպեից քիչ։

Ինչու է սա կարևոր

Նման միավորները նեղ ազդանշան են։ Աշխատող արկադային խաղը մտածողության ընդհանուր չափանիշ չէ, և հեղինակը դա ընդգծում է։ Չափանիշը ցույց է տալիս, թե որքանով է մեկանգամյա առաջադրանքի արդյունքը կախված մոդելի շուրջի միջավայրից և որքան հաճախ գեներացված կոդը ճիշտ է թվում, բայց մինչև վերջ խաղալ հնարավոր չէ։

SSiTech

SiTech — AI-ով հզորացված վեբ մշակում

Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։