Geri qayıt
PAC-Bench: modellər bir təlimatla Pac-Man oyununu nə qədər yaxşı qurur?
SiTech AI Team3 წთ. საკითხავი

PAC-Bench: modellər bir təlimatla Pac-Man oyununu nə qədər yaxşı qurur?

Mühəndis 30 model və mühit birləşməsindən bir qısa təlimatla Pac-Man oyunu qurmağı xahiş etdi. Ən yaxşı nəticə 100 baldan 99-dur, ən zəif qeyd isə cəmi 2 bal topladı.

Bir mühəndis PAC-Bench adlı ictimai etalonu dərc etdi. O, aparıcı AI modellərinə bir sual verir: qısa bir təlimatdan, əlavə izah və insan müdaxiləsi olmadan işlək Pac-Man oyunu qura bilirlər? Tapşırıq hamı üçün eynidir: "Create a Pac-Man game in a single html page". Nəticələri layihə səhifəsində yanaşı oynamaq olar.

Etalon nəyi ölçür

Yazı 30 qeydi qiymətləndirir; onlar model və işləmə mühitlərinin müxtəlif birləşmələrindən yaranıb. Hər oyun beş meyar üzrə 100 bala qiymətləndirildi: idarəetmə (20), xəyallar (25), Pac-Man-in ilişib qalması (20), labirint (20) və səs (15). Müəllifin izahına görə, qiymətləndirməni modellərin özü deyil, 28 sentyabr 2026-cı il tarixində canlı oyunları nəzərdən keçirən Opus 5.5 verdi.

Qeydlər Claude Code, Codex, Cursor Cloud və Grok Build kimi öz mühitlərində, OpenRouter-ə yönəldilmiş Claude Code ilə və Gemini ilə birlikdə Antigravity-də hazırlanıb. Vaxt və token sayı mühit protokollarından götürülüb; əgər işləmə rəqəm qeyd etməyibsə, cədvəldə tire görünür.

Nəticələr

Cədvəlin başında Anthropic modelləri dayanır. Claude Opus 5.5 99 balla birinci oldu; rəy ona dəstədə ən yaxşı səsi verdi: bas xətti olan iki cümləli giriş, irəliləyişlə yüksələn fasiləsiz sirena və arkada üslubunda ölüm səsi. Claude Fable 5.1 96 balla ikincidir, Claude Fable 5 və OpenRouter-də işlədilən Claude Sonnet 5.5 isə 95 balı bölüşür. xAI-nin Grok 4.7-si 94, OpenAI-nin GPT-5.6 Sol-u isə 90 bal topladı.

Aşağıda yayılma çox genişdir. Yalnız altı qeyd 90 və daha çox bal topladı, median 58 baldır, ən zəif qeyd olan MiniMax M3 isə cəmi 2 bal yığdı. Bəzi oyunlar sadəcə kobud deyil, sona çatdırıla bilmir: Grok 4.5-də on qranul əlçatmaz qaldı, Moonshot-un Kimi K2.7 Code versiyasında isə başlanğıcdan 270 qranulun heç biri əlçatan deyil.

Modellər harada uğursuz olur

Ən geniş yayılmış zəif nöqtə xəyalların davranışıdır. 30 qeydin 17-də rəy xəyallar meyarında ciddi qüsur qeydə aldı: dörd xəyalın eyni məntiqi paylaşması, yeyilən xəyalların evə qayıtmaması və ya xəyalların divarların üstünə çəkilməsi. Doqquz qeyddə labirint meyarında ciddi qüsur var idi; çoxsaylı kor yollardan Pac-Man labirintinə heç bənzəməyən düzülüşlərə qədər.

Xərc və sürət də keyfiyyət qədər dəyişkəndir. GPT-6 Luna təxminən 0,013 dollarla ən ucuz, Claude Fable 5 isə təxminən 17,28 dollarla ən bahalı oldu. Qwen 3.8 Max 44 dəqiqə ilə ən yavaş idi; çatda yazılmış Grok Bot versiyası isə bir dəqiqədən az müddətdə tamamlandı.

Niyə vacibdir

Bu cür ballar dar bir siqnaldır. İşlək arkada oyunu düşünmənin ümumi ölçüsü deyil və müəllif bunu açıq vurğulayır. Etalon göstərir ki, birdəfəlik tapşırığın nəticəsi modelin ətrafındakı mühitdən nə qədər asılıdır və yaradılan kod nə qədər tez-tez düzgün görünür, amma sona qədər oynanıla bilmir.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.