Geri Dön
PAC-Bench: modeller tek komutla Pac-Man oyununu ne kadar iyi kuruyor?
SiTech AI Team3 წთ. საკითხავი

PAC-Bench: modeller tek komutla Pac-Man oyununu ne kadar iyi kuruyor?

Bir mühendis, 30 model ve çalıştırma ortamı bileşiminden tek kısa komutla Pac-Man oyunu kurmasını istedi. En iyi sonuç 100 üzerinden 99 puan, en zayıf kayıt ise yalnızca 2 puan aldı.

Bir mühendis, önde gelen yapay zekâ modellerine tek bir soru yönelten PAC-Bench adlı herkese açık kıyaslamayı yayımladı: Kısa bir komuttan, ek yönlendirme ve insan müdahalesi olmadan çalışan bir Pac-Man oyunu kurabiliyorlar mı? Görev herkes için aynı: "Create a Pac-Man game in a single html page". Sonuçlar proje sayfasında yan yana oynanabiliyor.

Kıyaslama neyi ölçüyor

Çalışma, farklı model ve çalıştırma ortamı bileşimlerinden doğan 30 kaydı puanlıyor. Her oyun beş ölçüt üzerinden 100 puan üzerinden değerlendirildi: kontroller (20), hayaletler (25), Pac-Man'in takılması (20), labirent (20) ve ses (15). Yazarın belirttiğine göre puanlamayı modeller değil, canlı oyunları 28 Eylül 2026'da inceleyen Opus 5.5 yaptı.

Kayıtlar Claude Code, Codex, Cursor Cloud ve Grok Build gibi yerel ortamlarda, OpenRouter'a yönlendirilen Claude Code ile ve Gemini eşliğinde Antigravity ile üretildi. Süre ve token sayıları ortam dökümlerinden alındı; bir çalıştırma sayı kaydetmediyse tabloda tire görünüyor.

Sonuçlar

Tablonun zirvesine Anthropic modelleri yerleşti. Claude Opus 5.5, 99 puanla birinci oldu; inceleme ona kümedeki en iyi sesi verdi: bas hattı olan tam iki cümleli bir giriş, ilerlemeyle yükselen kesintisiz bir siren ve arcade tarzı ölüm sesi. Claude Fable 5.1, 96 puanla ikinci sırada; Claude Fable 5 ile OpenRouter üzerinde çalışan Claude Sonnet 5.5 ise 95 puanı paylaşıyor. xAI'nin Grok 4.7'si 94, OpenAI'nin GPT-5.6 Sol'u ise 90 puan aldı.

Bunun altında dağılım çok geniş. Yalnızca altı kayıt 90 puan ve üzeri aldı, ortanca 58 puanda kaldı ve en zayıf kayıt olan MiniMax M3 yalnızca 2 puan topladı. Bazı oyunlar sadece kaba değil, bitirilemez durumda: Grok 4.5'te on top ulaşılamaz kaldı, Moonshot'un Kimi K2.7 Code sürümünde ise başlangıçtan itibaren 270 topun hiçbirine ulaşılamıyor.

Modeller nerede başarısız oluyor

En yaygın zayıflık hayalet davranışı. 30 kaydın 17'sinde inceleme hayaletler ölçütünde ciddi bir kusur kaydetti: dört hayaletin aynı mantığı paylaşması, yenen hayaletlerin eve dönmemesi ya da hayaletlerin duvarların üzerine çizilmesi. Dokuz kayıtta labirent ölçütünde ciddi kusur vardı; çok sayıda çıkmaz sokaktan, Pac-Man labirentine hiç benzemeyen düzenlere kadar.

Maliyet ve hız da kalite kadar değişken. GPT-6 Luna yaklaşık 0,013 dolarla en ucuz, Claude Fable 5 ise yaklaşık 17,28 dolarla en pahalı oldu. Qwen 3.8 Max 44 dakikayla en yavaştı; sohbet içinde yazılan Grok Bot sürümü ise bir dakikadan kısa sürede tamamlandı.

Neden önemli

Bu tür puanlar dar bir sinyal. Çalışan bir arcade oyunu, akıl yürütmenin genel ölçüsü değil; yazar da bunu açıkça vurguluyor. Kıyaslamanın gösterdiği şey, tek seferlik bir görevin sonucunun modelin çevresindeki ortama ne kadar bağlı olduğu ve üretilen kodun ne sıklıkla doğru görünüp sonuna kadar oynanamadığı.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.