
PAC-Bench: як AI-моделі створюють Pac-Man з одного промпту, найкращий результат 99 балів
Інженер попросив 30 комбінацій моделей і середовищ зібрати гру Pac-Man з одного короткого промпту. Найкращий результат - 99 зі 100 балів, а найслабший запис отримав лише 2 бали.
Інженер опублікував PAC-Bench, публічний бенчмарк, який ставить провідним AI-моделям одне питання: чи здатні вони зібрати робочу гру Pac-Man з одного короткого промпту, без додаткових підказок і втручання людини. Завдання однакове для всіх: «Create a Pac-Man game in a single html page». Результати можна пограти на сторінці проєкту.
Що вимірює бенчмарк
Матеріал оцінює 30 записів, створених різними комбінаціями моделей і середовищ. Кожну гру оцінювали за 100-бальною шкалою за п'ятьма критеріями: керування (20), привиди (25), застрягання Pac-Man (20), лабіринт (20) і звук (15). За словами автора, оцінювання виконав Opus 5.5, переглядаючи живі ігри 28 вересня 2026 року, а не самі моделі.
Записи створювали в рідних середовищах Claude Code, Codex, Cursor Cloud і Grok Build, у Claude Code, спрямованому на OpenRouter, та в Antigravity разом із Gemini. Час і кількість токенів узято з транскриптів середовищ; якщо запис не зберіг число, у таблиці стоїть прочерк.
Результати
Верхівку таблиці займають моделі Anthropic. Claude Opus 5.5 посів перше місце з 99 балами; рецензія відзначила в нього найкращий звук у наборі: повне двофразове вступ із басовою лінією, безперервну сирену, що підвищується разом із прогресом, та звук смерті в аркадному стилі. Claude Fable 5.1 іде другим із 96 балами, а Claude Fable 5 і запущений на OpenRouter Claude Sonnet 5.5 ділять 95. Grok 4.7 від xAI отримав 94, а GPT-5.6 Sol від OpenAI дійшов до 90.
Нижче розкид дуже великий. Лише шість записів набрали 90 балів або більше, медіана становить 58, а найслабший запис, MiniMax M3, набрав лише 2 бали. Кілька ігор не просто грубі, а й не завершуються: у Grok 4.5 десять кульок недосяжні, а в Kimi K2.7 Code від Moonshot зі старту недосяжні всі 270 кульок.
Де моделі помиляються
Найчастіша слабкість - поведінка привидів. У 17 із 30 записів огляд зафіксував серйозний дефект за критерієм привидів: усі чотири привиди мають однакову логіку, з'їдені привиди не повертаються додому або намальовані поверх стін. Дев'ять записів мали серйозний дефект лабіринту, від великої кількості глухих кутів до розкладок, які взагалі не схожі на лабіринт Pac-Man.
Ціна й швидкість змінюються так само сильно. GPT-6 Luna виявився найдешевшим, близько $0.013, а Claude Fable 5 - найдорожчим, приблизно $17.28. Qwen 3.8 Max був найповільнішим із 44 хвилинами, а версія Grok Bot, написана прямо в чаті, завершилася менш ніж за хвилину.
Чому це важливо
Такі оцінки - вузький сигнал. Робоча аркада не є загальним мірилом міркувань, і автор це наголошує. Бенчмарк показує, наскільки результат одноразового завдання залежить від середовища навколо моделі та як часто згенерований код виглядає правильним, але до кінця в нього зіграти неможливо.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.