უკან დაბრუნება
PAC-Bench: AI მოდელები ერთი პრომპტით Pac-Man-ის თამაშს ქმნიან, საუკეთესო შედეგი 99 ქულაა
SiTech AI Team2 წთ. საკითხავი

PAC-Bench: AI მოდელები ერთი პრომპტით Pac-Man-ის თამაშს ქმნიან, საუკეთესო შედეგი 99 ქულაა

ინჟინერმა ერთი მოკლე პრომპტით 30 სხვადასხვა მოდელსა და ჰარნესს Pac-Man-ის თამაში დააწერინა. საუკეთესო შედეგი 100 ქულიდან 99-ია, ყველაზე სუსტი ჩანაწერი კი მხოლოდ 2 ქულამდე ჩამოვიდა.

ინჟინერმა გამოაქვეყნა PAC-Bench, საჯარო ბენჩმარკი, რომელიც წამყვან მოდელებს ერთ კითხვას უსვამს: შეუძლიათ თუ არა მოკლე პრომპტიდან მუშა Pac-Man-ის თამაშის აწყობა, დამატებითი მითითებისა და ადამიანის ჩარევის გარეშე. დავალება ყველასთვის ერთია: „Create a Pac-Man game in a single html page“. შედეგების თამაში პროექტის გვერდზეა შესაძლებელი.

რას ზომავს ბენჩმარკი

ნაშრომი 30 ჩანაწერს აფასებს, რომლებიც მოდელისა და ჰარნესის სხვადასხვა კომბინაციით შეიქმნა. თითოეული თამაში 100 ქულით შეფასდა ხუთ პარამეტრზე: მართვა (20), მოჩვენებები (25), Pac-Man-ის ჩარჩენა (20), ლაბირინთი (20) და ხმა (15). ავტორის განმარტებით, თამაშები Opus 5.5-მა გადაამოწმა 2026 წლის 28 სექტემბერს, თავად მოდელების მონაწილეობის გარეშე.

ჩანაწერები Claude Code-ის, Codex-ის, Cursor Cloud-ისა და Grok Build-ის ჰარნესებით, OpenRouter-ზე მიმართული Claude Code-ითა და Gemini-სთან ერთად Antigravity-ით შეიქმნა. დრო და ტოკენების რაოდენობა ჰარნესის ტრანსკრიპტებიდანაა; თუ ჩანაწერმა რიცხვი არ შეინახა, ცხრილში ცარიელი დარჩა.

შედეგები

ცხრილის სათავეში Anthropic-ის მოდელები არიან. Claude Opus 5.5 პირველ ადგილზე გავიდა 99 ქულით; შეფასების მიხედვით, მას ყველაზე კარგი ხმა აქვს: ორფრაზიანი შესავალი ბასის ხაზით, უწყვეტი სირენა, რომელიც პროგრესთან ერთად მაღლდება, და არკადის სტილის სიკვდილის ხმა. Claude Fable 5.1 96 ქულით მეორე ადგილზეა, Claude Fable 5 და OpenRouter-ზე გაშვებული Claude Sonnet 5.5 კი 95 ქულას იზიარებენ. xAI-ის Grok 4.7-მა 94 ქულა მიიღო, OpenAI-ს GPT-5.6 Sol-მა კი 90.

დანარჩენებში სხვაობა დიდია. 90 ან მეტი ქულა მხოლოდ 6 ჩანაწერმა მოაგროვა, მედიანა კი 58 ქულაა. ყველაზე სუსტმა ჩანაწერმა, MiniMax M3-მა, მხოლოდ 2 ქულა დააგროვა. რამდენიმე თამაში არა უბრალოდ უხეში, არამედ ვერ მისაღწევია: Grok 4.5-ს 10 პელეტი მიუწვდომელი დარჩა, Moonshot-ის Kimi K2.7 Code-ს კი სტარტიდან 270 პელეტიდან არცერთი.

სად ცდებიან მოდელები

ყველაზე ხშირი სისუსტე მოჩვენებების ქცევაა. 30 ჩანაწერიდან 17-ში შეფასებამ მოჩვენებების პარამეტრზე მსხვილი ხარვეზი დააფიქსირა: ოთხივე მოჩვენება ერთსა და იმავე ლოგიკას იყენებს, შეჭმული მოჩვენებები სახლში არ ბრუნდებიან, ან კედლებზეა დახატული. 9 ჩანაწერს ლაბირინთის მსხვილი ხარვეზი ჰქონდა, ბევრი ჩიხიდან იმ განლაგებამდე, რომელიც Pac-Man-ის ლაბირინთი საერთოდ არ არის.

ფასი და სიჩქარე ხარისხივით მერყეობს. GPT-6 Luna ყველაზე იაფი აღმოჩნდა, დაახლოებით 0,013 დოლარი, Claude Fable 5 კი ყველაზე ძვირი, დაახლოებით 17,28 დოლარი. Qwen 3.8 Max ყველაზე ნელი იყო 44 წუთით, ჩატში დაწერილი Grok Bot-ის ვერსია კი ერთ წუთზე ნაკლებში დასრულდა.

რატომ მნიშვნელოვანია

მსგავსი ქულები ვიწრო სიგნალია. მუშა არკადული თამაში მოდელის აზროვნების ზოგადი საზომი არ არის, ამას ავტორიც ხაზს უსვამს. ბენჩმარკი ცხადყოფს, რამდენადაა ერთჯერადი დავალების შედეგი დამოკიდებული მოდელის გარშემო არსებულ ჰარნესზე და რამდენად ხშირად ქმნის გენერირებული კოდი ისეთ რამეს, რაც სწორად გამოიყურება, მაგრამ ბოლომდე თამაში შეუძლებელია.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.