Назад
Ataraxos переміг найкращого в історії гравця в Stratego, на навчання знадобилося лише 16 GPU
SiTech AI Team3 хв читання

Ataraxos переміг найкращого в історії гравця в Stratego, на навчання знадобилося лише 16 GPU

Ataraxos переміг Pim Niemeijer, найкращого в історії гравця в Stratego, у 20 партіях із рахунком 15:1; чотири партії завершилися внічию. Дослідники з Carnegie Mellon, MIT, NYU і Stanford навчали систему лише на 16 GPU.

AI опанував ще одну класичну гру. Дослідники з Carnegie Mellon, MIT, NYU і Stanford створили Ataraxos, який переміг Pim Niemeijer, визнаного найкращим в історії гравцем у Stratego, з рахунком 15:1. На навчання знадобилося лише 16 GPU і кілька тисяч доларів; дослідження опубліковано в журналі Nature.

Приховані армії

У Stratego кожен гравець має 40 фігур: військові звання від маршала до шпигуна, а також бомби й прапор; перемагає той, хто захопить прапор суперника. Суперник бачить, де стоять фігури, але не те, яка з них чим є; це з’ясовується під час зіткнення: слабша фігура знімається з дошки. Тому Stratego — гра з неповною інформацією, подібна до покеру.

Різниця масштабна: у Texas Hold'em лише дві закриті картки та 1326 комбінацій, а в Stratego 40 фігур розставляють у будь-якому порядку: понад децильйон розташувань. Партія довга: у шахах 40 ходів, у Stratego — до 2000 ходів.

До цього додається блеф: слабку фігуру іноді рухають так, ніби це маршал. Від частого блефу загрози втрачають сенс, а від рідкісного ти стаєш передбачуваним. Із цим балансом не впоралися попередні системи, зокрема DeepNash від DeepMind.

Як вона навчилася вгадувати

Ataraxos навчали, граючи проти себе, 163 мільйонами партій. Головна новинка — обмірковування перед ходом: друга нейронна мережа, так звана belief model, вгадує приховані фігури суперника за їхніми рухами, а Ataraxos замість усіх розташувань обирає кілька правдоподібних і розігрує в них кандидатні ходи.

Назва Ataraxos походить від давньогрецького слова й означає спокій. «Людині дуже важко, коли ти знаєш таємницю, ухвалити рішення так, ніби не знаєш. Для машини це просто», — каже Farina. Система не діє імпульсивно й повільно, методично відіграє відставання.

Матч

Упродовж трьох тижнів Niemeijer зіграв із Ataraxos 20 партій онлайн, за кожну перемогу отримував 100 доларів; він знав, що система не підлаштовуватиметься під нього, тому присвятив час пошуку слабких місць. Утім, переміг лише раз: за словами дослідників, поразка не є вадою, адже розташування обирається випадково й удача теж важлива.

На чемпіонаті світу 2025 року з Ataraxos змагалися й присутні: із 40 партій він виграв 38. Гравців здивувало те, що він часто ховав прапор у куті, за двома бомбами.

Ціна та мета

Можливо, найбільше досягнення Ataraxos — це ціна: DeepNash тренували два-три місяці на 1024 спеціалізованих чіпах Google, що за цінами 2025 року коштувало 3-4,5 мільйона доларів, а Ataraxos потребував 16 GPU на один тиждень і додатково чотирьох GPU на чотири дні для belief model. Симулятор, написаний Samuel Sokota та Farina, обробляє мільйони ходів за секунду; Ataraxos зіграв у 34 рази менше партій, ніж DeepNash, і все одно виявився значно сильнішим.

Архітектура працює й на інших іграх: перемогла трьох чемпіонів світу в Barrage Stratego, опанувала кооперативну карткову гру Hanabi, перевершила найкращих ботів у китайській картковій грі dou dizhu. Мета команди — складні сценарії на основі настільних ігор: переговори, фінансові ринки, військові конфлікти. Тепер команда працює над тим, щоб Ataraxos став зрозумілим і міг пояснювати ходи.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.