Geri qayıt
Ataraxos tarixdə ən yaxşı Stratego oyunçusunu məğlub edib, öyrənməyə cəmi 16 GPU lazım olub
SiTech AI Team2 dəq oxu

Ataraxos tarixdə ən yaxşı Stratego oyunçusunu məğlub edib, öyrənməyə cəmi 16 GPU lazım olub

AI sistemi Ataraxos bütün zamanların ən yaxşı Stratego oyunçusu sayılan Pim Niemeijeri 20 partiyada 15:1 məğlub edib, dörd partiya isə heç-heçə bitib. Carnegie Mellon, MIT, NYU və Stanford tədqiqatçıları sistemi cəmi 16 GPU-da öyrədiblər.

AI daha bir klassik oyunu mənimsəyib. Carnegie Mellon, MIT, NYU və Stanford tədqiqatçıları yaratdıqları Ataraxos bütün zamanların ən yaxşı Stratego oyunçusu sayılan Pim Niemeijeri 15:1 məğlub edib. Öyrətməyə cəmi 16 GPU və bir neçə min dollar kifayət edib; tədqiqat Nature-də dərc olunub.

Gizli ordular

Stratego-da hər oyunçunun 40 fiquru olur: marşaldan casusa qədər hərbi rütbələr, həmçinin bombalar və bayraq; rəqibin bayrağını götürən qalib gəlir. Rəqib fiqurların harada durduğunu görür, amma hansının nə olduğunu yox; bu, toqquşma zamanı aydınlaşır: zəif fiqur lövhəni tərk edir. Buna görə Stratego pokerə bənzər natamam məlumat oyunudur.

Fərq böyükdür: Texas Hold'em-də iki gizli kart və 1326 kombinasiya var, Stratego-da 40 fiqur istənilən ardıcıllıqla düzülür: desilyondan çox düzülüş. Partiya uzundur: şahmatda 40, Stratego-da 2000 gedişə qədər.

Buna blof da əlavə olunur: zəif fiquru bəzən marşal kimi hərəkət etdirirlər. Tez-tez blof təhlükələri mənasız edir, nadir blof isə proqnozlaşdırıla bilən olur. Bu tarazlığı əvvəlki sistemlər, o cümlədən DeepMind-ın DeepNash-ı bacarmayıb.

Proqnozlaşdırmağı necə öyrəndi

Ataraxos özünə qarşı 163 milyon partiya ilə öyrədilib. Əsas yenilik gedişdən əvvəl düşünməkdir: ikinci neyron şəbəkəsi, belief model, rəqibin gizli fiqurlarını hərəkətlərinə görə təxmin edir; Ataraxos bütün düzülüşlər əvəzinə bir neçə inandırıcı variant seçir və onlarda namizəd gedişləri oynayır.

Ataraxos adı qədim yunan sözündən gəlir və sakitlik deməkdir. “İnsan üçün sirri biləndə bilmirmiş kimi qərar vermək çox çətindir. Maşın üçün bu asandır”, – deyir Farina. Sistem impulsiv deyil və geriləməni yavaş, metodik geri qaytarır.

Matç

Üç həftə ərzində Niemeijer Ataraxos ilə 20 partiyanı onlayn oynayıb, hər qələbəyə 100 dollar alırdı; sistemin ona uyğunlaşmayacağını bilirdi və vaxtını zəif cəhətləri axtarmağa sərf edib. Amma yalnız bir dəfə qalib gəlib: tədqiqatçılara görə, məğlubiyyət qüsur deyil, çünki düzülüş təsadüfi seçilir və şans da vacibdir.

2025 dünya çempionatında Ataraxos iştirakçılarla da oynadı: 40 partiyadan 38-ni qazandı. Oyunçuları təəccübləndirən odur ki, bayrağı tez-tez küncdə, iki bombanın arxasında gizlədirdi.

Qiymət və məqsəd

Bəlkə də Ataraxos-un ən böyük nailiyyəti qiymətidir: DeepNash iki-üç ay Google-ın 1024 xüsusi çipində öyrədilirdi, 2025 qiymətləri ilə 3-4,5 milyon dollar dəyərində; Ataraxos üçün 16 GPU bir həftə, belief model üçün əlavə dörd GPU dörd gün kifayət etdi. Samuel Sokota və Farina yazdığı simulyator saniyədə milyonlarla gedişi emal edir; Ataraxos DeepNash-dan 34 dəfə az partiya oynayıb, amma daha güclü oldu.

Arxitektura başqa oyunlarda da işləyir: Barrage Stratego-da üç dünya çempionunu məğlub edib, Hanabi-ni mənimsəyib, dou dizhu-da ən yaxşı botları üstələyib. Komandanın məqsədi daha mürəkkəb ssenarilərdir: danışıqlar, maliyyə bazarları, hərbi münaqişələr. İndi komanda Ataraxos-un anlaşılan olması və gedişləri izah edə bilməsi üzərində işləyir.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.