
Ataraxos-ը հաղթեց պատմության լավագույն Stratego խաղացողին, ուսուցմանը պահանջվեց ընդամենը 16 GPU
AI համակարգը՝ Ataraxos-ը, 20 պարտիայում 15:1 հաշվով հաղթեց բոլոր ժամանակների լավագույն Stratego խաղացող Pim Niemeijer-ին, չորս պարտիա ավարտվեց ոչ-ոքի։ Հետազոտողները այն մարզեցին ընդամենը 16 GPU-ով։
AI-ն յուրացրեց ևս մեկ դասական խաղ։ Carnegie Mellon-ի, MIT-ի, NYU-ի և Stanford-ի հետազոտողները ստեղծեցին Ataraxos-ը, որը 15:1 հաշվով հաղթեց բոլոր ժամանակների լավագույն Stratego խաղացող համարվող Pim Niemeijer-ին։ Մարզմանը պահանջվեց ընդամենը 16 GPU և մի քանի հազար դոլար. հետազոտությունը հրապարակվեց Nature-ում։
Թաքնված բանակներ
Stratego-ում յուրաքանչյուր խաղացող ունի 40 ֆիգուր՝ մարշալից մինչև լրտես, ռումբեր և դրոշ. հաղթում է նա, ով վերցնում է մրցակցի դրոշը։ Մրցակիցը տեսնում է ֆիգուրների դիրքը, բայց ոչ արժեքը. դա պարզվում է բախման ժամանակ, և թույլը լքում է տախտակը։ Այսպես Stratego-ն պոկերի նման անկատար տեղեկատվությամբ խաղ է։
Տարբերությունը մեծ է. Texas Hold'em-ում կա ընդամենը երկու թաքնված քարտ և 1326 կոմբինացիա, իսկ Stratego-ում 40 ֆիգուրը դասավորվում է դեցիլիոնից ավելի ձևերով։ Պարտիան երկար է. շախմատում՝ 40 քայլ, Stratego-ում՝ մինչև 2000։
Սրան գումարվում է բլեֆը. թույլ ֆիգուրին երբեմն շարժում են այնպես, կարծես մարշալ լինի։ Հաճախակի բլեֆը սպառնալիքներին իմաստ չի թողնում, հազվադեպը՝ քեզ կանխատեսելի դարձնում։ Այս հավասարակշռությունը չհաղթահարեցին ավելի վաղ համակարգերը, այդ թվում՝ DeepMind-ի DeepNash-ը։
Ինչպես սովորեց գուշակել
Ataraxos-ը մարզվեց ինքն իր հետ խաղալով՝ 163 միլիոն պարտիայով։ Հիմնական նորույթը մինչև քայլը մտածելն է. երկրորդ նեյրոնային ցանցը՝ belief model-ը, ըստ շարժման կանխատեսում է մրցակցի թաքնված ֆիգուրները, իսկ Ataraxos-ը բոլոր դասավորությունների փոխարեն ընտրում է մի քանի հավաստիներ և դրանցում խաղարկում թեկնածու քայլերը։
Ataraxos անունը հին հունարենից է և նշանակում է հանգստություն։ «Մարդու համար շատ դժվար է, երբ գիտես գաղտնիքը, որոշում կայացնել այնպես, կարծես չգիտես։ Մեքենայի համար դա հեշտ է»,— ասում է Farina-ն։ Համակարգը իմպուլսիվ չէ և հետ մնալը դանդաղ, մեթոդաբար հետ է բերում։
Հանդիպումը
Երեք շաբաթ Niemeijer-ը Ataraxos-ի հետ 20 պարտիա առցանց խաղաց՝ յուրաքանչյուր հաղթանակի համար ստանալով 100 դոլար. նա գիտեր, որ համակարգը չի հարմարվի իրեն, ուստի ժամանակը տրամադրեց թույլ կողմերի որոնմանը։ Սակայն հաղթեց միայն մեկ անգամ. ըստ հետազոտողների՝ դա թերություն չէ, քանի որ դասավորությունը պատահական է, և բախտը նույնպես կարևոր է։
2025 թվականի աշխարհի առաջնությունում Ataraxos-ի հետ մրցեցին նաև ներկաները. 40 պարտիայից հաղթեց 38-ը։ Խաղացողներին զարմացրեց այն, որ այն հաճախ դրոշը թաքցնում էր անկյունում՝ երկու ռումբի հետևում։
Գինը և նպատակը
Երևի Ataraxos-ի ամենամեծ ձեռքբերումը գինն է. DeepNash-ը երկու-երեք ամիս մարզում էին Google-ի 1024 չիպի վրա, ինչը 2025 թվականի գներով արժեր 3-4,5 միլիոն դոլար, իսկ Ataraxos-ին բավարարեց 16 GPU մեկ շաբաթ և belief model-ի համար չորս GPU՝ չորս օր։ Samuel Sokota-ի և Farina-ի գրած սիմուլյատորը վայրկյանում միլիոնավոր քայլեր է մշակում. Ataraxos-ը DeepNash-ի համեմատ 34 անգամ քիչ պարտիա խաղաց ու այնուամենայնիվ շատ ավելի ուժեղ էր։
Արխիտեկտուրան աշխատում է նաև այլ խաղերում. հաղթեց Barrage Stratego-ի երեք չեմպիոնների, յուրացրեց Hanabi քարտային խաղը, գերազանցեց dou dizhu-ի լավագույն բոտերին։ Թիմի նպատակը սեղանի խաղերում բարդ սցենարներն են՝ բանակցություններ, ֆինանսական շուկաներ, ռազմական կոնֆլիկտներ։ Այժմ թիմը ձգտում է, որ Ataraxos-ը բացատրի քայլերը։
SiTech — AI-ով հզորացված վեբ մշակում
Ստեղծում ենք արագ ու ժամանակակից կայքեր և AI-ը ներդնում իրական բիզնես գործընթացներում։ Ունե՞ք նախագիծ կամ հարց։ Ուրախ կլինենք օգնել։