უკან დაბრუნება
Ataraxos-მა ისტორიაში საუკეთესო Stratego-ს მოთამაშე დაამარცხა, სწავლებას მხოლოდ 16 GPU დასჭირდა
SiTech AI Team2 წთ. საკითხავი

Ataraxos-მა ისტორიაში საუკეთესო Stratego-ს მოთამაშე დაამარცხა, სწავლებას მხოლოდ 16 GPU დასჭირდა

AI სისტემამ Ataraxos-მა ყველა დროის საუკეთესო Stratego-ს მოთამაშედ მიჩნეული Pim Niemeijer 20 პარტიაში 15:1 დაამარცხა, ოთხი პარტია კი ფრედ დასრულდა. Carnegie Mellon-იდან, MIT-იდან, NYU-იდან და Stanford-იდან მკვლევრებმა სისტემა მხოლოდ 16 GPU-ზე გაწვრთნეს.

AI-მ კიდევ ერთი კლასიკური თამაში აითვისა. Carnegie Mellon-იდან, MIT-იდან, NYU-იდან და Stanford-იდან მკვლევრებმა შექმნეს Ataraxos, რომელმაც ყველა დროის საუკეთესო Stratego-ს მოთამაშედ მიჩნეული Pim Niemeijer 15:1 დაამარცხა. გაწვრთნას მხოლოდ 16 GPU და რამდენიმე ათასი დოლარი დასჭირდა; კვლევა ჟურნალ Nature-ში გამოქვეყნდა.

ფარული არმიები

Stratego-ში თითო მოთამაშეს 40 ფიგურა აქვს: სამხედრო ჩინები მარშლიდან ჯაშუშამდე, ასევე ბომბები და დროშა; იმარჯვებს ის, ვინც მეტოქის დროშას აიღებს. მეტოქე ხედავს, სად დგას ფიგურები, მაგრამ არა, რომელი რა არის; ეს შეტაკებისას ირკვევა: სუსტი ტოვებს დაფას. ამიტომ Stratego პოკერის მსგავსი არასრულყოფილი ინფორმაციის თამაშია.

სხვაობა მასშტაბურია: Texas Hold'em-ში მხოლოდ ორი ფარული კარტი და 1326 კომბინაციაა, Stratego-ში კი 40 ფიგურა ნებისმიერი თანმიმდევრობით დგება: დეცილიონზე მეტი განლაგება. პარტია გრძელია: ჭადრაკში 40 სვლა, Stratego-ში 2000 სვლამდე.

ამას ბლეფიც ემატება: სუსტ ფიგურას ზოგჯერ ისე მოძრაობენ, თითქოს მარშალი იყოს. ხშირი ბლეფით საფრთხეები აზრს კარგავს, იშვიათით კი პროგნოზირებადი ხდები. ამ ბალანსთან ვერ გაართვეს თავი ადრინდელმა სისტემებმა, მათ შორის DeepMind-ის DeepNash-მა.

როგორ ისწავლა გამოცნობა

Ataraxos საკუთარ თავთან თამაშით გაწვრთნეს, 163 მილიონი პარტიით. მთავარი სიახლე სვლამდე ფიქრია: მეორე ნეირონული ქსელი, ე.წ. belief model, მეტოქის ფარულ ფიგურებს მოძრაობის მიხედვით გამოიცნობს, Ataraxos კი ყველა განლაგების ნაცვლად რამდენიმე დამაჯერებელს ირჩევს და მათში კანდიდატ სვლებს ათამაშებს.

სახელი Ataraxos ძველბერძნული სიტყვიდან მომდინარეობს და სიმშვიდეს ნიშნავს. „ადამიანისთვის ძალიან ძნელია, როცა საიდუმლო იცი, გადაწყვეტილება ისე მიიღო, თითქოს არ იცი. მანქანისთვის ეს მარტივია“, ამბობს Farina. სისტემა იმპულსურად არ მოქმედებს და ჩამორჩენას ნელა, მეთოდურად აბრუნებს.

მატჩი

სამი კვირის განმავლობაში Niemeijer-მა Ataraxos-თან 20 პარტია ონლაინ ითამაშა, ყოველ მოგებაზე 100 დოლარი იღებდა; იცოდა, რომ სისტემა მას არ მოერგებოდა, ამიტომ დრო სისუსტეების ძიებას დაუთმო. თუმცა მხოლოდ ერთხელ მოიგო: მკვლევრების თქმით, წაგება ხარვეზი არ არის, რადგან განლაგება შემთხვევითად შეირჩევა და იღბალიც მნიშვნელოვანია.

2025 წლის მსოფლიო ჩემპიონატზე Ataraxos-ს დამსწრეებიც შეეჯიბრნენ: 40 პარტიიდან 38 მოიგო. მოთამაშეები გააკვირვა იმან, რომ დროშას ხშირად კუთხეში, ორი ბომბის მიღმა მალავდა.

ფასი და მიზანი

შესაძლოა, Ataraxos-ის ყველაზე დიდი მიღწევა ფასია: DeepNash ორ-სამ თვეს Google-ის 1024 სპეციალიზებულ ჩიპზე წვრთნიდნენ, რაც 2025 წლის ფასებით 3-4,5 მილიონი დოლარი ღირდა, Ataraxos-ს კი 16 GPU ერთი კვირით და belief model-ისთვის დამატებით ოთხი GPU ოთხი დღით დასჭირდა. Samuel Sokota-ს და Farina-ს დაწერილი სიმულატორი წამში მილიონობით სვლას ამუშავებს; Ataraxos-მა DeepNash-ზე 34-ჯერ ნაკლები პარტია ითამაშა და მაინც ბევრად ძლიერი აღმოჩნდა.

არქიტექტურა სხვა თამაშებზეც მუშაობს: დაამარცხა სამი მსოფლიო ჩემპიონი Barrage Stratego-ში, აითვისა კოოპერატიული კარტული თამაში Hanabi, აჯობა საუკეთესო ბოტებს ჩინურ კარტულ თამაშ dou dizhu-ში. გუნდის მიზანი სამაგიდო თამაშებზე რთული სცენარებია: მოლაპარაკებები, ფინანსური ბაზრები, სამხედრო კონფლიქტები. ახლა გუნდი მუშაობს, რომ Ataraxos გასაგები გახდეს და სვლები ახსნას შეძლოს.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.