
Ataraxos, tarihin en iyi Stratego oyuncusunu yendi; eğitimi için yalnızca 16 GPU yetti
AI sistemi Ataraxos, tüm zamanların en iyi Stratego oyuncusu sayılan Pim Niemeijer'i 20 partide 15:1 yendi; dört parti berabere bitti. Carnegie Mellon, MIT, NYU ve Stanford'dan araştırmacılar sistemi yalnızca 16 GPU'da eğitti.
AI bir klasik oyunu daha öğrendi. Carnegie Mellon, MIT, NYU ve Stanford'dan araştırmacılar, tüm zamanların en iyi Stratego oyuncusu sayılan Pim Niemeijer'i 15:1 yenen Ataraxos'u geliştirdi. Eğitimi yalnızca 16 GPU ve birkaç bin dolara mal oldu; araştırma Nature'da yayımlandı.
Gizli ordular
Stratego'da her oyuncunun 40 taşı vardır: Mareşal'den Casus'a kadar askeri rütbeler, ayrıca bombalar ve bir bayrak; rakibin bayrağını alan kazanır. Rakip taşların nerede olduğunu görür ama hangisinin ne olduğunu bilmez; bu çarpışmada ortaya çıkar: zayıf olan tahtadan çıkar. Bu nedenle Stratego, poker benzeri eksik bilgi oyunudur.
Fark büyük: Texas Hold'em'de yalnızca iki gizli kart ve 1326 kombinasyon vardır; Stratego'da ise 40 taş herhangi bir sırayla dizilir: desilyondan fazla dizilim. Parti uzundur: satrançta 40 hamle, Stratego'da 2000 hamleye kadar.
Buna blöf eklenir: bazen zayıf bir taş, sanki Mareşalmiş gibi oynatılır. Sık blöf tehditleri anlamsızlaştırır, seyrek blöf ise öngörülebilir kılar. Önceki sistemler, aralarında DeepMind'ın DeepNash'i de olmak üzere, bu dengeyi kuramadı.
Nasıl tahmin etmeyi öğrendi
Ataraxos, kendine karşı oynayarak 163 milyon partiyle eğitildi. Ana yenilik hamleden önce düşünmedir: belief model adı verilen ikinci bir sinir ağı, rakibin gizli taşlarını hareketlere göre tahmin eder; Ataraxos ise tüm dizilimler yerine birkaç makul olanı seçip aday hamleleri oynar.
Ataraxos adı, "huzur" anlamına gelen Antik Yunanca sözcükten gelir. "Bir sırrı bilirken, bilmiyormuş gibi karar vermek insan için çok zordur. Makine için bu kolaydır" diyor Farina. Sistem dürtüsel davranmaz; geri kalmışlığı yavaşça, yöntemli biçimde geri çevirir.
Maç
Üç hafta boyunca Niemeijer, Ataraxos'a karşı 20 parti çevrimiçi oynadı; her galibiyete 100 dolar alıyordu; sistemin uyum sağlamayacağını biliyordu, bu yüzden zayıflıkları aramaya zaman ayırdı. Ancak yalnızca bir kez kazandı: araştırmacılara göre bu yenilgi bir kusur değil, çünkü dizilim rastgele seçiliyor ve şans da önemli.
2025 Dünya Şampiyonası'nda Ataraxos'a oradaki izleyiciler de meydan okudu: 40 partiden 38'ini kazandı. Oyuncuları şaşırtan şey, bayrağını sık sık köşede, iki bombanın arkasına saklamasıydı.
Maliyet ve amaç
Ataraxos'un en büyük başarısı belki de maliyetidir: DeepNash iki-üç ay Google'ın 1024 özel çipinde eğitildi ve 2025 fiyatlarıyla 3-4,5 milyon dolara mal oldu; Ataraxos içinse 16 GPU bir hafta ve belief model için ek dört GPU dört gün yeterliydi. Samuel Sokota ve Farina'nın yazdığı simülatör saniyede milyonlarca hamleyi işler; Ataraxos, DeepNash'ten 34 kat az parti oynadı ve yine de çok daha güçlü çıktı.
Mimari başka oyunlarda da işliyor: Barrage Stratego'da üç dünya şampiyonunu yendi, işbirlikçi kart oyunu Hanabi'yi öğrendi, Çin kart oyunu dou dizhu'da en iyi botları geçti. Ekibin hedefi masa oyunlarından daha karmaşık senaryolar: müzakereler, finansal piyasalar, askeri çatışmalar. Şimdi ekip, Ataraxos'un anlaşılır olup hamlelerini açıklaması için çalışıyor.
SiTech — AI destekli web geliştirme
Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.