
Ataraxos يهزم أفضل لاعب Stratego في التاريخ، وتدريبه احتاج 16 GPU فقط
هزم نظام الذكاء الاصطناعي Ataraxos أفضل لاعب Stratego في التاريخ Pim Niemeijer بنتيجة 15:1 في 20 مباراة، وتعادل في أربع منها. درّبه باحثون من Carnegie Mellon وMIT وNYU وStanford على 16 GPU فقط.
أتقن الذكاء الاصطناعي لعبة كلاسيكية أخرى. أنشأ باحثون من Carnegie Mellon وMIT وNYU وStanford نظام Ataraxos، الذي هزم Pim Niemeijer، اللاعب الذي يُعد أفضل لاعب Stratego في التاريخ، بنتيجة 15:1. احتاج تدريبه إلى 16 GPU فقط وبضعة آلاف من الدولارات؛ ونُشر البحث في مجلة Nature.
الجيوش الخفية
في Stratego يملك كل لاعب 40 قطعة: رتب عسكرية من المارشال إلى الجاسوس، إضافة إلى القنابل والعلم؛ ويفوز من يلتقط علم الخصم. يرى الخصم أين تقف القطع، لكن لا يرى ما هي كل قطعة؛ ويتضح ذلك عند الاشتباك: القطعة الأضعف تُزال من اللوح. لذلك فإن Stratego لعبة معلومات غير كاملة تشبه البوكر.
الفرق هائل: في Texas Hold'em هناك ورقتان مخفيتان فقط و1326 تركيبة، أما في Stratego فتوضع 40 قطعة بأي ترتيب: أكثر من دسيليون توزيع. والمباراة طويلة: في الشطرنج 40 نقلة، وفي Stratego تصل إلى 2000 نقلة.
ويُضاف إلى ذلك الخداع: فتُحرّك قطعة ضعيفة أحيانًا كما لو كانت المارشال. مع الخداع المتكرر تفقد التهديدات معناها، ومع الخداع النادر تصبح متوقعًا. لم تتعامل الأنظمة السابقة مع هذه الموازنة، ومن بينها DeepNash من DeepMind.
كيف تعلم التخمين
دُرّب Ataraxos باللعب ضد نفسه، عبر 163 مليون مباراة. الابتكار الرئيسي هو التفكير قبل النقلة: شبكة عصبية ثانية، تُسمى belief model، تخمّن القطع المخفية للخصم بناءً على حركاته، بينما يختار Ataraxos بضع فرضيات معقولة بدلًا من كل التوزيعات، ويلعب نقلات مرشحة ضمنها.
اسم Ataraxos مشتق من كلمة يونانية قديمة ويعني الهدوء. «من الصعب جدًا على الإنسان، حين يعرف سرًا، أن يتخذ قرارًا كأنه لا يعرفه. أما الآلة فهذا سهل لها»، يقول Farina. لا يتصرف النظام باندفاع، بل يعيد التقدم المتأخر ببطء ومنهجية.
المباراة
على مدى ثلاثة أسابيع لعب Niemeijer 20 مباراة عبر الإنترنت ضد Ataraxos، وكان يتقاضى 100 دولار عن كل فوز؛ وكان يعرف أن النظام لن يتكيف معه، لذلك كرّس الوقت للبحث عن نقاط ضعفه. لكنه فاز مرة واحدة فقط: يقول الباحثون إن الخسارة ليست خللًا، لأن التوزيع يُختار عشوائيًا وللحظ أيضًا دور مهم.
وفي بطولة العالم لعام 2025 نافس الحاضرون أيضًا Ataraxos: فاز في 38 من أصل 40 مباراة. وقد أدهش اللاعبين أنه كثيرًا ما كان يخفي العلم في الزاوية، خلف قنبلتين.
التكلفة والهدف
ربما يكون أكبر إنجاز لـ Ataraxos هو التكلفة: فقد دُرّب DeepNash على مدى شهرين إلى ثلاثة أشهر على 1024 شريحة متخصصة من Google، ما كان يكلّف 3-4,5 ملايين دولار بأسعار 2025، أما Ataraxos فاحتاج إلى 16 GPU لمدة أسبوع وإلى أربع GPU إضافية لمدة أربعة أيام من أجل belief model. المحاكي الذي كتبه Samuel Sokota وFarina يعالج ملايين النقلات في الثانية؛ لعب Ataraxos مباريات أقل بـ 34 مرة من DeepNash، ومع ذلك كان أقوى بكثير.
تعمل البنية أيضًا على ألعاب أخرى: هزم ثلاثة أبطال عالميين في Barrage Stratego، وأتقن لعبة الورق التعاونية Hanabi، وتفوق على أفضل البوتات في لعبة الورق الصينية dou dizhu. هدف الفريق هو سيناريوهات معقدة قائمة على ألعاب الطاولة: المفاوضات، والأسواق المالية، والنزاعات العسكرية. ويعمل الفريق الآن على جعل Ataraxos مفهومًا وقادرًا على شرح نقلاته.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.