חזרה
Ataraxos ניצח את שחקן Stratego הטוב בהיסטוריה, והאימון דרש רק 16 GPU
SiTech AI Team3 דק׳ קריאה

Ataraxos ניצח את שחקן Stratego הטוב בהיסטוריה, והאימון דרש רק 16 GPU

מערכת ה-AI Ataraxos ניצחה את Pim Niemeijer, הנחשב לשחקן Stratego הטוב בכל הזמנים, בתוצאה 15:1 ב-20 משחקים, וארבעה משחקים הסתיימו בתיקו. חוקרים מ-Carnegie Mellon, MIT, NYU ו-Stanford אימנו את המערכת על 16 GPU בלבד.

ה-AI כבש עוד משחק קלאסי. חוקרים מ-Carnegie Mellon, MIT, NYU ו-Stanford יצרו את Ataraxos, שניצח 15:1 את Pim Niemeijer, הנחשב לשחקן Stratego הטוב בכל הזמנים. האימון דרש רק 16 GPU וכמה אלפי דולרים; המחקר פורסם בכתב העת Nature.

צבאות נסתרים

ב-Stratego לכל שחקן יש 40 כלים: דרגות צבאיות מהמרשל ועד המרגל, וכן פצצות ודגל; מי שלוקח את דגל היריב מנצח. היריב רואה היכן נמצאים הכלים, אך לא מה כל אחד מהם; זה מתברר בעת התנגשות: החלש יורד מהלוח. לכן Stratego הוא משחק מידע לא מלא, בדומה לפוקר.

ההבדל עצום: ב-Texas Hold'em יש רק שני קלפים נסתרים ו-1326 צירופים, בעוד שב-Stratego מסדרים 40 כלים בכל סדר אפשרי: יותר מדציליון מערכים. המשחק ארוך: בשחמט 40 מהלכים, וב-Stratego עד 2000 מהלכים.

לכך מצטרף גם בלוף: לפעמים מזיזים כלי חלש כאילו היה המרשל. עם בלוף תדיר האיומים מאבדים משמעות, ועם בלוף נדיר הופכים לצפויים. מערכות קודמות לא הצליחו לאזן זאת, כולל DeepNash של DeepMind.

איך למד לנחש

את Ataraxos אימנו באמצעות משחק נגד עצמו, עם 163 מיליון משחקים. החידוש המרכזי הוא חשיבה לפני מהלך: רשת נוירונים שנייה, מה שנקרא belief model, מנחשת את כלי היריב הנסתרים לפי התנועה, בעוד Ataraxos בוחר, במקום כל המערכים, כמה מערכים סבירים ומשחק בהם מהלכים מועמדים.

השם Ataraxos נובע ממילה יוונית עתיקה ומשמעותו שלווה. „לאדם קשה מאוד, כשהוא יודע סוד, לקבל החלטה כאילו אינו יודע. עבור מכונה זה פשוט“, אומר Farina. המערכת אינה פועלת באימפולסיביות ומחזירה את הפיגור לאט ובאופן שיטתי.

ההתמודדות

במשך שלושה שבועות שיחק Niemeijer נגד Ataraxos 20 משחקים אונליין, וקיבל 100 דולר על כל ניצחון; הוא ידע שהמערכת לא תתאים את עצמה אליו, ולכן הקדיש זמן לחיפוש חולשות. עם זאת, הוא ניצח רק פעם אחת: לפי החוקרים, ההפסד אינו תקלה, כי המערך נבחר באקראי וגם המזל חשוב.

באליפות העולם של 2025 גם הנוכחים התמודדו מול Ataraxos: הוא ניצח ב-38 מתוך 40 משחקים. השחקנים הופתעו מכך שהוא לעיתים קרובות הסתיר את הדגל בפינה, מאחורי שתי פצצות.

המחיר והמטרה

אולי ההישג הגדול ביותר של Ataraxos הוא המחיר: את DeepNash אימנו במשך שניים-שלושה חודשים על 1024 שבבים ייעודיים של Google, מה שבמחירי 2025 עלה 3-4,5 מיליון דולר, בעוד Ataraxos דרש 16 GPU לשבוע וארבעה GPU נוספים לארבעה ימים עבור belief model. הסימולטור שכתבו Samuel Sokota ו-Farina מעבד מיליוני מהלכים בשנייה; Ataraxos שיחק פי 34 פחות משחקים מ-DeepNash ובכל זאת התגלה כחזק בהרבה.

הארכיטקטורה עובדת גם במשחקים אחרים: היא ניצחה שלושה אלופי עולם ב-Barrage Stratego, למדה את משחק הקלפים השיתופי Hanabi, וגברה על הבוטים הטובים ביותר במשחק הקלפים הסיני dou dizhu. מטרת הצוות היא תרחישים מורכבים במשחקי לוח: משא ומתן, שווקים פיננסיים, סכסוכים צבאיים. כעת הצוות עובד כך ש-Ataraxos יהיה מובן ויוכל להסביר מהלכים.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.