חזרה
44% ב-ARC-AGI-1 תמורת 67 סנט: טרנספורמר קטן שאומן בשעה וחצי
SiTech AI Team2 წთ. საკითხავი

44% ב-ARC-AGI-1 תמורת 67 סנט: טרנספורמר קטן שאומן בשעה וחצי

מיתיל ואקדה אימן מאפס טרנספורמר קטן על כרטיס RTX 5090 אחד בכשעה וחצי, והוא משיג 44% במערך ההערכה הציבורי של ARC-AGI-1 ו-7% ב-ARC-AGI-2. העלות הכוללת של החישוב — 67 סנט.

החוקר מיתיל ואקדה פרסם פוסט שלישי בסדרה שלו על ARC-AGI. הפעם הוא אימן מאפס טרנספורמר קטן שמשיג 44% במערך ההערכה הציבורי של ARC-AGI-1 ו-7% ב-ARC-AGI-2. לדברי המחבר, עלות החישוב הכוללת לאורך כל מחזור החיים — אימון מהאתחול ועד ההסקה על כל המשימות — הסתכמה ב-67 סנט.

האימון אורך כשעה וחצי על כרטיס מסך אחד מדגם RTX 5090, והתוצאה משתווה לציונים המדווחים של TRM ו-HRM — המודלים שמולם הוא משווה כעת. ואקדה מדגיש שהוא משווה רק לגישות שמשתמשות באימון דומה בזמן הבדיקה. הקוד פתוח.

איך זה עובד

כל זוג קלט-פלט בחידה מומר לרצף טוקנים, וטרנספורמר קטן מתאמן על הרצפים האלה באופן אוטורגרסיבי מאפס, כבר בזמן הבדיקה — על חידות הבנצ'מרק, כאשר תשובות הבדיקה מוסתרות. כדי לאפשר למידה חוצת-משימות כל חידה מקבלת אמבדינג אדיטיבי משלה, והמידע המיקומי מעובד באמצעות אמבדינג 3D RoPE, משום שכל רצף מכיל שני לוחות דו-ממדיים.

נתוני האימון מועשרים בתמורות צבע ותמורות דיהדרליות. בזמן ההסקה גם קלטי הבדיקה עוברים העשרה, על הפלטים שנוצרו מוחלת הטרנספורמציה ההפוכה, ובסוף מוגשות שתי התשובות הנפוצות ביותר.

מה השתנה לעומת הגרסה הקודמת

הזינוק הגדול ביותר בציון נבע מארכיטקטורה מודרנית — SwiGLU במקום GELU ו-RMSNorm במקום LayerNorm — מערבוב טוב יותר של נתונים מגוונים יותר, והגדלה מארבע לשמונה שכבות. הירידה בעלויות נבעה מהרבה פחות אוגמנטציות, ממעבר האופטימייזר מ-AdamW בלבד ל-NorMuon עם AdamW משני, וממעבר ל-flash attention על רצפים ארוזים באורך משתנה.

למה זה חשוב

ואקדה מציג את היעילות בסמפלינג כבעיה הפתוחה החשובה ביותר בבינה מלאכותית, ואת ARC כזירה נוחה לבדוק אותה: כאלף חידות, לכל אחת חוק משל עצמה, ודרישות מינימליות של ידע מוקדם. מטרתו המוצהרת היא למצוא את גבולות השיטות העכשוויות ולשמור על איטרציה זולה מספיק כדי שכל אחד יוכל לעבוד על הבעיה.

ניתוח אבלציות הראה שחלק ניכר מהביצועים נשמר גם בלי אוגמנטציות ובלי נתונים סינתטיים, ושילוב המשימות שנפתרו בכמה ריצות מגיע ל-55%. המחבר סבור כעת ש-65% נמצאים בהישג יד בתוך מסגרת הטרנספורמר הרגילה, ושהורדה של פי עשרה נוסף בעלויות אפשרית עם קרנלים שנכתבו ידנית ל-GPU.

SSiTech

SiTech — פיתוח אתרים בכוח ה-AI

אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.