
GPT-6 Astra, שנאי הלולאה והמחלוקת על חשיבה נסתרת
המודל החדש GPT-6 Astra של OpenAI מוביל במבחנים ובהדגמות שימוש במחשב, בעוד דיווחים על שנאים בלולאה עוררו מחלוקת בשאלה אם המודל מסתיר את שרשרת החשיבה שלו. לדברי החוקר סבסטיאן ראשקה, זהו המודל החזק ביותר שבו השתמש.
OpenAI שחררה בתחילת ספטמבר את GPT-6 Astra, וחוקר למידת המכונה סבסטיאן ראשקה, שבחן את המודל בתוך ימים, מכנה אותו החזק ביותר שבו השתמש.
בסקירה שלו עוקף Astra את קודמו GPT-5.6 כמעט בכל תחום — כתיבה, מתמטיקה ותכנות — אך הפער הגדול ביותר נרשם בהדגמות גרפיות וברינדור תלת-ממדי. במבחן ARC-AGI-3, שמשלב חידות לוגיות עם הכללה, מגיע המודל ל-99.9 אחוז, לעומת 7.8 אחוז אצל GPT-5.6 Sol.
הובלה בחזית, עם הסתייגויות
במדדים העצמאיים של Artificial Analysis התמונה מאופקת יותר: Astra נמצאת בחזית של Coding Agent Index v1.4 ושל Intelligence Index v4.2, אך אינה בורחת קדימה בפערים עצומים. מכיוון שההערכות מערבבות מעטפות הרצה שונות — Stirrup עבור GDPval-AA ו-AA-Briefcase, ו-Terminus 2 עבור Terminal-Bench v2.1 — ייתכן שמודל שכוונן סביב מעטפת אחת מרכזית דווקא מוערך בחסר.
שימוש במחשב כחזית החדשה
השיפור הבולט ביותר הוא בשימוש במחשב: המודל מפעיל תוכנות במחשב המקומי דרך אפליקציות ChatGPT ו-Codex. בין ההדגמות שנפוצו ברשת אפשר למצוא רינדור של ניו יורק ב-Blender וציור בעכבר בגרסת דפדפן של MS Paint. לפי הדיווחים רכשה OpenAI עשרות אלפי מחשבי Mac Mini ו-Mac Studio כדי לחשוף את macOS למודל בזמן למידת חיזוק: צילומי מסך נכנסים, פעולות עכבר ומקלדת יוצאות, ומעטפת הרצה מבצעת אותן ומחזירה צילומים חדשים. האימון עצמו מתבצע במקום אחר — מנכ"ל Nvidia אמר כי Astra אומנה על כ-100 אלף מעבדי Grace Blackwell. Astra נותרת מודל חשיבה שמאומן בלמידת חיזוק עם תגמולים ניתנים לאימות.
שנאים בלולאה וחשיבה נסתרת
יומיים לפני ההשקה דיווח אתר The Information כי Astra משתמשת ב"עומק רקורסיבי", כלומר בשנאי בלולאה. בתכנונים כאלה אותם בלוקים מופעלים כמה פעמים עם משקלים משותפים: Nanbeige4.2-3B מריץ 22 בלוקים פעמיים, Ouro של ByteDance חוזר על 48 בלוקים ארבע פעמים, ו-Mixture-of-Recursions מנתב כל טוקן לאחת עד שלוש מעברים. התחבולה מעלה את העומק האפקטיבי תוך אחסון פחות משקלים, אך עלות החישוב וזיכרון ה-KV נשארים קרובים לאלה של מודל רגיל באותו עומק; לפי הערכת SMELT נדרשים 6.8 עד 18 אחוז פחות חישובי אימון לאותה שגיאה.
ראשקה מטיל ספק בכך שהלולאה מסתירה את החשיבה. OpenAI מסתירה את רוב עקבות החשיבה מאז o1, ו-Astra צורכת פחות טוקנים מ-GPT-5.6 Sol באותה דיוק — דפוס שנראה גם בין מודלים קטנים יותר (Luna צורכת 80 אחוז יותר טוקנים מ-Sol בתוצאות דומות) בלי אזעקות לגבי פרשנות. כרטיס המערכת של Astra אכן מציין ירידה ביכולת הניטור לעומת Sol, בעיקר בגלל עקבות קצרות יותר. המדען הראשי של OpenAI, יאקוב פצ'וצקי, אמר שגרף החישוב של מודלי החזית נמצא בטווח של פי שניים מ-GPT-4, והזהיר מפני "מרוץ לחוסר ניטור שנגרם מדיווח מבולבל".
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.