
GPT-6 Astra היא המודל היחיד שהשלים את מסלול הקונוסים של DrivingBench
DrivingBench העבירה לשליטה של ארבעה מודלים מתקדמים מכונית Toyota Corolla משנת 2022 במסלול קונוסים בחניון ריק. רק GPT-6 Astra השלימה את המסלול כולו — 100% ב-5 דקות ו-22 שניות.
DrivingBench, בנצ'מרק שנבנה על ידי Aditya Ramabadran, Simon Mahns ו-Tobias Gessler, בוחן שאלה אחת: האם מודלים מתקדמים מסוגלים לנהוג במכונית אמיתית? החוקרים פרסו מסלול קונוסים בחניון ריק ומסרו לשליטה של ארבעה מודלים מכונית Toyota Corolla משנת 2022. המסלול כולו הושלם רק על ידי GPT-6 Astra.
איך המודל נוהג במכונית
ברכב מותקן מכשיר comma four המחובר לאפיק ה-CAN באמצעות כבל OBD-C. המודלים לא יושבים מאחורי ההגה — הם קוראים לשלושה כלי MCP מתוך סביבות הצ'אט הרגילות שלהם (Codex, Claude Code, Cursor): observe(), set_motion() ו-stop_now(). הקריאה set_motion() מקבלת כיוון, אחוז היגוי מ-0 עד 100, מהירות במטרים לשנייה ומשך פעולה. פקודה חדשה מחליפה את הקודמת במקום להצטבר בתור, והמכונית ממשיכה לנוע בזמן שהמודל חושב.
כל ניסיון מלווה במפעיל אנושי שיושב במושב הנהג עם רגל מוכנה מעל דוושת הבלם. התוכנה מגבילה את המהירות ל-0.5–3.5 מטרים לשנייה (1–8 מייל לשעה), ומעל 6 מטרים לשנייה מופעל עצירת חירום שמבטל את התנועה.
טבלת התוצאות
לכל מודל עמדו עד שלושה ניסיונות בצ'אט רציף אחד, עם בקשה לחשבון נפש בין הניסיונות. ההתקדמות נמדדת לפי המרחק לאורך קו המרכז של המסלול כל עוד המכונית נשארת בטווח ארבעה מטרים ממנו; התנגשות שומרת רק על ההתקדמות שהושגה לפניה.
GPT-6 Astra (Codex, medium) סיימה בניסיון השני: 100% מהמסלול ב-5 דקות ו-22 שניות, ב-24 פקודות. הניסיון הראשון שלה הסתיים ב-49%. Claude Fable 5.1 (Claude Code) הגיעה לשיא של 45% בניסיון השלישי, Grok 4.6 (Cursor) ל-11%, ו-GPT-5.6 Sol (Codex) ל-6%. כל שאר הניסיונות נעצרו לפני הפנייה הראשונה.
מה עולה מהניסיונות
רוב הכישלונות נבעו מתפיסה ולא ממכניקה: המודלים טעו בזיהוי הצד הנכון של קו הקונוסים האלכסוני הראשון. Astra צפתה בערך כל חמש עד שש שניות; בניסיון המוצלח היא לא עברה 0.8 מטרים לשנייה וביקשה היגוי מלא ב-20 מתוך 24 פקודות.
הדוח מתאר גם למידה מתוך ההקשר: Astra ו-Fable 5.1 שינו את דפוסי ההיגוי והמהירות לאחר שהרהרו בטעויותיהן.
מה זה מוכיח — ומה לא
מדובר במסלול מבחן קבוע בחניון ריק, לא בנהיגה אוטונומית בכבישים. המחברים מציינים מגבלות: כל מודל נבחן פעם אחת בלבד, ושלושת הניסיונות חולקים הקשר אחד ולכן אינם בלתי תלויים. הם גם מציינים שחלק מהמודלים סירבו לנהוג מטעמי בטיחות עד ששם שרת ה-MCP שונה. DrivingBench אינו קשור ל-comma.ai, ל-openpilot או ל-Toyota. המסקנה מאופקת: המודלים כבר מסוגלים לנהוג במכונית אמיתית במהירות נמוכה, אך התוצאה מחייבת עבודה נוספת בתחומי הבטיחות וההערכה.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.