العودة
GPT-6 Astra هو النموذج الوحيد الذي أكمل مسار DrivingBench بالمخاريط
SiTech AI Team2 წთ. საკითხავი

GPT-6 Astra هو النموذج الوحيد الذي أكمل مسار DrivingBench بالمخاريط

منحت DrivingBench أربعة نماذج متقدمة التحكم في سيارة Toyota Corolla موديل 2022 على مسار محدد بالمخاريط في موقف سيارات فارغ. النموذج الوحيد الذي أكمل المسار كاملاً كان GPT-6 Astra، بنسبة 100% خلال 5 دقائق و22 ثانية.

يهدف اختبار DrivingBench، الذي أعدّه Aditya Ramabadran وSimon Mahns وTobias Gessler، إلى الإجابة عن سؤال واحد: هل تستطيع النماذج المتقدمة قيادة سيارة حقيقية؟ رسم الفريق مساراً بالمخاريط في موقف سيارات فارغ، وسلّم سيارة Toyota Corolla موديل 2022 إلى تحكم أربعة نماذج. ولم يكمل المسار كاملاً سوى GPT-6 Astra.

كيف يقود النموذج السيارة

تحمل السيارة جهاز comma four متصلاً بناقل CAN عبر كابل OBD-C. النماذج لا تجلس خلف المقود، بل تستدعي ثلاثة أدوات MCP من بيئات المحادثة المعتادة لديها (Codex وClaude Code وCursor): observe() وset_motion() وstop_now(). تستقبل set_motion() اتجاهاً ونسبة توجيه من 0 إلى 100 وسرعة بالمتر في الثانية ومدة. الأمر الجديد يستبدل السابق بدلاً من أن يصطف في طابور، وتواصل السيارة السير أثناء تفكير النموذج.

تخضع كل محاولة لإشراف بشري: يجلس مشغّل في مقعد السائق وقد وضع قدمه فوق دواسة المكابح. ويحدّ البرنامج السرعة بين 0,5 و3,5 متر في الثانية (1–8 ميل في الساعة)، وعند تجاوز 6 أمتار في الثانية يعمل توقف طارئ يلغي الحركة.

مسار الاختبار في موقف السيارات الفارغ

جدول النتائج

حصل كل نموذج على ما يصل إلى ثلاث محاولات في محادثة واحدة متواصلة، مع طلب تحليل أخطائه بين المحاولات. تُقاس نسبة التقدم بمسافة السير على الخط المركزي للمسار مع البقاء ضمن أربعة أمتار منه، وعند الاصطدام يُحتسب فقط ما تحقق من تقدم قبله.

أكمل GPT-6 Astra (Codex، medium) المسار في محاولته الثانية: 100% خلال 5 دقائق و22 ثانية وبـ24 أمراً. وانتهت محاولته الأولى عند 49%. وبلغ Claude Fable 5.1 (Claude Code) نسبة 45% في محاولته الثالثة، وGrok 4.6 (Cursor) نسبة 11%، وGPT-5.6 Sol (Codex) نسبة 6%. وتوقفت بقية المحاولات قبل المنعطف الأول.

ما تكشفه المحاولات

معظم الإخفاقات كانت مرتبطة بالإدراك لا بالميكانيكا: أخطأت النماذج في تحديد الجانب الصحيح لخط المخاريط القطري الأول. وكان Astra يراقب كل خمس أو ست ثوانٍ تقريباً؛ وفي المحاولة الناجحة لم يتجاوز 0,8 متر في الثانية وطلب التوجيه الكامل في 20 من أصل 24 أمراً.

يرصد التقرير أيضاً مؤشرات على التعلم من السياق: فقد غيّر Astra وFable 5.1 تفضيلاتهما في التوجيه والسرعة بعد تحليل أخطائهما.

ما يثبته هذا وما لا يثبته

هذا مسار اختبار ثابت في موقف فارغ، وليس قيادة ذاتية على الطرق العامة. ويعدد المؤلفون حدود العمل: خضع كل نموذج للتقييم مرة واحدة، والمحاولات الثلاث تتشارك السياق نفسه فهي ليست مستقلة. ويلاحظون أيضاً أن بعض النماذج رفضت القيادة لأسباب أمنية حتى تغيّر اسم خادم MCP. وDrivingBench غير مرتبط بـcomma.ai أو openpilot أو Toyota. وخاتمة الفريق متحفظة: صارت النماذج قادرة على قيادة سيارة حقيقية بسرعات منخفضة، لكن النتيجة تستدعي مزيداً من العمل في الأمان والتقييم.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.