Geri Dön
GPT-6 Astra, DrivingBench parkurunu tamamlayan tek model oldu
SiTech AI Team2 წთ. საკითხავი

GPT-6 Astra, DrivingBench parkurunu tamamlayan tek model oldu

DrivingBench, dört öncü modele boş bir otoparkta konilerle çizilmiş parkurda 2022 model Toyota Corolla'yı sürme kontrolü verdi. Rotayı baştan sona tamamlayan tek model GPT-6 Astra oldu: 5 dakika 22 saniyede %100.

Aditya Ramabadran, Simon Mahns ve Tobias Gessler'in hazırladığı DrivingBench, basit bir soruyu yanıtlamayı amaçlıyor: öncü dil modelleri gerçek bir otomobili sürebilir mi? Ekip, boş bir otoparkta konilerle parkur kurdu ve 2022 model Toyota Corolla'yı dört modelin kontrolüne verdi. Rotanın tamamını yalnızca GPT-6 Astra tamamladı.

Model aracı nasıl sürüyor

Araçta OBD-C kablosuyla CAN veri yoluna bağlanan bir comma four cihazı var. Modeller direksiyon başında değil; Codex, Claude Code ve Cursor gibi alıştıkları sohbet ortamlarından üç MCP aracını çağırıyorlar: observe(), set_motion() ve stop_now(). set_motion() yön, yüzde 0-100 arası direksiyon oranı, hız ve süre alıyor. Yeni komut kuyruğa girmek yerine öncekini değiştiriyor; model düşünürken araç hareket etmeye devam ediyor.

Her denemede operatör sürücü koltuğunda, ayağı fren pedalının üzerinde oturuyor. Yazılım hızı 0,5–3,5 m/s (1–8 mph) ile sınırlıyor; 6 m/s'nin üzerinde hareketi iptal eden acil durdurma devreye giriyor.

DrivingBench'in boş otoparktaki test parkuru

Sıralama tablosu

Her modelin tek bir kesintisiz sohbette en fazla üç deneme hakkı vardı; denemeler arasında hatalarını değerlendirmesi istendi. İlerleme, araç parkur merkez çizgisinden dört metreden fazla uzaklaşmadan çizgi boyunca ne kadar ilerlediğiyle ölçülüyor; çarpışmada yalnızca öncesindeki ilerleme sayılıyor.

GPT-6 Astra (Codex, medium) ikinci denemesinde bitişe ulaştı: parkurun %100'ünü 24 komutla 5 dakika 22 saniyede. İlk denemesi %49'da sona erdi. Claude Fable 5.1 (Claude Code) üçüncü denemesinde en fazla %45'e, Grok 4.6 (Cursor) %11'e, GPT-5.6 Sol (Codex) ise %6'ya ulaştı. Diğer tüm denemeler ilk virajdan önce durdu.

Denemelerin gösterdikleri

Başarısızlıkların çoğu algısaldı: modeller ilk çapraz koni hattının hangi tarafında olduklarını karıştırdı. Astra yaklaşık beş-altı saniyede bir gözlem yapıp dakikada altı komut gönderdi; başarılı denemede 0,8 m/s'yi aşmadı ve 24 komutun 20'sinde tam direksiyon istedi.

Rapor, bağlam içi öğrenmenin de izlerini aktarıyor: Astra ve Fable 5.1 hatalarını değerlendirdikten sonra direksiyon ve hız tercihlerini değiştirdi.

Ne gösteriyor, ne göstermiyor

Bu, boş bir otoparktaki sabit bir test parkuru; gerçek yollarda otonom sürüş değil. Yazarlar sınırlamaları kendileri sıralıyor: her model bir kez değerlendirildi ve üç deneme aynı bağlamı paylaştığı için bağımsız sayılmaz. Ayrıca bazı modellerin güvenlik gerekçesiyle MCP sunucusunun adı değişene kadar sürmeyi reddettiğini belirtiyorlar. DrivingBench'in comma.ai, openpilot veya Toyota ile bir bağlantısı yok. Ekibin sonucu ölçülü: modeller artık düşük hızda gerçek bir aracı sürebiliyor, ancak bu güvenlik ve değerlendirme üzerine daha fazla çalışma gerektiriyor.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.