
GPT-6 Astra DrivingBench trasını tamamlayan yeganə model oldu
DrivingBench dörd aparıcı modelə boş dayanacaqda konuslarla düzəldilmiş trasda 2022-ci il Toyota Corolla-nın idarəetməsini verdi. Marşrutu tam başa vuran yeganə model GPT-6 Astra oldu: 5 dəqiqə 22 saniyədə 100%.
Aditya Ramabadran, Simon Mahns və Tobias Gessler tərəfindən hazırlanan DrivingBench sadə bir suala cavab axtarır: aparıcı dil modelləri real avtomobili idarə edə bilirmi? Komanda boş dayanacaqda konuslarla tras düzəltdi və 2022-ci il Toyota Corolla-nı dörd modelin idarəsinə verdi. Marşrutu bütövlükdə yalnız GPT-6 Astra başa vurdu.
Model avtomobili necə idarə edir
Avtomobildə OBD-C kabeli ilə CAN şinə qoşulan comma four cihazı quraşdırılıb. Modellər sükan arxasında oturmur — onlar adi söhbət mühitlərindən (Codex, Claude Code, Cursor) üç MCP alətini çağırır: observe(), set_motion() və stop_now(). set_motion() istiqamət, sükanın 0-100 faizi, sürət və müddət qəbul edir. Yeni əmr növbəyə durmur, əvvəlkini əvəz edir və model düşündüyü müddətdə avtomobil hərəkətini davam etdirir.
Hər cəhddə operator sürücü oturacağında, ayağı əyləc pedalının üzərində oturur. Proqram sürəti 0,5–3,5 m/s (1–8 mil/saat) ilə məhdudlaşdırır, 6 m/s-dən yuxarı sürətdə isə təcili dayanma hərəkəti ləğv edir.
Nəticə cədvəli
Hər modelin bir söhbətdə üç cədhə haqqı var idi; cəhdlər arasında ondan səhvlərini dəyərləndirməsi istənilirdi. Tərəqqi avtomobilin trasın mərkəz xətti boyunca nə qədər irəlilədiyi ilə ölçülür; toqquşmada yalnız toqquşmadan əvvəl qət edilən məsafə sayılır.
GPT-6 Astra (Codex, medium) ikinci cəhdində finişə çatdı: trasın 100%-i 24 əmrlə 5 dəqiqə 22 saniyədə. Birinci cəhdi 49%-də dayandı. Claude Fable 5.1 (Claude Code) üçüncü cəhdində ən çoxu 45%-ə, Grok 4.6 (Cursor) 11%-ə, GPT-5.6 Sol (Codex) isə 6%-ə çatdı. Qalan bütün cəhdlər ilk döngədən əvvəl dayandı.
Cəhdlərin göstərdikləri
Uğursuzluqların çoxu qavrayışla bağlı idi: modellər zolağın ilk diaqonal konus xəttinin hansı tərəfində olduğunu səhv müəyyən edirdi. Astra təxminən hər beş-altı saniyədən bir müşahidə edir və dəqiqədə altı əmr verirdi; uğurlu cəhddə 0,8 m/s-dən yuxarı çıxmadı və 24 əmrin 20-də tam sükan çevirməsi istədi.
Hesabat kontekstdən öyrənmənin əlamətlərini də qeyd edir: Astra və Fable 5.1 səhvlərini təhlil etdikdən sonra sükan və sürət seçimlərini dəyişdi.
Nəyi göstərir, nəyi yox
Bu, boş dayanacaqda düzəldilmiş sabit sınaq trasıdır, real yollarda avtonom hərəkət deyil. Müəlliflər məhdudiyyətləri özləri sadalayır: hər model bir dəfə yoxlanılıb və üç cəhd eyni konteksti bölüşdüyü üçün müstəqil sayılmır. Onlar həmçinin qeyd edirlər ki, bəzi modellər MCP serverinin adı dəyişdirilənə qədər təhlükəsizlik səbəbilə idarəetmədən imtina edirdi. DrivingBench comma.ai, openpilot və ya Toyota ilə əlaqəli deyil. Komandanın nəticəsi təmkinlidir: modellər artıq aşağı sürətlə real avtomobili idarə edə bilir, lakin bu, təhlükəsizlik və qiymətləndirmə üzərində daha çox iş tələb edir.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.