Назад
GPT-6 Astra — єдина модель, яка повністю пройшла трасу DrivingBench
SiTech AI Team2 წთ. საკითხავი

GPT-6 Astra — єдина модель, яка повністю пройшла трасу DrivingBench

DrivingBench дав чотирьом фронтир-моделям керування Toyota Corolla 2022 року на трасі з конусів у порожньому паркінгу. Єдиною, хто подолав маршрут повністю, стала GPT-6 Astra: 100% за 5 хвилин 22 секунди.

Бенчмарк DrivingBench, який створили Aditya Ramabadran, Simon Mahns і Tobias Gessler, перевіряє просте питання: чи здатні фронтир-моделі керувати справжнім автомобілем? Дослідники розклали трасу з конусів на порожньому паркінгу та передали чотирьом моделям керування Toyota Corolla 2022 року. Повністю пройти маршрут вдалося лише GPT-6 Astra.

Як модель керує машиною

В автомобілі встановлено пристрій comma four, під'єднаний до шини CAN через кабель OBD-C. Моделі не сидять за кермом — вони викликають три інструменти MCP зі своїх звичних чат-середовищ (Codex, Claude Code, Cursor): observe(), set_motion() і stop_now(). set_motion() приймає напрямок, відсоток повороту керма від 0 до 100, швидкість у метрах за секунду та тривалість. Нова команда замінює попередню, а не стає в чергу, і машина продовжує рух, поки модель думає.

Кожен запуск контролює оператор: він сидить на місці водія, тримаючи ногу над педаллю гальма. Програма обмежує швидкість до 0,5–3,5 м/с (1–8 миль/год), а понад 6 м/с спрацьовує аварійна зупинка, яка скасовує рух.

Тестова траса DrivingBench на порожньому паркінгу

Таблиця результатів

Кожна модель мала до трьох спроб в одному безперервному чаті, між якими отримувала запит на осмислення помилок. Прогрес рахують за відстанню вздовж осьової лінії траси, доки машина тримається в межах чотирьох метрів від неї; у разі зіткнення зараховують лише пройдене до нього.

GPT-6 Astra (Codex, medium) фінішувала з другої спроби: 100% траси за 5 хвилин 22 секунди у 24 командах. Перша спроба завершилася на 49%. Claude Fable 5.1 (Claude Code) досягла максимум 45% на третій спробі, Grok 4.6 (Cursor) — 11%, а GPT-5.6 Sol (Codex) — 6%. Решта спроб зупинилися ще до першого повороту.

Що показують запуски

Більшість невдач були пов'язані зі сприйняттям, а не з механікою: моделі плутали, з якого боку від першої діагональної лінії конусів проходить смуга. Astra спостерігала приблизно кожні п'ять-шість секунд; в успішному запуску вона не перевищувала 0,8 м/с і просила повний поворот керма у 20 з 24 команд.

Звіт фіксує й ознаки навчання з контексту: Astra та Fable 5.1 змінили свої підходи до керма й швидкості після аналізу помилок.

Що це доводить, а що ні

Це фіксована тестова траса на порожньому майданчику, а не автономність на дорогах. Автори самі називають обмеження: кожну модель перевірили один раз, а три спроби мають спільний контекст і не є незалежними. Вони також зазначають, що деякі моделі відмовлялися керувати з міркувань безпеки, доки сервер MCP не перейменували. DrivingBench не пов'язаний із comma.ai, openpilot чи Toyota. Висновок стриманий: моделі вже здатні керувати справжньою машиною на низькій швидкості, але це вимагає більше роботи над безпекою та оцінюванням.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.