Дослідники DrivingBench провели експеримент, який ще кілька років тому виглядав би як сценарій фантастичного відео: кілька універсальних моделей штучного інтелекту отримали реальний контроль над Toyota Corolla 2022 року. Вони могли керувати кермом, акселератором і гальмами, а людина сиділа за водійським місцем лише як страховка, готова миттєво натиснути на гальма.

Автомобіль обладнали пристроєм comma four та програмною системою openpilot. Саме цей комплекс перетворював команди мовних моделей на фізичні дії автомобіля. AI отримував зображення з камер, аналізував ситуацію та формував команди щодо швидкості, тривалості руху й кута повороту керма.
Мовні моделі виявилися зовсім не схожими на справжній автопілот
Тестова траса була короткою — приблизно 130 метрів — і проходила по закритій парковці між конусами. Швидкість обмежили приблизно 2–13 км/год, тому ризик був мінімальним. Попри це, більшість моделей не змогли пройти навіть простий маршрут.
Найкращий результат показала GPT-6 Astra. У першій спробі вона подолала приблизно половину дистанції, після чого проаналізувала власні помилки. Під час другої спроби модель почала їхати повільніше, давати коротші команди та сильніше повертати кермо у складних місцях — і врешті пройшла всю трасу за 5 хвилин 22 секунди.
Claude Fable 5.1 дісталася приблизно до 45% маршруту. Grok 4.6 зупинилася приблизно на 11%, а GPT-5.6 Sol — на 6%. Останні дві моделі фактично не змогли нормально пройти перший поворот.
Головною проблемою стала не відсутність логіки, а затримка між сприйняттям і дією. Модель отримувала окремий кадр, думала, формувала команду, а автомобіль у цей час продовжував рухатися. Саме тому довгі або неточні команди швидко призводили до виходу за межі траси.
Експеримент добре показує різницю між мовною моделлю та спеціалізованим автопілотом. Серійні системи автономного водіння обробляють потоки даних багато разів на секунду й мають окремі алгоритми для траєкторії, гальмування та розпізнавання об’єктів. У DrivingBench універсальний AI фактично вчився керувати машиною «на ходу».
Тому результат не означає, що чат-боти готові замінити водія. Але сам факт, що одна універсальна модель після аналізу власної невдачі змогла адаптувати поведінку і пройти реальну трасу, робить експеримент показовим для майбутнього робототехніки.

865