Команда DrivingBench провела незвичайний експеримент: кілька універсальних ШІ-моделей під’єднали до справжньої Toyota Corolla і дали їм контроль над кермом, акселератором та гальмами. Машину не виводили на звичайну дорогу — тест відбувався на закритій парковці з конусами, де автомобіль мав пройти просту U-подібну трасу й зупинитися у заданій зоні. Головна ідея полягала не у створенні конкурента Waymo, а у перевірці, чи здатні мовні моделі виконувати фізичне завдання без спеціального навчання водінню.

Для зв’язку між чатботами та автомобілем використали систему Comma, яка дозволяє додавати функції автоматизованого керування до сумісних серійних машин. Дві камери передавали моделі зображення дороги, а команда контролювала роботу через ноутбук. Людина не керувала автомобілем, але тримала ногу біля педалі гальма як резервний захід.
У тесті брали участь кілька сучасних моделей ШІ. Три з них змогли проїхати лише кілька метрів і не завершили маршрут. Лише одна модель після серії змін промпта зрештою змогла пройти трасу повністю.
Цікаво, що частина труднощів виникла ще до самого руху. Моделі іноді відмовлялися виконувати команду, коли розуміли, що йдеться про реальний автомобіль. Дослідникам доводилося змінювати формулювання, описувати середовище як контрольовану «пісочницю» та додатково пояснювати умови безпеки.
Головною проблемою виявилася не логіка маршруту, а час відповіді
Навіть коли модель правильно розуміла, що потрібно зробити, вона могла витрачати занадто багато часу на аналіз кадру та формування наступної команди. За словами команди, у деяких випадках затримка сягала близько 20 секунд.
Для звичайного чатбота двадцять секунд можуть бути просто повільною відповіддю. Для автомобіля це критично. Навіть на швидкості близько 3 км/год машина за такий час здатна проїхати приблизно 20 метрів. На реальній дорозі ситуація за ці секунди може повністю змінитися.
Саме тому спеціалізовані системи автономного водіння працюють інакше. Вони не чекають, поки велика мовна модель «обдумає» кожен кадр. Камери, радари, лідари та нейромережі обробляють дані з дуже низькою затримкою, а контури керування реагують десятки разів за секунду.
Експеримент показав потенціал, але не готовність ШІ до реального водіння
DrivingBench прямо наголошує, що тест не доводить можливість замінити Waymo або Tesla звичайним чатботом. Йдеться про інше: універсальна модель, яку ніхто спеціально не тренував як водія, все одно здатна зрозуміти зображення дороги, сформувати план і керувати фізичним об’єктом.
Це цікавий приклад емерджентної здатності — функції, яка не була основною метою навчання моделі, але проявляється через загальні навички роботи із зображеннями, мовою та плануванням.
Водночас тест показав і межі. Реальне водіння вимагає миттєвої реакції, стабільності та передбачуваності. Модель не може «думати» кілька секунд перед кожним поворотом, а безпека не повинна залежати від того, як саме сформульований промпт.
Тому найближчий практичний сценарій для мовних моделей — не пряме керування кермом і педалями, а високорівневі функції: пояснення маршруту, взаємодія з пасажиром, планування або робота як один із допоміжних модулів у складнішій системі автономного водіння.
Експеримент із Corolla важливий саме як лабораторна демонстрація. Він показав, що універсальний ШІ вже може взаємодіяти з фізичним світом значно складніше, ніж звичайний голосовий асистент. Але він так само чітко показав, чому між «може повільно проїхати парковку» і «готовий безпечно керувати на дорозі» лежить величезна технологічна дистанція.

4453