Исследователи представили результаты необычного эксперимента, который проверил, способны ли универсальные языковые модели справиться с задачей, для которой их специально не обучали. Речь шла не о симуляции и не о компьютерной игре, а об управлении реальным автомобилем. Команда DrivingBench решила выяснить, могут ли современные чат-боты принимать решения в динамичной среде и вести машину по заданному маршруту.

Как проводился эксперимент
В испытаниях участвовали четыре модели: GPT-6 Astra, Claude Fable 5.1, Grok 4.6 и GPT-5.6 Sol. Им доверили Toyota Corolla. Информацию об окружающей обстановке системы получали с камер, после чего должны были самостоятельно провести автомобиль по трассе. Длина маршрута составляла 130 метров. Условия были максимально контролируемыми: скорость ограничивали, а человек в любой момент мог вмешаться и нажать на тормоз.
Сложности появились ещё до старта. Некоторые модели, особенно GPT-6 Astra, периодически отказывались управлять настоящей машиной из соображений безопасности. Это происходило даже на пустой площадке, где скорость была сильно ограничена, а рядом находился человек, готовый остановить автомобиль. Разработчикам пришлось экспериментировать с формулировками запросов, чтобы добиться стабильного начала заезда.
В итоге исследователи нашли обходной путь: они добавили слово «песочница» (sandbox) к названию одного из компонентов. После этого модели начинали работать стабильнее и соглашались приступить к управлению. Этот эпизод показывает, насколько важны формулировки и контекст даже в технических экспериментах с ИИ. Кроме того, он говорит о том, что встроенные ограничения безопасности могут заметно влиять на практическое применение моделей.
Результаты заездов
Результаты заездов заметно различались. GPT-5.6 Sol за три попытки каждый раз преодолевал лишь около 6% трассы. К третьему заезду суммарный пройденный им путь достиг 17,1 метра. При этом часть движения приходилась на отклонения и возвращение назад, то есть система не столько уверенно ехала вперёд, сколько пыталась корректировать курс. Для маршрута длиной 130 метров такой результат оказался очень скромным.
Лучший результат Grok 4.6 составил 22,6 метра. Это соответствовало примерно 11% маршрута. Показатель оказался выше, чем у GPT-5.6 Sol, но всё равно не позволил приблизиться к полному прохождению трассы. Модель продемонстрировала ограниченную способность удерживать направление и принимать решения в реальном времени. Даже в упрощённых условиях ей не хватило устойчивости для уверенного вождения.
Две другие модели выступили лучше. Claude Fable 5.1 во время третьей попытки смог добраться примерно до середины трассы. Это уже заметно превышало результаты GPT-5.6 Sol и Grok 4.6. Однако и здесь речь шла не о полноценном проезде, а лишь о частичном успехе. Тем не менее прогресс от попытки к попытке указывал на то, что модель способна учитывать предыдущие ошибки.
GPT-6 Astra в первом заезде показал результат, сопоставимый с достижением Claude Fable 5.1. А затем именно эта модель стала единственным участником эксперимента, которой удалось полностью завершить маршрут. Этот факт стал главным позитивным моментом испытаний. Однако даже единичный успех не означает, что система готова к реальной дороге: для надёжного вождения нужны стабильность, предсказуемость и безопасность в самых разных ситуациях.
После каждого заезда системам предлагали проанализировать предыдущие ошибки. У Astra и Fable исследователи заметили улучшение результатов. Это может говорить о том, что модели способны учиться на собственном опыте в рамках серии попыток. Однако такой вывод требует осторожности: улучшение могло быть связано с конкретными условиями трассы и ограниченным числом тестов.
Заключение
Авторы эксперимента подчёркивают, что проверка была ограниченной. Для каждой модели провели лишь небольшое число попыток на одной трассе, поэтому делать широкие обобщения рано. По их мнению, дальнейшее развитие подобных возможностей потребует не только совершенствования моделей, но и дополнительной работы над безопасностью и методами их оценки. Пока же чат-боты, даже самые продвинутые, не могут считаться надёжными водителями реального автомобиля.