Исследователи представили DrivingBench — бенчмарк, в котором популярные LLM управляют настоящей Toyota Corolla. DrivingBench.. DrivingBench. llm.. DrivingBench. llm. автомобили.. DrivingBench. llm. автомобили. искусственный интеллект.. DrivingBench. llm. автомобили. искусственный интеллект. Машинное обучение.. DrivingBench. llm. автомобили. искусственный интеллект. Машинное обучение. модели машинного обучения.. DrivingBench. llm. автомобили. искусственный интеллект. Машинное обучение. модели машинного обучения. нейросети.. DrivingBench. llm. автомобили. искусственный интеллект. Машинное обучение. модели машинного обучения. нейросети. Транспорт.. DrivingBench. llm. автомобили. искусственный интеллект. Машинное обучение. модели машинного обучения. нейросети. Транспорт. эксперимент.. DrivingBench. llm. автомобили. искусственный интеллект. Машинное обучение. модели машинного обучения. нейросети. Транспорт. эксперимент. языковые модели.

Исследователи из Axiom Math запустили бенчмарк DrivingBench, в котором дали современным языковым моделям управлять настоящей Toyota Corolla 2022 года выпуска. Нейросеть получала изображение с камер и телеметрию автомобиля, а затем самостоятельно управляла рулём, педалями газа и тормоза. Полностью пройти тестовую трассу смогла только GPT-6 Astra.

Исследователи представили DrivingBench — бенчмарк, в котором популярные LLM управляют настоящей Toyota Corolla - 1

В эксперименте участвовали модели GPT-6 Astra, Claude Fable 5.1, Grok 4.6 и GPT-5.6 Sol. Автомобиль оснастили внешним бортовым компьютером Comma Four с модифицированной версией системы помощи водителю Openpilot. Модели запускали через привычные для них среды: Astra и Sol — через Codex, Fable — через Claude Code, а Grok — через Cursor.

Исследователи представили DrivingBench — бенчмарк, в котором популярные LLM управляют настоящей Toyota Corolla - 2

Для управления автомобилем у моделей были три MCP‑инструмента:

  • observe() — получить изображение с камер, скорость, положение руля и другую телеметрию;

  • set_motion() — задать направление поворота, положение руля, скорость и длительность движения;

  • stop_now() — начать торможение.

После отправленной команды автомобиль продолжал движение, а модель в этот момент анализировала новые данные. Следующая команда могла заменить предыдущую до её завершения. Из этого следует, что на результат влияет не только умение анализировать данные и планировать свои действия, но и скорость генерации ответов и способность учитывать задержку.

Исследователи представили DrivingBench — бенчмарк, в котором популярные LLM управляют настоящей Toyota Corolla - 3

У каждой LLM было три попытки в рамках одного диалога. После неудачного заезда исследователи просили модель проанализировать ошибки и возвращали авто на точку старта. Так команда проверила, могут ли нейросети научиться лучше управлять машиной внутри контекста чата.

Лучший результат показала GPT-6 Astra. Во время первой попытки модель прошла трассу на 49%, но после анализа ошибок завершила её. Автомобиль под управлением Astra проехал 134,7 метра за 5 минут 22 секунды. Во время анализа модель решила, что надо раньше входить в повороты и замедлятся рядом с препятствиями.

Исследователи представили DrivingBench — бенчмарк, в котором популярные LLM управляют настоящей Toyota Corolla - 4

Claude Fable 5.1 завершила первую попытку с результатом 9% и улучшила его до 45%. Grok 4.6 прошёл максимум 11% трассы, а GPT-5.6 Sol — 6%. Модели начали совершать ошибку уже после первого поворота: они неправильно определили, с какой стороны от диагональной линии конусов находится полоса движения.

GPT-6 Astra не только показала лучший результат, но и периодически отказывалась управлять автомобилем из‑за соображений безопасности. Исследователи редактировали системный промпт и называли эксперимент симуляцией, но модель по снимкам с камер понимала, что окружение реальное и прерывала эксперимент. Частично справиться с ограничениями помогла смена названия MCP‑сервера на DrivingBench Sandbox.

Сам эксперимент проводили на закрытой парковке с ограничением в диапазоне 0,5–3,5 м/с. В машине находился человек с ногой на педали тормоза. Нажатие на педаль или другое вмешательство в управление отменяло выполнение команду и отключало систему Openpilot.

Авторы опубликовали исходный код харнеса DrivingBench, промпты, записи заездов и трассировки действий моделей. С этим набором можно повторить эксперимент, но исследователи просят не использовать систему на дорогах общего пользования.

Автор: daniilshat

Источник