Исследователи представили DrivingBench — бенчмарк, в котором популярные LLM управляют настоящей Toyota Corolla

Исследователи из Axiom Math запустили бенчмарк DrivingBench, в котором дали современным языковым моделям управлять настоящей Toyota Corolla 2022 года выпуска. Нейросеть получала изображение с камер и телеметрию автомобиля, а затем самостоятельно управляла рулём, педалями газа и тормоза. Полностью пройти тестовую трассу смогла только GPT-6 Astra.

В эксперименте участвовали модели GPT-6 Astra, Claude Fable 5.1, Grok 4.6 и GPT-5.6 Sol. Автомобиль оснастили внешним бортовым компьютером Comma Four с модифицированной версией системы помощи водителю Openpilot. Модели запускали через привычные для них среды: Astra и Sol — через Codex, Fable — через Claude Code, а Grok — через Cursor.

Для управления автомобилем у моделей были три MCP‑инструмента:

  • observe() — получить изображение с камер, скорость, положение руля и другую телеметрию;

  • set_motion() — задать направление поворота, положение руля, скорость и длительность движения;

  • stop_now() — начать торможение.

После отправленной команды автомобиль продолжал движение, а модель в этот момент анализировала новые данные. Следующая команда могла заменить предыдущую до её завершения. Из этого следует, что на результат влияет не только умение анализировать данные и планировать свои действия, но и скорость генерации ответов и способность учитывать задержку.

У каждой LLM было три попытки в рамках одного диалога. После неудачного заезда исследователи просили модель проанализировать ошибки и возвращали авто на точку старта. Так команда проверила, могут ли нейросети научиться лучше управлять машиной внутри контекста чата.

Лучший результат показала GPT-6 Astra. Во время первой попытки модель прошла трассу на 49%, но после анализа ошибок завершила её. Автомобиль под управлением Astra проехал 134,7 метра за 5 минут 22 секунды. Во время анализа модель решила, что надо раньше входить в повороты и замедлятся рядом с препятствиями.

Claude Fable 5.1 завершила первую попытку с результатом 9% и улучшила его до 45%. Grok 4.6 прошёл максимум 11% трассы, а GPT-5.6 Sol — 6%. Модели начали совершать ошибку уже после первого поворота: они неправильно определили, с какой стороны от диагональной линии конусов находится полоса движения.

GPT-6 Astra не только показала лучший результат, но и периодически отказывалась управлять автомобилем из‑за соображений безопасности. Исследователи редактировали системный промпт и называли эксперимент симуляцией, но модель по снимкам с камер понимала, что окружение реальное и прерывала эксперимент. Частично справиться с ограничениями помогла смена названия MCP‑сервера на DrivingBench Sandbox.

Сам эксперимент проводили на закрытой парковке с ограничением в диапазоне 0,5–3,5 м/с. В машине находился человек с ногой на педали тормоза. Нажатие на педаль или другое вмешательство в управление отменяло выполнение команду и отключало систему Openpilot.

Авторы опубликовали исходный код харнеса DrivingBench, промпты, записи заездов и трассировки действий моделей. С этим набором можно повторить эксперимент, но исследователи просят не использовать систему на дорогах общего пользования.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев