Google DeepMind представила Gemini Robotics ER 2 — модель для физического ИИ

Google DeepMind выпустила Gemini Robotics ER 2 — новую модель для робототехники, которую компания называет своим самым продвинутым embodied reasoning-решением. ER 2 предназначена для высокоуровневого планирования, работы с непрерывными видеопотоками и координации нескольких роботов в общей физической среде. Модель уже доступна через Gemini API и Google AI Studio, а в Gemini Enterprise Agent Platform открыта в приватном превью.

Основная идея ER 2 — разделение логики и моторики. Модель получает поток текста, аудио или видео, строит план следующих шагов и при этом передает низкоуровневое выполнение отдельным Vision-Language-Action (VLA) моделям или другим инструментам управления. В Google подчеркивают, что такой подход позволяет роботу «думать» о следующем шаге параллельно с выполнением текущих действий, без постоянных пауз на подумать.

По сравнению с предыдущей версией Gemini Robotics ER 1.6, ER 2 лучше отслеживает прогресс задачи в реальном времени. Модель анализирует непрерывные видеопотоки, умеет определять, на каком этапе находится задача, и может корректировать поведение на лету, если что-то пошло не так. Отдельный акцент сделан на progress classification и moment finding — способности понимать, когда задача выполнена и в какой именно момент произошло важное событие в кадре.

Google также заявляет о поддержке multi-robot collaboration: разные устройства могут обмениваться семантическим контекстом и совместно выполнять многошаговые задачи. В официальном посте компания показывает примеры с роботами Boston Dynamics Spot, а в репозитории на GitHub опубликованы стартовые примеры для разработчиков, которые хотят попробовать модель в своих сценариях.

Внутри Gemini Robotics ER 2 используются инструменты вроде Google Search и пользовательских функций, а сама модель интегрируется в потоковую архитектуру Gemini Live API для задач с низкой задержкой. По сути, Google строит связку, где крупная мультимодальная модель выступает оркестратором, а специализированные контроллеры и VLA-модели выполняют физические действия.

Стек Google постепенно становится похож на обычный агентский воркфлоу: есть высокоуровневый планировщик, набор инструментов, потоковый ввод данных и отдельный слой исполнения. Google делает ставку на семантическое управление задачей, где модель не только видит мир, но и понимает, на каком этапе находится процесс и как его безопасно довести до конца.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев