Разработчики из Google представили модель Gemini Robotics ER 2, предназначенную для управления роботами и выполнения сложных задач в реальном мире. Системное решение выполняет роль высокоуровневого центра принятия решений. Модель анализирует видеопоток, планирует последовательные действия и координирует работу специализированных алгоритмов управления. Система способна использовать инструменты вроде поиска информации в сети или сторонних функций прямо во время выполнения физических действий, что повышает скорость реакции на изменения окружающей среды.
Главными изменениями по сравнению с прошлым поколением стали улучшенный анализ видео и поддержка совместной работы нескольких устройств. Модель способна точно отслеживать прогресс выполнения задачи, разделяя процесс на этапы и определяя точные моменты завершения действий, например, наливания жидкости или упаковки вещей. В случае ошибки система перестраивает план действий без необходимости начинать процесс с самого начала. Функция совместной работы позволяет распределять задачи между устройствами разного типа, такими как колесные платформы и антропоморфные модели, для совместной работы в общем пространстве.
Разработчики также уделили внимание пространственному анализу и безопасности. Модель умеет считывать показания цифровых и аналоговых приборов, линейных термометров, а также отслеживать сбои в реальном времени по видеопотоку. В области безопасности внедрены алгоритмы, соблюдающие пространственные ограничения и отслеживающие присутствие людей поблизости. Если в рабочей зоне находится человек, система приостанавливает движение и возобновляет работу только после освобождения пространства. Версия доступна разработчикам через Gemini API, Google AI Studio и на платформе Gemini Enterprise Agent Platform.
Источник: mobile-review.com