Роботу показали человеческое видео — и он научился выполнять незнакомую задачу без дообучения

Вчера на arXiv появилась работа Zero-WAM (название исследовательского метода для обучения роботов по видео с действиями человека), которая предлагает довольно естественный способ объяснять роботу новое действие: не писать инструкцию и не собирать отдельный набор роботизированных демонстраций, а просто показать видео, где человек выполняет нужную задачу.

Модель анализирует, как развивается сцена на видео, и использует это как контекст для собственных действий. Авторы собрали набор из 74,2 тысячи пар человеческих и роботизированных демонстраций для 8,6 тысячи задач, после чего проверили систему на операциях, которых она раньше не видела.

В симуляторе RoboTwin 2.0 на семи новых задачах средняя успешность составила 47% — на 29,5 процентного пункта выше сильнейшей сравниваемой модели. В физических экспериментах робот смог переносить идею из человеческого видео на новые расположения предметов, длинные последовательности действий и задачи с точной вставкой объектов.

47% — это ещё очень далеко от надёжного домашнего помощника, и работа пока только препринт. Но сам интерфейс обучения выглядит перспективно: человечество уже накопило миллиарды часов видео, где люди собирают мебель, готовят еду, чинят технику и работают на производстве. Если робот действительно научится использовать их как инструкции, проблема нехватки специальных роботизированных данных станет заметно менее болезненной.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев