Сбер выпустил семейство генеративных моделей Kandinsky WM 1.0 для создания физически достоверного видео — оно нужно разработчикам роботов и беспилотного транспорта.
Сбер представил семейство генеративных моделей
WM 1.0, предназначенных для синтеза видео, соответствующего законам физики. Разработка ориентирована на задачи Physical AI — систем искусственного интеллекта, которые воспринимают реальный мир, понимают его динамику и управляют физическими устройствами. Код и веса моделей опубликованы на Hugging Face под лицензией MIT и доступны бесплатно.
В основе Kandinsky WM — нейросеть Kandinsky 5.0 Video Lite, дообученная на нескольких миллионах реальных видеосцен: записях с камер роботов, беспилотных автомобилей и промышленных объектов. Для автомобильных сценариев дополнительно применяли обучение с подкреплением — специальные модели оценивали ролики по сохранению формы объектов, геометрии и естественности движений, и на основе этой обратной связи Kandinsky WM учился генерировать более реалистичные кадры.
Каждый ролик длится около пяти секунд и фиксирует одно действие: манипуляцию с предметом, дорожную ситуацию или этап производственного процесса. Именно такие «кирпичики» нужны для обучения автономных систем — особенно там, где реальные съемки невозможны или опасны: ДТП, экстремальная погода, отказы оборудования.
Источник: hi-tech.mail.ru