Сбер научил нейросети «понимать» течение времени при генерации видео

Команда Kandinsky представила Time Adapter — модуль, который управляет частотой кадров и динамикой сцены в сгенерированных видео.

Команда Kandinsky представила Time Adapter — надстройку для генеративных видеомоделей, которая отвечает за скорость и динамику происходящего в кадре. Разработка нацелена на одну из ключевых проблем ИИ-генерации видео: нейросети неплохо справляются с качеством отдельного кадра, но плохо передают естественный темп событий. Исходный код опубликован в открытом доступе на Hugging Face под лицензией MIT, а статья с описанием метода была представлена на конференции ICML.

По словам разработчиков, видеомодели нередко искажают скорость происходящего: быстрые действия растягиваются, а медленные — либо замирают, либо, наоборот, ускоряются. Падение шарика, которое в реальности длится доли секунды, модель может «размазать» на несколько секунд, а дождь или туман — заставить двигаться рывками. В компании связывают это с принципом обучения таких систем: приоритет обычно отдается эстетике картинки, а не физической достоверности движения.

Как устроен адаптер

Time Adapter — компактный модуль размером менее 1% от основной модели. Он состоит из двух независимых блоков:

один регулирует частоту кадров — от 15 до 60 fps;второй управляет динамикой сцены в каждый момент времени.

Модуль обучали на 40 тысячах видео с разной скоростью происходящего — от динамичных сцен с людьми (ходьба, бег, танцы) до медленных природных процессов (облака, волны, туман). В ходе обучения система училась отличать реальный темп действия от искусственно ускоренного или замедленного.

Источник: hi-tech.mail.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев