Сбер научил видеонейросети лучше понимать течение времени

Команда Kandinsky из Сбера разработала Time Adapter — лёгкую надстройку к генеративным моделям видео. Модуль управляет динамикой событий и частотой кадров, делая ролики физически достовернее. Код доступен бесплатно под лицензией MIT. Соответствующая научная статья представлена на конференции ICML.

Обычные модели хорошо рисуют отдельные кадры, но плохо понимают, как должно течь время. Быстрые действия растягиваются, медленные замирают или ускоряются. К примеру, падение шарика, которое в реальности длится очень быстро, модель может растянуть на несколько секунд вместо долей. Дождь идёт рывками, бег человека выглядит неестественно.

Time Adapter — компактный модуль (меньше 1% от размера основной модели). Один блок отвечает за частоту кадров (от 15 до 60 fps), другой — за динамику сцены. Разработчики обучали модуль на 40 тысячах видео: от ходьбы и бега до тумана, волн и дождя.

Есть два режима. В первом адаптер просто подключается к готовой модели — движения становятся плавнее. Во втором модель дообучается вместе с ним — меняется и физика сцены. Дообученная Kandinsky 5.0 Video Lite показала рост естественности движения на 29%. Визуальное качество выросло на 8%, соответствие тексту — на 19%.

Исходный код опубликован на Hugging Face. Решение можно использовать в том числе в коммерческих проектах.

Источник: www.ferra.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев