Команда Kandinsky представила Time Adapter — модуль, который управляет частотой кадров и динамикой сцены в сгенерированных видео.
Команда Kandinsky представила Time Adapter — надстройку для генеративных видеомоделей, которая отвечает за скорость и динамику происходящего в кадре. Разработка нацелена на одну из ключевых проблем ИИ-генерации видео: нейросети неплохо справляются с качеством отдельного кадра, но плохо передают естественный темп событий. Исходный код опубликован в открытом доступе на Hugging Face под лицензией MIT, а статья с описанием метода была представлена на конференции ICML.
По словам разработчиков, видеомодели нередко искажают скорость происходящего: быстрые действия растягиваются, а медленные — либо замирают, либо, наоборот, ускоряются. Падение шарика, которое в реальности длится доли секунды, модель может «размазать» на несколько секунд, а дождь или туман — заставить двигаться рывками. В компании связывают это с принципом обучения таких систем: приоритет обычно отдается эстетике картинки, а не физической достоверности движения.
Как устроен адаптер
Time Adapter — компактный модуль размером менее 1% от основной модели. Он состоит из двух независимых блоков:
один регулирует частоту кадров — от 15 до 60 fps;второй управляет динамикой сцены в каждый момент времени.
Модуль обучали на 40 тысячах видео с разной скоростью происходящего — от динамичных сцен с людьми (ходьба, бег, танцы) до медленных природных процессов (облака, волны, туман). В ходе обучения система училась отличать реальный темп действия от искусственно ускоренного или замедленного.
Источник: hi-tech.mail.ru