
Команда ИИ‑проекта Kandinsky «Сбера» разработала решение под названием Time Adapter. Проект предоставляет собой надстройку к генеративным моделям, которая управляет динамикой событий и частотой кадров в ролике. По словам разработчиков, проект создан для решения распространённой проблемы видео‑генерации, когда ИИ‑модели хорошо передают картинку в отдельном кадре, но плохо понимают, как должно течь время в течение видеоролика.
Исходный код Time Adapter опубликован под лицензией MIT, а научная статья о подходе по этому проекту была представлена на конференции по машинному обучению ICML.

Модели генерации видео не всегда корректно передают скорость происходящего: быстрые действия могут неестественно растягиваться, а медленные — замирать или, наоборот, ускоряться. Например, падение шарика, которое в реальности занимает доли секунды, модель может растянуть на несколько секунд. Сгенерированные дождь или туман могут двигаться слишком медленно или рывками, а движения бегущего человека — выглядеть неестественно. Причина — в архитектуре моделей и в принципе обучения: приоритет традиционно отдаётся эстетике отдельного кадра, а не физической достоверности. В результате модель не умеет напрямую управлять динамикой событий и сцены, в сгенерированных роликах нарушается естественный темп происходящего.
Time Adapter — компактный модуль (меньше 1% от размера основной модели), который подключается к готовой нейросети. Он состоит из двух независимых блоков: один управляет частотой кадров (от 15 до 60 FPS), другой — динамикой происходящего в каждый момент сцены.
Обучающий датасет для Time Adapter состоял из 40 тыс. видео с разной частотой и динамикой. Например, там использовались динамичные сцены с людьми (ходьба, бег, танцы) и медленные природные процессы (туман, волны, облака, дождь). В процессе обучения ИИ‑модель училась отличать реальную скорость действия от скорости действия на видео с изменённой динамикой.
«Раньше скорость происходящего в кадре задавали только слова в промпте, а повлиять на реальную динамику в создаваемом видео было достаточно сложно. С помощью Time Adapter модель понимает, как процессы разворачиваются во времени, и умеет естественно задавать нужный ритм в любой сцене, а не заучивает готовые шаблоны. Это ключевое условие для обучения физического ИИ и будущих моделей мира: система должна точно понимать длительность и динамику каждого действия. Новый метод позволяет делать из моделей инструменты, которые лучше подчиняются замыслу человека: режиссёра, инженера, разработчика робототехники, любого творческого пользователя», — пояснил CTO Kandinsky, управляющий директор по исследованию данных «Сбера» Денис Димитров.
У Time Adapter есть два режима использования. В первом режиме адаптер обучается и далее подключается к предварительно обученной модели генерации видео: в этом случае движения становятся плавнее, при этом общий характер генерации не меняется. Во втором режиме модель дообучается совместно с адаптером — в этом случае меняется не только плавность движения, но и сама физика сцены. В результате возникает способность генерировать физические процессы, которые базовой моделью создавать не удавалось.
Дообученная с адаптером модель Kandinsky 5.0 Video Lite превзошла обычную версию по нескольким показателям при тестировании на наборе динамичных видео с людьми и природой:
-
естественность движения возросла на 29%;
-
визуальное качество — на 8%;
-
видео стало на 19% точнее соответствовать текстовому запросу,
«Исследователи и разработчики могут использовать решение бесплатно: исходный код опубликован на Hugging Face под открытой лицензией MIT, которая разрешает в том числе коммерческое применение», — подытожили в «Сбере».
Источник: habr.com