«Сбер» выпустил модель Kandinsky 6.0 Video для генерации видео с речью и музыкой

Команда «Сбера» представила Kandinsky 6.0 Video — модель, которая генерирует видео вместе с синхронным звуком, включая речь, музыку и шумы окружения. Максимальная длительность роликов пока ограничена пятью секундами, но разработчики планируют её увеличить. Модель доступна в «ГигаЧате» и на Hugging Face.

Для генерации надо описать сцену на естественном языке или загрузить первый кадр с описанием происходящего. Модель синхронизирует движения губ с фразами персонажей и генерирует звуковую дорожку с частотой дискретизации 44 кГц. При необходимости звук можно отключить. В компании отмечают, что для более точной генерации система подбирает референсы для незнакомых объектов, включая персонажей, которые появились уже после обучения модели.

Семейство Kandinsky 6.0 Video включает в себя две модели: Lite с 3 млрд параметров и Pro с 30 млрд. В основе лежат связанные модули, которые обмениваются данными, чтобы синхронизировать звук и изображение. Обе модели поддерживают запросы как на основе текста, так и начального изображения.

В «ГигаЧате» есть возможность выбрать разрешение видео: SD, HD и Full HD. При этом Full HD получают с помощью модели Kandinsky 6.0 Video Super‑Resolution, которая повышает разрешение исходного ролика с 864 × 480 пикселей до 1920 × 1080 пикселей.

Код и веса модели опубликованы по лицензии MIT. Кроме того, команда выпустила интеграцию для Diffusers и ускоренные версии моделей. Для запуска есть режим работы на графических ускорителях с 16 ГБ видеопамяти.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев