Пользователи ГигаЧата теперь могут бесплатно создавать ролики с речью, музыкой и звуками окружения в качестве до Full HD. За это отвечает новая модель Kandinsky 6.0 Video. Достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда.
Максимальная длительность ролика со звуком составляет пять секунд. Со временем разработчики планируют увеличить этот лимит. Модель стала лучше передавать физику реального мира: движения людей, животных и техники выглядят естественнее, особенно в динамичных сценах.
Kandinsky 6.0 Video — мультимодальная модель: она одновременно обрабатывает картинку и звук. Диалоги и эффекты идут синхронно с изображением, губы персонажей двигаются вместе с речью. При необходимости можно создать ролик без звука. Если модель не знает объект из запроса, она ищет референсы и генерирует его точнее.
Звук получается чистым, без шипения, в качестве 44 кГц. В одном ролике можно совместить диалог, шаги, шум ветра и музыку — от «испанской гитары» до «саундтрека к погоне» или «лоу-фая для сонного вечера». С помощью модели можно, например, оживить семейную фотографию, сделать видеооткрытку или ASMR-ролик.
Разработчикам модель доступна в опенсорсе под лицензией MIT. Её можно бесплатно встроить в свои продукты — в том числе через FAL, Diffusers, ComfyUI и vLLM-omni. В ГигаЧате перед генерацией можно выбрать качество: SD для скорости или HD и Full HD для детализации.
По оценкам разработчиков, Kandinsky 6.0 Video Pro лучше версии 5.0 в среднем в 71% случаев. Она также обходит открытую LTX 2.5, а в оживлении изображений — закрытую Veo 3.1 Fast по качеству картинки и соответствию исходному кадру.
Источник: www.ferra.ru