Компания Black Forest Labs представила FLUX 3 — новую мультимодальную модель, которая одновременно работает с изображениями, видео и аудио. В отличие от предыдущих версий, она обучается сразу на нескольких типах данных, что позволяет ей лучше понимать взаимосвязи между происходящими событиями, движением объектов и звуком, а не рассматривать каждую модальность отдельно.
Разработчики считают, что такой подход помогает модели формировать более целостное представление об окружающем мире. Изображения передают пространственную структуру сцены, видео добавляет информацию о движении и времени, а аудио помогает установить причинно-следственные связи между событиями. Благодаря совместному обучению FLUX 3 учитывает соответствие звука происходящему на экране, физику движения объектов и последовательность событий.
В основе модели лежит архитектура Self-Flow, предназначенная для объединения генерации и понимания мультимодальных данных. На её базе FLUX 3 способен создавать изображения, видео и аудио как по текстовым запросам, так и с использованием изображений или видеороликов в качестве исходных материалов.
Одной из главных возможностей модели стала генерация видеороликов продолжительностью до 20 секунд со встроенным звуковым сопровождением. FLUX 3 поддерживает создание видео по текстовому описанию, анимацию статичных изображений, продолжение существующих роликов, перенос персонажей и объектов между сценами, генерацию ключевых кадров, многоязычные диалоги и работу с различными стилями. Также модель позволяет объединять отдельные фрагменты в более длинные последовательности.
По данным разработчиков, в предварительных тестах FLUX 3 опередил ряд конкурирующих моделей, включая решения от Runway, Luma, Kling и Grok. FLUX 3 был предпочтительнее Grok Imagine Video в 69% сравнений, Kling v3 Pro — в 60%, Happy Horse v1 — в 59%, Happy Horse 1.1 — в 57%, Seedance 2.0 и Gemini Omni Flash — в 52%. Также FLUX 3 обошёл ИИ-модель Runway Gen-4.5 в 77% сравнений и Luma Ray 3.2 — в 93% сравнений. При этом компания отмечает, что модель всё ещё находится на стадии раннего доступа и её качество продолжит улучшаться.
Помимо генерации видео, FLUX 3 умеет создавать и редактировать изображения, включая сложные композиции и текст на разных языках. Отдельное направление разработки связано с прогнозированием действий для робототехники. В рамках этого проекта Black Forest Labs сотрудничает с компанией Mimic Robotics, которая использует возможности модели для обучения промышленных роботов.
В ближайшие месяцы компания планирует поэтапно открыть ранний доступ к инструментам для генерации видео, изображений и аудио через API, а также предоставить исследователям доступ к открытой версии архитектуры FLUX 3. Вместе с этим разработчики обещают опубликовать дополнительные технические подробности о модели.
Источник: trashbox.ru