Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений

Команда Qwen из Alibaba опубликовала веса Qwen-Image 2.1. Модель объединяет генерацию и редактирование изображений, работает в нативном разрешении 2K и умеет создавать картинки с прозрачным фоном. Разработчики утверждают, что она обходит большинство закрытых конкурентов, хотя результаты пока получены на собственном бенчмарке Qwen.

Главная достоинство релиза в том, что модель имеет 7 млрд параметров. Столько содержит генеративный компонент модели, построенный на 32-слойном диффузионном трансформере DiT. Однако называть всю систему семимиллиардной не совсем точно. Для обработки текста и исходных изображений она дополнительно использует визуально-языковую модель Qwen3-VL 8B.

Генерация и редактирование в одной модели

Qwen-Image 2.1 поддерживает обычную генерацию по тексту и редактирование готовых изображений через один пайплайн. За один запрос можно передать до десяти референсов. Например, собрать групповой снимок из отдельных портретов, примерить одежду на человека или перенести предметы из нескольких фотографий в новый интерьер.

Локальные изменения можно задавать маской, нарисованной областью или обычным кругом вокруг нужного объекта. По заявлению разработчиков, модель старается сохранять внешность людей и особенности товаров при переносе между сценами.

Ещё одно заметное нововведение связано с форматом RGBA. Модель умеет сразу генерировать объекты на прозрачном фоне, извлекать предметы из фотографий и редактировать уже существующие прозрачные слои. Раньше для этого обычно приходилось отдельно удалять фон или использовать специализированную модель.

В документации приведены рекомендованные размеры от 2048 × 2048 пикселей для квадратных изображений до 2752 × 1536 для формата 16:9. Генерация по умолчанию занимает 40 шагов.

Зачем модели KV-кеш

При редактировании нескольких изображений значительная часть вычислений повторяется на каждом шаге диффузии. В Qwen-Image 2.1 исходные картинки и инструкции обрабатываются один раз, после чего промежуточные ключи и значения сохраняются в KV-кеше.

Для текста используется причинная маска на уровне отдельных токенов, а изображения обрабатываются более крупными блоками. Alibaba утверждает, что такая схема ускоряет работу с несколькими референсами и уменьшает лишние вычисления.

Архитектура также включает автоэнкодер с 16-кратным пространственным сжатием и поддержкой альфа-канала. Именно он позволяет модели работать с прозрачностью как с нативной частью изображения, а не как с результатом последующей обработки. Подробное описание архитектуры опубликовано на GitHub.

«Лучше закрытых моделей», но пока со звёздочкой

На Qwen-Image-Bench новая модель, по данным Alibaba, превосходит большинство протестированных закрытых систем. Разработчики отдельно отмечают качество текста, портретного освещения, мелких деталей и реалистичных текстур.

Относиться к этому сравнению пока стоит осторожно. Бенчмарк создан самой командой Qwen, а независимые тесты модели ещё не появились. Поэтому корректнее говорить о заявленных результатах, а не о подтверждённом превосходстве над коммерческими генераторами.

Есть и другой важный нюанс. Веса доступны публично, но Qwen Research License разрешает использовать, изменять и распространять их только в некоммерческих целях, связанных с исследованиями или оценкой. Для коммерческого применения необходимо получить отдельную лицензию у Alibaba. Поэтому Qwen-Image 2.1 точнее называть моделью с открытыми весами, а не полноценным open source.

Где попробовать

Веса опубликованы на Hugging Face и ModelScope. С первого дня модель поддерживают Diffusers и ComfyUI, а для серверного запуска заявлена интеграция с vLLM-Omni и SGLang.

Что в итоге?

Семимиллиардный генератор, нативная прозрачность и работа сразу с десятью референсами делают её хорошим таким вариантом для локальных экспериментов. Но коммерческим проектам перед скачиванием весов стоит начать не с выбора видеокарты, а с чтения лицензии.

Больше важных AI‑новостей в канале AI Native. Разбираем все, что связано с ИИ.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев