Qwen представила Qwen-Image-2.1-Turbo — ускоренную версию модели для генерации и редактирования изображений. Вместо 40 шагов денойзинга она использует 8. Первые тесты подтверждают прирост скорости, но детализация и следование сложным промптам уступают базовой модели.
Веса опубликованы на Hugging Face, а запуск поддерживается через Diffusers.
В пять раз быстрее
Turbo сохраняет архитектуру визуального генератора на 7 млрд параметров, но использует специальный график семплирования на восьми шагах. В качестве дополнительных оптимизаций применяются CFG=1 и prefix KV caching, позволяющий повторно использовать контекст текстового энкодера и референсных изображений.
Тест модели на NVIDIA RTX PRO 6000 Blackwell:
Разрешение
Qwen-Image-2.1, 40 шагов
Turbo, 8 шагов
1024 × 1536
35 с
6,9 с
1024 × 1824
41,3 с
8,2 с
Что изменилось в качестве
Первые отзывы неоднозначные. Turbo часто выдаёт менее проработанные изображения и хуже справляется со сложными инструкциями.
Еще один юзер проверил модель на RTX 5090 с разрешением 1024 × 1024 и сравнил результат с полной Qwen-Image-2.1 на 25 шагах. По его наблюдениям, Turbo часто усиливает текстуру кожи: поры и морщины выглядят слишком резкими, а изображение напоминает результат агрессивной обработки. Базовая модель в тех же тестах давала более естественную картинку.
Итоги
Turbo подходит также для редактирования изображений. Среди заявленных возможностей:
-
работа с несколькими референсами и сохранение композиции;
-
редактирование отдельных элементов изображения;
-
генерация изображений с прозрачностью RGBA;
-
создание постеров с текстом и типографикой;
-
генерация интерфейсов и визуальных макетов.
Qwen-Image-2.1-Turbo решает понятную задачу: ускоряет генерацию изображений без перехода на принципиально другую архитектуру. Для быстрых итераций, черновиков и подбора композиции Turbo выглядит перспективно. Для финальных фотореалистичных изображений и сложных инструкций стоит сравнить её с базовой моделью на собственных промптах.
Источник: habr.com