Alibaba представила Qwen3.8-Flash и показала раннюю версию архитектуры, которая станет основой следующего поколения Qwen4.
Qwen3.8-Flash — мультимодальная MoE-модель с упором на высокую эффективность инференса. Основная модель содержит 125 млрд параметров, из которых на каждом токене активируется только около 6 млрд. Дополнительно используется 51 млрд параметров N-gram embeddings — отдельная таблица эмбеддингов, которая дополняет основную модель.
Контекстное окно Qwen3.8-Flash составляет 262 тыс. токенов. Через YaRN его можно расширять до 1 млн токенов. Сама модель мультимодальная и рассчитана не только на текстовые, но и на визуальные задачи.

Основной апдейт коснулся архитектуры. Qwen сочетает Gated DeltaNet (GDN) с новым вариантом разреженного внимания Qwen Sparse Attention (QSA). Такой гибридный сеханизм внимания должен снизить стоимость обработки длинного контекста по сравнению с использованием полного attention на всех слоях.
В архитектуру также добавили Gated Residual, N-gram Embedding и новый для этой линейки вариант оптимизатора Muon. Qwen позиционирует эти изменения не как точечные улучшения Qwen3, а как набор архитектурных решений, которые будут использоваться в следующем поколении моделей.
Отдельно команда подчеркивает эффективность обучения: по заявлению Qwen, стоимость подготовки Qwen3.8-Flash-Next составила примерно 0,1 от сопоставимого обучения Qwen3.7-Plus. При этом разработчики заявляют сопоставимый общий уровень возможностей и более сильные результаты в кодинге и задачах типа cowork.
Бенчмарки Qwen3.8-Flash
DeepSWE 1.1 — 58,7%;
SWE-bench Pro — 62,5%;
CoWorkBench — 73,9%;
AndroidWorld — 84,5%;
MathVision — 95,7%.
Qwen пытается получить производительность значительно более крупной модели за счет сочетания MoE, разреженного attention и дополнительных механизмов памяти.

Еще интереснее Qwen3.8-Flash-Next. Это отдельная открытая модель, которую Qwen выпускает как ранний preview архитектуры Qwen4. В Hugging Face она прямо обозначена как «A Preview of the Qwen4 Architecture». Qwen фактически выносит архитектурные изменения Qwen 4 в отдельный релиз заранее. Можно пощупать и изучить новую конструкцию, подготовиться к следующему семейству моделей еще до выхода полноценного Qwen4.
Производственную версию Qwen3.8-Flash компания планирует добавить в QwenCloud. Заявленная цена составляет $0,16 за 1 млн входных токенов и $0,47 за 1 млн выходных.
Github
Hugging Face
Источник: habr.com