Qwen показала Qwen3.8-Flash и раскрыла архитектуру будущего Qwen4

Alibaba представила Qwen3.8-Flash и показала раннюю версию архитектуры, которая станет основой следующего поколения Qwen4.

Qwen3.8-Flash — мультимодальная MoE-модель с упором на высокую эффективность инференса. Основная модель содержит 125 млрд параметров, из которых на каждом токене активируется только около 6 млрд. Дополнительно используется 51 млрд параметров N-gram embeddings — отдельная таблица эмбеддингов, которая дополняет основную модель.

Контекстное окно Qwen3.8-Flash составляет 262 тыс. токенов. Через YaRN его можно расширять до 1 млн токенов. Сама модель мультимодальная и рассчитана не только на текстовые, но и на визуальные задачи.

Основной апдейт коснулся архитектуры. Qwen сочетает Gated DeltaNet (GDN) с новым вариантом разреженного внимания Qwen Sparse Attention (QSA). Такой гибридный сеханизм внимания должен снизить стоимость обработки длинного контекста по сравнению с использованием полного attention на всех слоях.

В архитектуру также добавили Gated Residual, N-gram Embedding и новый для этой линейки вариант оптимизатора Muon. Qwen позиционирует эти изменения не как точечные улучшения Qwen3, а как набор архитектурных решений, которые будут использоваться в следующем поколении моделей.

Отдельно команда подчеркивает эффективность обучения: по заявлению Qwen, стоимость подготовки Qwen3.8-Flash-Next составила примерно 0,1 от сопоставимого обучения Qwen3.7-Plus. При этом разработчики заявляют сопоставимый общий уровень возможностей и более сильные результаты в кодинге и задачах типа cowork.

Бенчмарки Qwen3.8-Flash

DeepSWE 1.1 — 58,7%;

SWE-bench Pro — 62,5%;

CoWorkBench — 73,9%;

AndroidWorld — 84,5%;

MathVision — 95,7%.

Qwen пытается получить производительность значительно более крупной модели за счет сочетания MoE, разреженного attention и дополнительных механизмов памяти.

Еще интереснее Qwen3.8-Flash-Next. Это отдельная открытая модель, которую Qwen выпускает как ранний preview архитектуры Qwen4. В Hugging Face она прямо обозначена как «A Preview of the Qwen4 Architecture». Qwen фактически выносит архитектурные изменения Qwen 4 в отдельный релиз заранее. Можно пощупать и изучить новую конструкцию, подготовиться к следующему семейству моделей еще до выхода полноценного Qwen4.

Производственную версию Qwen3.8-Flash компания планирует добавить в QwenCloud. Заявленная цена составляет $0,16 за 1 млн входных токенов и $0,47 за 1 млн выходных.

Github
Hugging Face

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев