DeepSeek V4.1-Flash: новая архитектура, 552 млрд параметров и агентные тесты

DeepSeek вывела V4.1-Flash — младшую модель новой архитектурной линейки компании. Это MoE-модель на 552 млрд параметров с нативной поддержкой изображений, контекстом до 1 млн токенов и отдельными режимами reasoning.

Наиболее интересная часть релиза — архитектурные изменения. DeepSeek перешла к асимметричной схеме Causal Encoder–Decoder: при prefill активируется около 8 млрд параметров на токен, а при decode — 16 млрд. То есть вычислительный бюджет для обработки входа и генерации намеренно сделали разным.

В модели также используется новый Engram-модуль на 196 млрд параметров для работы с N-граммами. В сочетании с MoE это позволяет разделить часть знаний и вычислений между параметрами, которые не нужно прогонять через основную сеть на каждом токене.

Отдельно DeepSeek переработала работу с KV-cache. Для длинного контекста это одна из ключевых оптимизаций V4.1-Flash: компания заявляет заметное снижение memory footprint по сравнению с предыдущим поколением. В документации модель также использует QAT для KV-cache и FP4-квантизацию, что дополнительно снижает требования к памяти при инференсе.

1) Производительность DeepSeek-V4.1-Flash и его аналогов на агентных бенчмарках. 2) Глобальный размер KV-кэша на токен (в байтах) по поколениям моделей DeepSeek1) Производительность DeepSeek-V4.1-Flash и его аналогов на агентных бенчмарках. 2) Глобальный размер KV-кэша на токен (в байтах) по поколениям моделей DeepSeekВ агентных тестах — рядом с Opus 5 и GPT-5.6 Sol

На DeepSWE v1.1 результат V4.1-Flash составляет 74,2% — это практически уровень заявленного результата Claude Opus 5 (74%) и выше показателя GPT-5.6 Sol (73%).

В Terminal-Bench 2.1 модель набирает 90,6%, а в Automation-Bench — 54,8%. В таблице DeepSeek оба результата стоят выше показателей конкурирующих моделей, с которыми компания сравнивает Flash.

При этом универсальным лидером V4.1-Flash назвать нельзя. На Terminal-Bench 3.0 и Terminal-Bench 4.0 модель получает только 30,0% и 31,2% соответственно.

Важная оговорка: опубликованные цифры — результаты самой DeepSeek.Важная оговорка: опубликованные цифры — результаты самой DeepSeek.Что интересно в архитектуре

V4.1-Flash выглядит продолжением той же линии, которую DeepSeek развивает с предыдущими V4-моделями: снижать стоимость инференса не за счет упрощения модели, а за счет переработки самой вычислительной схемы.

Асимметричный prefill/decode здесь особенно показателен. 8 млрд активных параметров на входе и 16 млрд на выходе — довольно необычная конфигурация для LLM. Она заточена под сценарии, где входной контекст может быть огромным, а генерация идет короткими последовательными шагами, как в coding agent.

Вторая интересная часть — Engram. Модель сочетает большую MoE-часть с отдельным N-граммным хранилищем параметров. Это еще один вариант вынесения части информации из основной вычислительной цепочки: некоторые закономерности можно получать через lookup-механизм, а не заставлять каждый раз восстанавливать их через глубокий проход сети.

В итоге V4.1-Flash — это довольно большая модель по числу параметров, но с гораздо меньшим активным вычислительным графом на конкретный токен.

Reasoning, мультимодальность и миллионный контекст

V4.1-Flash получила нативное мультимодальное понимание изображений и контекстное окно до 1 млн токенов.

Для API DeepSeek предлагает три уровня reasoning — low, high и max. Это уже скорее инструмент управления стоимостью агентного запуска, чем просто переключатель качества: одна и та же модель может работать с разным бюджетом рассуждения в зависимости от сложности задачи.

Миллионный контекст при этом имеет смысл рассматривать вместе с оптимизацией KV-cache. Для агентных нагрузок длинная история — один из основных источников роста memory и latency, поэтому сам размер окна без изменений в attention-механике был бы куда менее интересен.

Цена

В непиковые часы API стоит $0,15 за 1 млн входных токенов без cache hit и $0,60 за 1 млн выходных. Для уже закэшированного входа тариф составляет $0,003 за 1 млн токенов. В пиковые часы цены удваиваются.

То есть DeepSeek одновременно пытается занять две позиции: дать фронтир-модель по отдельным агентным тестам и сделать сам инференс достаточно дешевым для постоянных многошаговых вызовов.

Отдельно компания собирается заменить через V4.1-Flash текущий V4 Pro в API до выхода следующей Pro-версии. Это важнее обычного обновления каталога: Flash становится не просто более дешевой моделью, а фактическим рабочим уровнем DeepSeek для части продакшн-нагрузок.

Открытые веса

V4.1-Flash опубликована на Hugging Face с лицензией MIT. Одновременно с релизом DeepSeek выложила техническую документацию и материалы для самостоятельного развёртывания.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев