Один день — три громких релиза: Qwen3.8-Max, DeepSeek V4 Pro 0813 и Grok 4.6

На рынке больших языковых моделей сразу несколько заметных обновлений: Alibaba открыла веса гигантской Qwen3.8-Max, DeepSeek выпустила в API версию V4 Pro 0813, а xAI представила Grok 4.6.

Несмотря на разную архитектуру и бизнес-модель, все три разработки движутся в одном направлении: от обычного чат-бота к моделям, способным самостоятельно выполнять длинные многошаговые задачи, прежде всего в программировании, работе с инструментами и агентных сценариях.

Qwen3.8-Max: 2,4 трлн параметров, 512 экспертов и миллион токенов контекста

Alibaba представила Qwen3.8-Max как крупнейшую модель семейства Qwen и опубликовала ее веса. Модель построена на архитектуре Mixture-of-Experts (MoE): общее число параметров достигает примерно 2,4 трлн, при этом в обработке каждого токена участвует около 95 млрд активных параметров. Архитектура использует 512 экспертов. Это позволяет увеличивать емкость модели без пропорционального роста вычислительной нагрузки.

Контекстное окно Qwen3.8-Max достигает 1 млн токенов, что позволяет использовать модель в сценариях с большими кодовыми базами, длинными документами и продолжительными агентными сессиями.

По данным Alibaba, модель набирает 86,6% на Terminal-Bench 2.1 и 93,0% на PaperBench.

DeepSeek V4 Pro 0813: миллион токенов и агрессивная экономика API

DeepSeek обновила Pro-модель до версии DeepSeek-V4-Pro-0813. В официальном API для нее заявлены контекстное окно 1 млн токенов, максимальный размер ответа до 384 тыс. токенов, поддержка tool calls и двух режимов работы — thinking и non-thinking.

Главная особенность версии 0813 — не только контекст, но и низкая стоимость инференса. Текущая тарификация DeepSeek V4 Pro составляет:

  • $0,435 за 1 млн входных токенов при cache miss;

  • $0,003625 за 1 млн входных токенов при cache hit;

  • $0,87 за 1 млн выходных токенов.

Для агентных систем разница особенно существенна. В многошаговом сценарии одна задача может генерировать большое количество повторно используемого контекста, поэтому дешевые cache-hit токены непосредственно влияют на итоговую стоимость выполнения.

По опубликованным DeepSeek результатам, переход к версии 0813 заметно улучшил показатели на нескольких агентных тестах: Terminal-Bench 2.1 — до 87,9%, CyberGym — до 83,3%, DeepSWE — до 62,7%. Они показывают направление развития модели — в сторону автономного программирования, работы с окружением и многошагового решения задач, — но сами по себе не устанавливают универсальное первое место среди всех современных LLM.

Grok 4.6: упор на длительные агентные задачи

В тот же день xAI представила Grok 4.6. В отличие от обычного обновления качества диалога, акцент здесь также сделан на длительном выполнении задач: программировании, исследовании, создании приложений и работе с инструментами.

По данным, опубликованным вместе с релизом, Grok 4.6 получил 61 балл в Artificial Analysis Intelligence Index. На отдельных специализированных оценках модель показывает высокие результаты в задачах, связанных с кодингом и долгими цепочками действий. В частности, для нее приводятся результаты 69,9% на CursorBench 3.2, 65,9% на DeepSWE 1.1 и 61,3% на FrontierCode 1.1 Extended.

xAI позиционирует Grok 4.6 как модель для сценариев, в которых агенту приходится долго работать над одной целью, использовать инструменты, анализировать промежуточные результаты и продолжать выполнение после обнаружения ошибок.

Ещё в Grok 4 компания масштабировала reinforcement learning (обучение с подкреплением) для развития reasoning-навыков, а последующие продукты вокруг Grok все активнее строились именно как агентные системы.

Три модели — один вектор

На техническом уровне эти релизы показывают несколько важных изменений в развитии LLM.

  1. Масштаб модели перестает измеряться только количеством параметров. Qwen3.8-Max с 2,4 трлн параметров использует MoE и активирует лишь часть сети на каждом токене. В результате разработчики получают огромную общую емкость модели без необходимости выполнять вычисления по всем параметрам на каждом шаге.

  2. Длинный контекст становится инфраструктурным параметром. Миллион токенов позволяет держать в одном контексте крупный репозиторий, историю взаимодействия с инструментами, результаты предыдущих шагов и связанные документы. Но само по себе большое контекстное окно еще не означает, что модель эффективно использует весь этот объем: качество работы на длинном контексте остается отдельной задачей.

  3. Бенчмарки постепенно смещаются от оценки генерации к оценке самостоятельности. Terminal-Bench, DeepSWE и другие агентные тесты оценивают уже не только генерацию текста, а взаимодействие модели с окружением, использование инструментов и результат всей цепочки действий.

  4. Стоимость инференса становится частью качества модели в продакшене. Для обычного запроса в чат разница в несколько центов может быть несущественной. Для агента, который делает десятки или сотни вызовов модели, повторно передает большой контекст и генерирует длинные цепочки действий, цена каждого миллиона токенов напрямую определяет экономику продукта.

Сейчас Qwen, DeepSeek, xAI и другие лаборатории стремятся делать дешевле и стабильнее, дольше выполняя реальную работу вместо кожаных мешков.

Как вам релизы?

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев