Alibaba выпустила Qwen3.8-Max-0902 — обновленную версию флагманской модели Qwen3.8-Max. Новый чекпоинт появился примерно через месяц после оригинальной версии, при этом базовую архитектуру и масштаб модели менять не стали: это по-прежнему MoE-модель на 2,4 трлн параметров с контекстным окном до 1 млн токенов.
Основные изменения пришлись на дообучение для длительных автономных задач. Qwen сообщает о заметном приросте в задачах, где агенту приходится самостоятельно планировать работу, использовать инструменты, исправлять ошибки и доводить задачу до результата.
Особенно сильно выросли результаты на coding-бенчмарках. На Terminal-Bench 3.0 результат поднялся с 11,3 до 29,0 балла, на DeepSWE 1.1 — до 69,3, а на QwenSWEbench V2 — до 70,0. Компания также заявляет улучшения на остальных тестах для генерации кода.
При этом мультимодальные показатели практически не изменились: основное обновление не затрагивало визуальную часть модели, а было направлено на агентное поведение и программирование.
В документации Qwen3.8-Max-0902 отдельно отмечается улучшение long-horizon autonomy — способности модели выполнять длинные последовательности действий без постоянного вмешательства пользователя. Alibaba приводит в качестве примера многошаговые инженерные задачи и автономную разработку, где модель может продолжать работу на протяжении сотен итераций.
При этом цена API для международного endpoint остается прежней: $2 за 1 млн входных токенов и $6 за 1 млн выходных. Поддерживается контекст до 1 млн токенов, а максимальный объем вывода составляет 131 072 токена.
Читать далее
Источник: habr.com