Французский стартап Mistral AI представил публичную preview-версию Mistral Large 4. Мультимодальная модель получила прозвище Le Chonk — «пухляш». Она уже доступна через API, а открытые веса компания обещает опубликовать в конце октября.

В анонсе размер модели округлён до 1 трлн параметров. Документация уточняет: у Large 4 архитектура Mixture-of-Experts, 1,05 трлн параметров всего и 49 млрд активных. Контекстное окно составляет 1 млн токенов, визуальный энкодер содержит 1,6 млрд параметров.
Предыдущая флагманская Large 3 вышла 2 декабря 2025 года с 675 млрд общих и 41 млрд активных параметров. Между обновлениями прошло около десяти месяцев. За это время Mistral выпустила Small 4 и Medium 3.5, ориентированные в том числе на программирование и работу с агентами.
Программирование и работа в терминале
На DeepSWE v1.1 Large 4 набрала 61,7%. В опубликованном сравнении она обошла DeepSeek V4 Pro 0813 и Qwen3.8 Max, но уступила Kimi K3. На SWE-Atlas-QnA, проверяющем понимание репозиториев, результат составил 59,4%.

На Terminal-Bench 4.0 отрыв от части конкурентов заметнее. Результат Large 4 примерно вдвое выше, чем у DeepSeek и Kimi. При этом до GLM-5.3 остаётся 13,6 процентного пункта.

Mistral отдельно поясняет происхождение этих цифр: DeepSWE v1.1, Terminal-Bench 4.0 и SWE-Atlas-QnA прогоняла Artificial Analysis в закрытом режиме до публичного запуска тестового окружения. Результаты должны появиться в Coding Agent Index после его публикации.
В слепой оценке качества кода с Surge AI модель заняла второе место среди пяти участников. Профессиональные оценщики поставили ей 3,74 балла из пяти: выше GLM-5.3 и Kimi K3, но ниже Claude Opus 5 с 4,22 балла. Названия моделей оценщикам не показывали.
Кибербезопасность
На CyberGym-E2E Large 4 получила 82% и заняла первое место в опубликованной таблице. В этом тесте нужно воспроизвести реальную уязвимость в открытом ПО, а затем исправить её. Ближайший конкурент, MiMo-V2.6-Pro, набрал 79%; Grok 4.7 и GLM-5.3-Flash — по 74%.
Первое место относится именно к CyberGym-E2E. По данным анонса, в общем Artificial Analysis Cyber Index модель входит в первую пятёрку. Mistral также отмечает, что некоторые закрытые модели получают низкие результаты в CyberGym-E2E из-за отказов выполнять задания. Поэтому тест отражает и способность работать с уязвимостями, и ограничения, заданные разработчиками модели.

API, цены и будущие открытые веса
Идентификатор модели в API — mistral-large-4. Поддерживаются работа с изображениями, вызов функций и структурированные ответы.
На момент анонса стоимость стандартных API-запросов составляет $0,68 за миллион входных токенов и $2,09 за миллион выходных. Чтение кэшированного входа стоит $0,07. В карточке модели эти цены показаны со скидкой 50% от $1,36, $4,18 и $0,14 соответственно.
Large 4 обучали с нуля на 3800 NVIDIA Grace Blackwell GPU в собственных европейских дата-центрах Mistral. Preview обслуживается на той же инфраструктуре. В обучающих данных представлены более 160 языков.
До публикации весов компания продолжает обучение с подкреплением и проверку модели с партнёрами по кибербезопасности. Вместе с весами Mistral обещает раскрыть дополнительные подробности архитектуры, бенчмарки и методику постобучения. Поэтому опубликованные сейчас результаты относятся к preview-версии.
Если новость понравилась, приглашаю в канал AI for Devs. Каждый день публикую похожие материалы: новые модели, агенты, практические кейсы и новости из мира AI.
Источник: habr.com