
25 августа IBM Research опубликовала Granite 4.2 — семейство из трех моделей на 3, 8 и 30 млрд параметров с переключаемым режимом рассуждений. Веса открыты под Apache 2.0, без ограничений на коммерческое использование и дообучение.
Главное отличие от предыдущей версии — не размер, а то, чему модели учили после предобучения.
Что именно выложили
Все три модели — плотные decoder-only трансформеры, без MoE. Grouped Query Attention с восемью KV-головами, RoPE, SwiGLU, bfloat16:
-
3B — 40 слоев и размерность эмбеддингов 2560;
-
8B — те же 40 слоев при 4096;
-
30B — 64 слоя и скрытый размер MLP 32 768.
Обучение шло с нуля примерно на 15 трлн токенов, включая 1 трлн синтетического кода, сгенерированного пайплайном CodeAlchemy. Рабочая длина контекста по архитектурной таблице — 131 072 токена, при этом фаза длинного контекста в предобучении доходила до 512К.
Режимов вывода три: с рассуждениями, без и «low-effort» для экономии на простых запросах. Спекулятивное декодирование встроено. Модели выложены на Hugging Face, Ollama, GitHub и LM Studio, работают в vLLM и SGLang.
Агентный RL: модель училась в песочнице
Для версий 8B и 30B IBM добавила отдельную стадию обучения с подкреплением в изолированных окружениях. Модель сама вызывала инструменты, писала и запускала код, ходила в поиск. Вызов функций — в формате OpenAI, то есть переезд существующего агентного кода не требует переписывания.
Пайплайн постобучения семейства Granite 4.2. Источник.
Разница между «умеет вызывать инструменты» и «обучена выбирать инструменты» на практике заметна именно на длинных цепочках: модель, которую не тренировали в окружении, охотно вызывает все подряд и не умеет остановиться. Плюс к этому три режима вывода — это способ управлять счетом. На классификации и извлечении сущностей рассуждения только жгут токены, и возможность отключить их флагом дешевле, чем держать вторую модель.
Отдельно стоит отметить выбор плотной архитектуры. Пока индустрия соревнуется в MoE с триллионными общими параметрами и скромными активными, IBM выпускает обычные dense-трансформеры — и это решение под конкретный сценарий. MoE выигрывает по вычислениям, но требует держать в памяти все эксперты, поэтому self-hosted развертывание упирается в VRAM гораздо раньше, чем в FLOPS. Плотная 30B в bf16 — это примерно 60 ГБ весов, в восьмибитном кванте около 30 ГБ, то есть одна карта. 8B в bf16 укладывается в 16 ГБ и живет на чем угодно. Для бизнеса, да и в целом, для локального контура предсказуемость важнее пиковой эффективности.
Цифры
По бенчмаркам старшей 30B: SWE-Bench Verified — 57,00, AIME25 — 89,17, GPQA — 66,41, MMLU-Pro — 77,60, RULER на 128К — 81,38. Для плотной модели на 30 млрд параметров, которую можно поднять на одной приличной карте, это приличный результат. Особенно RULER, который прямо проверяет, работает ли заявленный контекст на самом деле.
Отдельно вышли речевые модели Granite Speech 5.0 Turbo CTC на 470 млн параметров: около 12 600 RTFx на одной H200, примерно три часа аудио в секунду обработки и вдвое больше скорости, чем у прежнего лидера Open ASR Leaderboard. Тут нет LLM-бэкбона, и это осознанный выбор. Для транскрибации он не нужен.
Кому это надо
Зачем брать Granite, когда есть Qwen с лучшими бенчмарками и фронтир-модели по API. Ответ у IBM звучит примерно так: Apache 2.0 без дополнительных условий, размеры, которые помещаются в локальный контур, вменяемая юридическая позиция по данным обучения и внятная поддержка — набор, который в enterprise часто перевешивает пару процентов на лидерборде.
Интересно, что 3B в семействе есть, а агентного RL для нее нет. IBM очертила, где проходит граница применимости: младшая модель — для классификации, извлечения и RAG, агентная работа начинается с 8B.
Есть и вторая причина, по которой на такие релизы стоит обратить внимание. Открытые веса под Apache 2.0 в диапазоне 3–30B — это то, что реально разворачивается в закрытом контуре без экспортных вопросов и без счета за токены, растущего линейно с нагрузкой. Фронтир-API выигрывает на сложных задачах, но большая часть корпоративной работы с текстом — это извлечение полей из документов, маршрутизация обращений и суммаризация, где 8B справляется.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
Источник: habr.com