Z.ai выпустила GLM-5.3-Flash — первую нативно мультимодальную модель семейства GLM-5. Она сочетает 320 млрд параметров, из которых на каждом токене активируется около 18 млрд, и гибридную архитектуру, рассчитанную на снижение стоимости инференса при работе с длинным контекстом.

Главная архитектурная особенность — комбинация sparse attention и linear attention. Решение снижает объем вычислений attention, по сравнению с GLM-5.3, в 3,01 раза, а размер KV-cache — в 4,44 раза. Для длинного контекста это особенно важно: KV-cache занимает значительную часть памяти при генерации, поэтому его сокращение позволяет эффективнее обслуживать большие последовательности.
Контекстное окно модели достигает 1 млн токенов. GLM-5.3-Flash при этом работает не только с текстом: визуальные возможности встроены непосредственно в цикл выполнения задач. Модель может анализировать интерфейс, учитывать результат своих действий и использовать эту информацию для следующего шага.

Z.ai ориентирует модель прежде всего на агентные сценарии. Среди заявленных задач — программирование, работа с браузером и GUI, создание сцен в Blender, взаимодействие с Office-документами, финансовые исследования и обработка профессиональных документов. Модель может разбивать задачу на этапы, вызывать инструменты, анализировать промежуточные результаты и корректировать собственные действия.

Для разработчиков модель доступна под идентификатором glm-5.3-flash. API поддерживает изображения через image_url, несколько изображений в одном запросе и контекст до 1 млн токенов.
Отдельно Z.ai изменила условия GLM Coding Plan: для GLM-5.3-Flash заявлена квота в три раза больше, чем для GLM-5.3. При этом компания перевела новый план на балльную систему, а запросы в непиковые часы, включая выходные, расходуют половину стандартного количества баллов.
По сути, GLM-5.3-Flash — это попытка совместить характеристики крупной MoE-модели с более дешевой эксплуатацией: большое общее число параметров, небольшая активная часть, разреженное и линейное внимание, уменьшенный KV-cache и нативная работа с изображениями.
Источник: habr.com