Z.ai выпустила GLM-5.3: прирост за счет масштабирования RL и рост кибербзопасности

Z.ai представила GLM-5.3 — новую версию своей флагманской модели. Возможности выросли за счет масштабирования post-training и reinforcement learning: базовая модель при этом осталась той же, что использовалась в GLM-5.2.

Главный акцент разработчики сделали на обучении на реальных задачах. RL использовался не только для улучшения ответов модели, но и для практических инженерных сценариев, включая оптимизацию самого процесса тренировки. По словам команды Z.ai, такой подход дал заметный прирост в программировании и задачах, требующих длинных последовательностей действий. На внутреннем Code Bench модель якобы показывает примерно на 50% более высокий результат, чем GLM-5.2.

Отдельно Z.ai сообщает о неожиданно сильном росте возможностей в кибербезопасности. GLM-5.3 достигла state-of-the-art на CyberGym в задачах поиска уязвимостей, а прирост особенно заметен на более поздних этапах exploit chain — в задачах эксплуатации найденных уязвимостей. По данным команды, с момента выхода GLM-5.2 модели Z.ai суммарно обнаружили около 2500 уязвимостей, причем самая старая из них относится к программному обеспечению, существующему около 45 лет.

При этом архитектуру GLM-5.2 не меняли и не масштабировали модель за счет нового pre-training. Вместо этого команда увеличивала объем и сложность reinforcement learning после базового обучения. Иными словами, ставка сделана на то, насколько хорошо модель можно «дотренировать» решать реальные задачи, а не только на количество параметров или новый набор обучающих данных.

GLM-5.3 уже запущена в программных продуктах Z.ai, однако полноценные веса пока не опубликованы. Компания обещает открыть их примерно через две недели — после завершения дополнительной оценки безопасности.

Ранее компания уже использовала контекстное окно в 1 миллион и большую MoE-архитектуру, а теперь показывает, что еще один источник прироста может находиться не в увеличении самой модели, а в масштабировании post-training. GLM-5.3 фактически становится экспериментом: насколько далеко можно продвинуть уже существующий фундаментальный чекпойнт, если увеличить объем качественного RL на реальных задачах.

Если результаты подтвердятся независимыми тестами после публикации весов, история будет интересна не только для самой Z.ai. Она станет еще одним аргументом в пользу того, что следующая гонка ИИ может идти не столько за триллионами параметров, сколько за качеством и масштабом post-training.

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев