
«Сбер» представил новую версию своей мультимодальной нейросети GigaChat — GigaChat 3.5 Reasoning. В модели появился отдельный режим рассуждений: перед формированием ответа она разбивает задачу на этапы, составляет план решения, при необходимости использует внешние инструменты и проверяет промежуточные результаты. Об этом Хабру рассказали в пресс‑службе компании.
По словам разработчиков, режим рассуждений рассчитан на задачи, которые требуют нескольких последовательных действий. Среди возможных сценариев в компании называют анализ договоров, финансовые расчёты, поиск ошибок в программном коде и планирование поездок с учётом нескольких ограничений.
Режим рассуждений пользователь может включить самостоятельно. На простые запросы модель отвечает без него, а при решении сложных задач может задействовать значительно больше вычислительных ресурсов. В «Сбере» отметили, что новая версия улучшила результаты в программировании, работе с инструментами и функциями, планировании и задачах со сложной логикой.
Компания приводит результаты собственных тестов: в бенчмарке IFBench показатель вырос с 44 до 77 баллов, в Natural Plan — с 64 до 80, а в LiveCodeBench v6 — с 56 до 85. При этом «Сбер» сравнивает эффективность модели по числу использованных токенов: по его данным, при решении математических задач GigaChat 3.5 Reasoning использует в среднем на 37% меньше токенов, чем DeepSeek V4 Flash Preview при сопоставимом качестве ответов.
GigaChat 3.5 Reasoning уже доступна пользователям «ГигаЧата», а разработчикам — бесплатно по лицензии MIT для интеграции в свои продукты. API‑версия для бизнеса, как заявили в компании, появится позже.
Основой для новой версии стала GigaChat 3.5 Ultra. Для обучения модели использовали математические и программные задачи, которые она должна была решать поэтапно. Полученные варианты рассуждений автоматически проверяли, после чего в обучение отбирали те, которые приводили к правильному результату.
По замыслу разработчиков, такой подход должен был научить модель не только выстраивать последовательность действий, но и определять, когда нужно использовать внешний инструмент или пересмотреть предыдущий этап решения.
В GigaChat 3.5 Reasoning также используют архитектуру с технологией линейного внимания. Она предназначена для работы с длинным контекстом и позволяет модели сохранять ключевую информацию из уже обработанного текста, не сопоставляя каждый новый запрос со всем предыдущим контекстом.
Источник: habr.com