Яндекс выложил на Hugging Face ИИ-модель Alice AI Foundation LLM и два русскоязычных бенчмарка

Яндекс выложил в опенсорс Alice AI Foundation LLM — претрейн-версию новой большой языковой модели, обученной с нуля. Модель, технические отчёты и бенчмарки опубликованы на Hugging Face, техрепорт — на Хабре. Об этом сообщили редакции Трешбокс.ру в компании. Подписывайтесь на Telegram-канал про технологии

Модель работает на архитектуре MoE (Mixture of Experts). В ней 80 млрд параметров, из которых в моменте активны 3 млрд. Разработчики могут использовать её в исследовательских и коммерческих проектах по лицензии Apache 2.0. Публикация включает: веса модели, технические отчёты и бенчмарки на Hugging Face; техрепорт на Хабре; лицензию Apache 2.0 без ограничений на коммерческое применение;

Эта версия экспериментальная. На ней Яндекс тестирует архитектурные решения для будущей единой рассуждающей модели (ЕРМ), которая ляжет в основу агентных возможностей Алисы AI. В агентных сценариях пользователи смогут поручать модели выполнение конкретных действий.

По данным компании, на олимпиадных задачах по математике модель делит лидерство с Qwen3.5-35B-A3B-Base. В тестах на написание кода она опережает NVIDIA Nemotron-3-Super-120B-Base, используя в четыре раза меньше активных параметров. На задачах, где нужны широкие фактические знания, обходит DeepSeek-V4-Flash-Base с 284 млрд параметров и 13 млрд активных. По собственным бенчмаркам на знание фактов новая модель отвечает на уровне предыдущей закрытой Alice AI LLM, у которой в три раза больше параметров и в семь раз больше активных.

Для оценки русскоязычных знаний Яндекс собрал два бенчмарка. WikiWebFacts состоит из пар «короткий вопрос — короткий ответ» и проверяет знание дат, определений, событий и персоналий на основе онлайн-энциклопедий и частотных агрегированных поисковых запросов. HardMultiQA построен на анонимизированном потоке запросов к Алисе AI и охватывает медицину, право, IT и искусство. В заданиях нужно выбрать несколько верных вариантов из списка, перечислить несколько подходящих фактов или найти фактическую ошибку в тексте. Оба набора открыты вместе с моделью, эталонными ответами и полным протоколом оценки.

В технической части компания описывает два изменения. Оптимизатор перестроили так, чтобы пересылка данных между видеокартами шла параллельно с вычислениями, и шаги оптимизации ускорились примерно в два раза. Отбор обучающих данных раньше требовал запуска ресурсоёмкой модели на всём корпусе, это заняло бы более 200 тыс. часов работы видеокарт. Теперь документы проходят каскад классификаторов, где более затратная модель работает с меньшим числом документов. Вычисления сократились в десятки раз, сохранилось около 95% полезных документов. Базу знаний модели дополнили в области права, медицины и математики.

Модель прошла основной этап обучения, от которого зависят её эрудированность и способности, и может использоваться как основа для собственных проектов.

Источник: trashbox.ru

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев