Встречайте Maple-Preview — новую открытую языковую модель от DeepGrove

Это модель Mixture-of-Experts (MoE) с тернарным квантованием весов, которая работает очень быстро: 218 токенов в секунду на Mac Mini M4.

Главные особенности Maple-Preview:

  • Архитектура: 24 слоя, 256 экспертов, из которых для каждого токена используются только 8.

  • Параметры: Всего 20 миллиардов, из которых активны 1 миллиард (20B-A1B).

  • Веса: Тернарные, что означает примерно 2 бита на параметр.

  • Контекст: Обрабатывает до 131 072 токенов.

  • Размер: Всего 5.31 ГБ.

  • Внимание: Использует скользящее окно (SWA-512) и глобальное внимание в соотношении 3:1, а также нормализацию Q/K RMS и FFN MoE с SiLU-гейтом (как в DeepSeek v4).

Производительность и железо:

Самое впечатляющее — это скорость генерации. Авторы заявляют, что на обычном Mac mini с чипом M4 модель выдает до 218 токенов в секунду при работе на CPU. Это намного быстрее, чем у многих других моделей такого же размера. Благодаря тому, что модель занимает всего около 5 ГБ, она помещается в оперативную память большинства современных компьютеров. Это открывает возможности для создания локальных помощников, которые могут работать с длинным контекстом и помогать с кодом, не отправляя ваши данные в облако.

Ссылки: Github HF

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев