Встречайте Maple-Preview — новую открытую языковую модель от DeepGrove
Это модель Mixture-of-Experts (MoE) с тернарным квантованием весов, которая работает очень быстро: 218 токенов в секунду на Mac Mini M4. Главные особенности Maple-Preview: Архитектура: 24 слоя, 256 экспертов, из которых для каждого токена используются только 8. Параметры: Всего 20 миллиардов, из которых активны 1 миллиард (20B-A1B). Веса: Тернарные, что означает примерно 2 бита на параметр.