
27 сентября пекинский стартап NaiveAI опубликовал на Hugging Face модель Naive-N0.5-Flash. Это MoE на 309 млрд параметров, из которых на каждый токен работают 15,5 млрд, с нативным контекстом в миллион токенов и лицензией MIT.
Компания делает акцент на том, что модель «построена ИИ-центричными исследованиями». Мне этот маркетинг кажется наименее интересной частью релиза. Самое ценное в нем — архитектура, в которой нет ни одного слоя полного внимания.
Кто это
NaiveAI возглавляет Цзифэн Дай, доцент Университета Цинхуа. Раньше он работал в Microsoft Research Asia и SenseTime и известен работами по компьютерному зрению и мультимодальным моделям. Сам стартап оценен в 1,4 млрд $. Модель построена поверх открытой базы MiMo-V2.5 от Xiaomi. Авторы прямо благодарят команду MiMo, DeepSeek — за дизайн разреженного внимания и SGLang — за инференс.
Архитектура
В модели 48 слоев. 39 из них используют скользящее окно внимания (SWA) шириной всего 128 токенов. Оставшиеся девять работают на облегченном DeepSeek Sparse Attention (DSA): специальный индексатор выбирает для каждого запроса топ-2048 токенов из всего контекста. Дообучение шло на 3,25 трлн токенов, и все время на полном миллионном контексте. Сначала 50 млрд токенов ушло на прогрев индексатора, потом 3 трлн — на обучение разреженного внимания, затем 200 млрд — на затухание learning rate.
Если прикинуть на пальцах, 39 слоев из 48 хранят KV-кэш только для 128 последних токенов. Длинная память целиком живет в девяти DSA-слоях, это меньше пятой части стека. Моя оценка такая: по памяти под KV на длинном контексте модель должна быть в разы экономнее классической архитектуры с полным вниманием в каждом слое. Для инференса на миллионе токенов именно эта статья расходов обычно и решает, сколько запросов влезет в одну карту.
Что с цифрами
Сравнительных бенчмарков в виде таблиц с сырыми значениями в карточке модели нет, только графики. Независимых замеров пока тоже нет. Скорость компания приводит по-разному. В карточке значится «до 2 000 токенов в секунду» в режиме Ultrafast на собственном движке NaiveRT.
RuntimeWire уточняет, что пиковые 2 122 ток/с получены на восьми GPU в одном потоке и взяты как лучшее секундное окно на 41 запросе с генерацией HTML и SVG. Для пресс-релиза такой замер подходит хорошо, а реальную нагрузку описывает плохо. Стандартный режим, по данным карточки, выдает около 50 токенов в секунду. Планируемая цена API — 0,10 $ за миллион входных токенов и 0,40 $ за миллион выходных.
Тезис про «ИИ-центричную разработку» тоже ничем не измерен. Компания пишет, что модели писали код, запускали эксперименты и следили за результатами, а люди задавали цели и критерии. Какую долю работы сделали агенты, не раскрыто.
Контекст рынка
Релиз попадает в очень удачный момент для открытых весов. По свежему индексу Vercel AI Gateway, в августе открытые модели обработали 56% всех токенов шлюза, против 7% в декабре. При этом по деньгам их доля всего 14%, а 64% трат уходит Anthropic. Токены массово уезжают на дешевые открытые модели, деньги пока остаются у закрытых.
Стоит ожидать, что в ближайший месяц появятся независимые замеры на RULER и аналогах. Если качество на миллионе токенов подтвердится, гибрид SWA и разреженного внимания быстро станет стандартом для открытых моделей среднего размера. Скепсис у меня вызывает другое. База MiMo-V2.5 устарела буквально за неделю: Xiaomi уже 22 сентября выпустила MiMo-V2.6. Скорость, с которой китайские открытые модели надстраиваются друг над другом, сейчас важнее любой отдельной модели.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
Источник: habr.com