Чип OpenAI разогнал Kimi K2.5 почти до 700 токенов в секунду

В июне OpenAI и Broadcom представили Jalapeño, первый собственный чип OpenAI для инференса языковых моделей. Тогда компании рассказывали в основном про архитектуру и обещали начать развёртывание до конца года. Теперь появились первые результаты.

На Kimi K2.5 чип выдаёт 694 токена в секунду на пользователя против 182 у топового железа NVIDIA текущего поколения. На DeepSeek R1 разрыв получился ещё немного больше: 700 против 169 токенов в секунду.

Примечательно, что OpenAI проверяет своё железо не только на GPT-OSS, но и на крупных китайских моделях с открытыми весами. Это хороший признак того, что Jalapeño не привязан намертво к архитектуре одной конкретной модели.

По эффективности на трёх протестированных моделях Jalapeño обработал в 1,5–1,9 раза больше токенов на киловатт, а полная задержка запроса сократилась в 1,7–3,6 раза.

В абсолютной скорости Cerebras пока впереди: Kimi K2.6 на их гигантском чипе работает примерно на 1000 токенах в секунду. Правда, напрямую сравнивать результаты нельзя, потому что версии Kimi и методики тестирования отличаются.

Бенчмарки Jalapeño проводила сама OpenAI. Методика InferenceX публичная, но независимого доступа к чипу пока нет. Первые системы на Jalapeño компания собирается установить в своей инфраструктуре до конца 2026 года.

Русскоязычное сообщество про AI в разработке

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI‑агентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь, чтобы быть в курсе и ничего не упустить!

Источник: habr.com

0 0 голоса
Рейтинг новости
1
0
Подписаться
Уведомить о
0 комментариев