OpenAI опубликовала первые результаты тестирования Jalapeño — собственного ASIC для инференса языковых моделей. На публичном бенчмарке InferenceX чип показал более высокую производительность на ватт и меньшую задержку по сравнению с коммерческими системами на NVIDIA GB200 и GB300.
DeepSeek R1 670B
Тесты проводили на трех open-weight моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Во всех трех случаях OpenAI заявляет преимущество Jalapeño по совокупности ключевых метрик.
GPT-OSS 120B
На пиковых нагрузках чип показал в 1,5–1,9 раза больше полезной ИИ-работы на ватт, а end-to-end latency оказалась ниже в 1,7–3,6 раза. В интерактивных сценариях преимущество по производительности составило 2,1–4,1 раза.
Для GPT-OSS 120B OpenAI приводит показатель около 1459 токенов в секунду на пользователя против 535 у системы конкурента. Для DeepSeek R1 670B — около 700 токенов в секунду на пользователя против 169. На Kimi K2.5 1T результат составил около 694 токенов в секунду против 182.
Kimi K2.5
Откуда у OpenAI такие результаты
Jalapeño проектировали именно под современные LLM и агентные нагрузки. OpenAI одновременно оптимизировала вычислительные блоки, память, сетевое взаимодействие и программный стек, чтобы уменьшить лишнее перемещение данных.
Это особенно важно для инференса LLM: на этапе prefill основным ограничением часто становятся вычисления, а во время decode, когда модель генерирует ответ токен за токеном, существенную роль играет пропускная способность памяти. Дополнительную задержку может создавать обмен данными между чипами.
В Jalapeño OpenAI старается держать состояние модели, включая KV-cache, максимально близко к вычислительным блокам. Сеть при этом является частью общей архитектуры, а не отдельным уровнем инфраструктуры.
Чип имеет заявленный TDP 700 Вт, но во время проведенных тестов фактическое устойчивое потребление не превышало 550 Вт. Для сравнения OpenAI нормализовала результаты с учетом опубликованного энергопотребления сопоставляемых ускорителей.
Есть и более интересный эксперимент. С помощью Codex и GPT-Astra инженеры перенесли на Jalapeño три open-weight модели, которые изначально не входили в производственный план, менее чем за два месяца. Для отдельных attention- и MoE-блоков реализации, сгенерированные ИИ, оказались в 1,5–1,8 раза быстрее написанных экспертами вручную. Отмечу, речь идет только об отдельных блоках, а не о полной модели.
Что дальше будет с чипом OpenAI
OpenAI планирует начать развертывание Jalapeño в собственной вычислительной инфраструктуре до конца этого года. Компания уже работает над вторым поколением, а архитектура третьего поколения находится на стадии формирования.
При этом OpenAI не собирается отказываться от сторонних ускорителей. Компания прямо заявляет, что продолжит использовать NVIDIA и других поставщиков для training и inference. Jalapeño рассматривается не как полная замена GPU, а как собственный специализированный слой инфраструктуры для тех нагрузок, где оптимизация под реальные модели OpenAI дает максимальный эффект.
По сути, OpenAI постепенно движется к фулл-стек подходу: собственные модели, серверное ПО, сеть, память и специализированный кремний проектируются как единая система. Если результаты InferenceX сохранятся на production-нагрузках, Jalapeño может стать одним из ключевых инструментов для снижения стоимости и задержки инференса по мере роста числа AI-агентов.
Источник: habr.com