
На Hot Chips 2026 OpenAI и Broadcom впервые раскрыли цифры по Jalapeño — собственному ASIC компании для инференса. Заявка крупная: прирасти в 1,5–1,9 раз по пропускной способности и 1,7–3,6 по латентности против актуальных ускорителей, а на сценариях со сверхнизкой задержкой — до 4,1. Презентация прошла 25 августа, а вечером 26-го NVIDIA отчитывалась за квартал и конечно это не спроста. Детали разбираем внутри.
Что показали
Стойка Jalapeño — это 128 чипов, 1,7 экзафлопса в 4-битной точности, 27,5 ТБ HBM4 и около 2 ПБ/с суммарной пропускной способности памяти. По оценке The Register, вся конструкция потребляет на 40–60% меньше сопоставимых GPU-систем.
Источник.
Разбор SemiAnalysis добавляет деталей: 13,4 петафлопс MXFP4 на вычислительный кристалл, TSMC N3P, 15,4 ТБ/с на HBM4 и TDP 700 Вт — против 900–1150 Вт у Rubin. На DeepSeek R1 при concurrency = 1 чип выдает больше 700 токенов в секунду на пользователя, что примерно в девять раз выше ближайшего конкурента. Причем без спекулятивного декодирования, то есть запас на оптимизацию еще есть.
Архитектурно OpenAI пошла против тенденций. Индустрия разносит префилл и декодирование по разным пулам железа — здесь их объединили на одних и тех же чипах. Продакшен-трафик не держит стабильное соотношение между фазами, и дизагрегация начинает простаивать. Иерархия памяти тоже упрощена и каждое ядро работает со своим срезом HBM, синхронизация вынесена в отдельную сеть коллективных операций.
Стойка собирается из трех типов треев: Katsu с парой AMD EPYC Turin и 1,5 ТБ DRAM, Vindaloo с самими ASIC и Chana на коммутаторах Broadcom Tomahawk 6. Scale-up домен — до 2048 XPU, около 160 кВт на сдвоенную стойку.
Самое интересное в этой истории — софт, а не кремний. Обычно железо готово, а писать под него ядра некому и нечем. OpenAI сделала собственный язык ядер Gluon поверх Triton с явной абстракцией раскладки тензоров по ресурсам чипа — и часть MLA-ядер для тестов на DeepSeek написала внутренним Codex.
За восемь дней команда растянула конфигурацию с TP8 до TP32 и вышла на масштаб полной стойки. Это, пожалуй, единственный аргумент против стандартного возражения «у NVIDIA CUDA, и этим все сказано». Когда компилятор пишет тот же, кто проектировал чип и обучал модель, цикл оптимизации становится заметно короче.
Почему это еще не «убийца NVIDIA»
Как бы ни хотелось в очередной раз назвать кого-то «убийцей», пока оговорок хватает, и SemiAnalysis их прямо перечисляет. Бенчмарки прогоняли только на InferenceX и на коротких контекстах (8k на вход, 1k на выход). AgentX с многооборотными сценариями и стресс-тестами кэша не запускали, а именно он ближе к реальной агентной нагрузке. Сравнивали с Blackwell, хотя корректнее было бы с Rubin. И модели брали не самые свежие: DeepSeek R1 и Kimi K2.5, тогда как NVIDIA и AMD показывают результаты на DeepSeek V4 Pro и Kimi K3.
Конкретно в качестве оппонентов выступали GB200 и GB300. И еще одна деталь для точности: устойчивое измеренное потребление Jalapeño около 550 Вт при паспортных 700.
Отдельная история — сроки. OpenAI говорит о девятимесячном цикле от старта проектирования до выпуска, SemiAnalysis насчитывает около 16 месяцев полного цикла с окончанием CoWoS в ноябре 2025-го. Обе цифры для отраслевого ASIC быстрые, но маркетинг считает от одной точки, инженеры — от другой.
Экономика — минус 50% и чужая маржа
Глава Broadcom Хок Тан говорил Bloomberg про примерно 50% экономии на стоимости токена против GPU текущего поколения. Речь про цену токена, а не про операционные расходы вообще — в официальном релизе Broadcom этой цифры нет вовсе. Первые чипы уходят в собственные дата-центры OpenAI до конца 2026 года, полномасштабная рамповка растянута на 2027–2028.
По TCO на токен Jalapeño и Rubin, по расчетам SemiAnalysis, идут примерно вровень. Разница в том, кому достается маржа. У Broadcom как контрактного разработчика она заметно ниже, чем у NVIDIA. Собственно, это и есть весь смысл кастомного ASIC для компании, которая покупает вычисления гигаваттами.
Рынок отреагировал сдержанно. Акции Broadcom 26 августа закрылись на 355,59$, потеряв 0,32%. А NVIDIA в тот же день показала 96,2$ млрд выручки за квартал (+106% год к году), 89 млрд $ в дата-центровом сегменте (+117%), валовую маржу 75% и гайденс на 108 млрд $.
Что это значит
Первое поколение кастомных ускорителей обычно получается неконкурентоспособным — это правило Jalapeño нарушил. Но нарушил в узком классе задач. Это инференс-ASIC и обучать на нем модели никто не собирается. Для тех, кто арендует или покупает GPU, ближайшие последствия не в замене железа, а в давлении на цену. Когда крупнейший потребитель инференса частично уходит на свой кремний, у остальных появляется аргумент в переговорах.
Полноценный технический отчет OpenAI обещает опубликовать в ближайшие месяцы. Как думаете, дождемся мы там результатов на AgentX?

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
Источник: habr.com