26 августа 2026 г.
У Nvidia появился конкурент внутри OpenAI: Jalapeno выдаёт до 1,9 раза больше токенов на киловатт
Цифры дала сама OpenAI: сторонних замеров Jalapeno нет, и снаружи их сделать нельзя.

На GPT-OSS 120B чип OpenAI выдал 85 448 токенов в секунду на киловатт. У Nvidia GB200 на той же модели 44 960.
Электричество и есть главная статья расходов инференса, поэтому счёт в токенах на киловатт решает, во сколько компании обходится каждый ответ модели.
Замер сделала заинтересованная сторона. Все числа предоставила OpenAI по бенчмарку InferenceX (26.08). SemiAnalysis полный набор не прогоняла, тесты шли на инженерном кремнии, и повторить сторону Jalapeno вне OpenAI не может никто.
Что намерили (данные OpenAI, 26.08, профиль теста 8k входных и 1k выходных токенов):
- GPT-OSS 120B против GB200: 85 448 против 44 960 токенов/с на киловатт, задержка 1,03 против 1,80 секунды - DeepSeek R1 670B против GB300: 19 641 против 11 781 токенов/с на киловатт, задержка 1,65 против 5,99 секунды - Kimi K2.5 1T против GB300: 18 195 против 11 862 токенов/с на киловатт, задержка 1,56 против 5,31 секунды
Паспортная мощность Jalapeno 700 Вт, под тестовой нагрузкой чип не поднимался выше 550 Вт. У GB200 в паспорте 1200 Вт, у GB300 1400 Вт.
Экономия из двух ходов. Числа для расчётов сжаты до 4 бит форматом MXFP4. Веса лежат неподвижно в самой вычислительной сетке, и данные текут от ячейки к ячейке, а не гоняются туда-обратно во внешнюю память, где обычный процессор упирается в узкое место.
На Hot Chips 2026 OpenAI показала паспорт кристалла: 13,4 PFLOP/s матричных вычислений в MXFP4, 216 ГиБ памяти HBM4 и 15,4 ТБ/с пропускной способности при 700 Вт. В один домен собирается до 2048 чипов, это 27 EFLOP/s и 432 ТиБ памяти на коммутаторах Broadcom Tomahawk6.
Первоисточник