26 августа 2026 г.
Свой чип OpenAI оказался экономнее ускорителей Nvidia: 1.9 раза по токенам на киловатт
Jalapeño выдал 85 448 токенов на киловатт против 44 960 у GB200, и все числа для замера предоставила сама OpenAI.
Девять месяцев от первой схемы до готового кристалла: 25 августа OpenAI выложила первые замеры.
Раньше компания просто покупала ускорители Nvidia под инференс ChatGPT. Теперь она меряет собственный кремний против них на публичном бенчмарке и показывает числа.
Замер. На InferenceX Jalapeño выдал в 1.5–1.9 раза больше токенов на киловатт, чем системы GB200 и GB300, и отвечал в 1.7–3.6 раза быстрее. На DeepSeek R1 670B это 19 641 токен на киловатт против 11 781 у GB300 при задержке 1.65 секунды против 5.99.
Выигрыш складывается из питания. Паспортное потребление Jalapeño составляет 700 Вт на пакет, в замере кристалл держался на 550 Вт и ниже. У GB300 на один ускоритель приходится 1400 Вт.
По заголовкам разошлась цифра 104x: в точке низкой задержки на том же DeepSeek R1 чип дал 12 258 токенов на киловатт против 118. Это верхняя точка разрыва, а не типичный режим.
Чьи числа. SemiAnalysis, чей бенчмарк использовали для замера, оговаривает: все числа предоставила OpenAI, лаборатория проверила прогоны InferenceX сама, но полный набор не гоняла. Результатов AgentX, профиля с длинным контекстом и многоходовостью, который аналитики считают ближе к боевой нагрузке, пока нет.
Сравнение асимметрично и по настройкам: Jalapeño мерили без speculative decoding, а у Vera Rubin оно включено и даёт 3–5x по стоимости за токен. Честным соперником по поколению SemiAnalysis называет не Blackwell, а Vera Rubin на HBM4.
Поставить или включить Jalapeño нельзя. Чип спроектирован под собственный инференс OpenAI: это не облачный инстанс и не отдельный тип машин для внешних разработчиков, давних партнёров по железу он не заменяет.
Первоисточник