25 августа 2026 г.
Модели отвечают вчетверо быстрее: Nvidia начала выпускать ускорители Groq 3 LPX
Nvidia обещает 3400 токенов в секунду на Gemma 4 31B, вчетверо больше ближайшей платформы, и первые такие чипы уже сдаёт в аренду Nebius.

В декабре 2025 Nvidia заплатила $20 млрд за чужую технологию. Через восемь месяцев чипы пошли с конвейера Samsung.
Groq 3 LPX затачивали не под обучение моделей, а под скорость ответа. Это та самая пауза, пока модель печатает текст тебе в чат или в агента.
Замер такой. 3400 токенов в секунду на Gemma 4 31B при контексте в 100 000 токенов, вчетверо больше ближайшей альтернативной платформы (бенчмарк Artificial Analysis, пресс-релиз NVIDIA, 24.08.2026).
Раньше Groq продавал свою скорость сам, как независимый стартап. Теперь его технологию лицензировала Nvidia, а основатель Джонатан Росс, создатель Google TPU, ушёл туда вместе с инженерным ядром. Лицензия неэксклюзивная: сам Groq вместе с Dell тоже везёт LPX в своё облако.
Взять можно уже сейчас. Первым чипы поставил неоклауд Nebius Аркадия Воложа: в Nebius Token Factory Groq 3 LPX выбирается как ещё одна опция поверх тех же API, переписывать код не нужно. Регистрация на studio.nebius.ai, доки лежат на docs.nebius.ai/studio/inference (блог Nebius, 24.08.2026).
Ускоряется при этом не весь инференс: тяжёлый разбор запроса остаётся на GPU, LPX включается только на генерации. И замер снят на модели в 31B, которая укладывается в 64 ускорителя, а модель уровня DeepSeek V3 потребовала бы 1342 чипа, чуть больше пяти стоек (разбор The Register, 24.08.2026).
Следом в ранних развёртываниях объявлены CoreWeave и SpaceXAI, а Groq вместе с Dell везёт те же чипы в GroqCloud.
Первоисточник