25 августа 2026 г.
Генерация у AI-агентов ускорилась вчетверо: NVIDIA пустила Groq 3 LPX в серию
3400 выходных токенов в секунду на Gemma 4 31B: у Cerebras на том же тесте вышло 882.

Один тест, одна модель, один контекст. У Cerebras 882 токена в секунду, у нового чипа NVIDIA 3400.
Artificial Analysis прогнала Gemma 4 31B со 100 тысячами токенов контекста. Groq 3 LPX выдал 3400 выходных токенов в секунду, Cerebras на том же тесте 882. NVIDIA называет свой результат вчетверо быстрее ближайшей альтернативной платформы.
24 августа NVIDIA объявила Groq 3 LPX в серийном производстве. Первый клиент — Nebius. Чип идёт расширением платформы Vera Rubin, и затачивали его под нагрузки AI-агентов.
Подключается сменой модели. Попробовать LPX можно через Nebius Token Factory: API тот же, что уже используется, переезжать со своим стеком никуда не надо. Регистрация на studio.nebius.ai, документация на docs.nebius.ai/studio/inference.
На старте на LPX работает только часть моделей. Из агентской обвязки уже есть вызов функций, ответы структурированным JSON и встроенные ограничители, а выделенные endpoints обещают задержку меньше секунды.
За скорость платят масштабом. Рекордный замер NVIDIA снимала минимум с 64 LPU, тогда как Cerebras обходится одним-двумя ускорителями CS-3. Под DeepSeek V3 понадобилось бы 1342 чипа, чуть больше пяти стоек LPX. Стойка держит 256 связанных чипов и контекст до 400 тысяч токенов, а цену и энергопотребление NVIDIA не называет.
Год назад Groq была отдельным стартапом. В декабре 2025 NVIDIA заплатила $20 млрд не за компанию, а за лицензию на технологию плюс наём основателя Джонатана Росса и президента Санни Мадры. Теперь в связке Vera Rubin NVL72 видеокарты разбирают контекст, а LPU гонят генерацию: NVIDIA заявляет до 35 раз больше токенов на мегаватт против GB200 NVL72.
Первоисточник