24 августа 2026 г.
Самая быстрая генерация на Gemma 4 31B: 3400 токенов в секунду на стойке NVIDIA
Стойка NVIDIA Groq 3 LPX пошла в серию 24.08.2026, и на Gemma 4 31B замер дал 3400 токенов в секунду.

3400 токенов в секунду на Gemma 4 31B при контексте в 100 000 токенов: вчетверо быстрее ближайшей платформы.
Столько дала стойка, где работу поделили: GPU Vera Rubin принимают контекст и считают prefill, а чипы LP30 занимаются только генерацией токенов.
Раньше и теперь. В марте NVIDIA обещала для Vera Rubin NVL72 вдесятеро больше инференса на ватт и десятую часть стоимости токена против Blackwell. Теперь к платформе добавили отдельную стойку под генерацию: до 256 ускорителей LP30, узел на 16 LPU в 2U с жидкостным охлаждением. На агентском кодинге со 140K контекста компания заявляет до 30 раз больше токенов на мегаватт, чем у GB300 NVL72.
Как попробовать. Доступ раздаёт Nebius Token Factory, и подключение сводится к смене имени модели в уже работающем API: ни нового SDK, ни нового вендора, ни отдельного биллинга. Вход через studio.nebius.ai. Работает пока не вся линейка моделей, а цену за токен Nebius не называет.
Замеры сделаны в разных условиях: свою цифру NVIDIA сняла 21.08.2026 на приватном пре-релизном эндпоинте, а конкурентов Artificial Analysis мерила на живых продакшен-эндпоинтах.
Сторонние замеры появятся, когда Nebius откроет Groq 3 LPX за пределами первой подборки моделей.
Первоисточник