26 августа 2026 г.
Железо для агентов меряют трейсами Claude Code: NVIDIA заявила 30x токенов на мегаватт
Vera Rubin выдаёт до 30 раз больше токенов на мегаватт, чем GB300. Завершённые задачи бенчмарк не считает.

Бенчмарк агентов собрали из 393 реальных сессий Claude Code. NVIDIA прогнала на нём Vera Rubin.
Трейсы анонимизировали и пересобрали: контекст до миллиона токенов, многоходовые сессии с сабагентами, повторное чтение KV-кэша с попаданием 95% и выше. SemiAnalysis назвала сценарий AgentX и открыла его под Apache-2.0.
Раньше мерили короткими запросами. Стандартная схема замера серверов гоняла 8 тысяч токенов на вход и тысячу на выход. Живая агентная сессия устроена иначе: медиана входа 88 тысяч токенов, у длинных 272 тысячи, приемлемая задержка первого ответа для прода от 200 до 5000 мс.
На этом сценарии NVIDIA заявляет для Vera Rubin NVL72 до 30 раз больше токенов на мегаватт, чем у GB300 NVL72, на модели DeepSeek V4-Pro. Выигрыш растёт вместе с отзывчивостью: 2 раза при 110 токенах в секунду на пользователя, 10 раз при 130, 30 раз при 160. Миллион токенов по тем же расчётам выходит в 35 раз дешевле. Замеры делала сама NVIDIA, в блоге от 24.08.2026 стоит пометка pending SemiAnalysis review, а работа CPU Vera на вызовах инструментов в цифрах ещё не отражена.
Прирост компания объясняет не одним чипом: MoE-рантаймы SGLang, TensorRT-LLM и vLLM, разнесение prefill и decode в NVIDIA Dynamo, ядра DeepGEMM, форматы MXFP4/MXFP8.
Токен не равен сделанной задаче. SemiAnalysis оговаривает границу метрики сама: бенчмарк сохраняет структуру токенов и кэша, но не смысл текста. Промпты в трейсах синтезированы, прочитать их нельзя, поэтому качество и завершённость работы AgentX не меряет. Сколько задач доехало до принятого результата на мегаватт-час, сколько сгорело на повторах и на ревью человеком, из этих цифр не видно. Система, которая эффективнее гонит токены, так же эффективно гонит и брак.
Прогнать AgentX у себя можно открытым клиентом NVIDIA AIPerf: `pip install aiperf`, дальше `aiperf profile --scenario inferencex-agentx-mvp --model deepseek-ai/DeepSeek-V4-Pro --max-context-length 128000 --concurrency 32 --benchmark-duration 1800`. Нужен OpenAI-совместимый сервер и токенайзер с HuggingFace, корпус трейсов скачивается сам. Каждая точка на дашборде InferenceX ссылается на публичный прогон GitHub Actions.
Первоисточник