16 сентября 2026 г.
Vera Rubin вышла вперёд в инференсе: до 3,7 раза выше throughput в MLPerf
В первом preview-раунде MLPerf Inference v6.1 Vera Rubin NVL72 показала до 3,7 раза больший throughput, чем GB300 NVL72, 16 сентября 2026 года. На Qwen3-VL преимущество сохранилось в offline, server и interactive-сценариях с vLLM и NVIDIA Dynamo, а на DeepSeek-R1 составило 2,5 раза с TensorRT-LLM. Результат NVIDIA получен на связке железа и оптимизированного ПО.

MLPerf Inference v6.1 собрал 30 организаций и добавил тесты End-to-End RAG и Edge Agentic Inference. NVIDIA Rubin и Vera Rubin NVL72 вошли в раунд как preview-платформы.
**Проверка по моделям.**
- Qwen3-VL: Vera Rubin NVL72 показала до 3,7 раза больший throughput в offline, server и interactive-сценариях с vLLM и NVIDIA Dynamo. - DeepSeek-R1: преимущество Vera Rubin NVL72 достигло 2,5 раза с TensorRT-LLM. - GB300 NVL72: четыре стойки с 288 GPU показали 99% scaling efficiency на DeepSeek-R1 в offline-сценарии.
ПО меняет счёт. Относительно MLPerf Inference v6.0 оптимизации подняли результат GB300 NVL72 на Qwen3-VL до 1,6 раза. NVIDIA перечисляет lower KV-cache precision, kernel fusion, улучшенные kernels и disaggregated serving через vLLM и Dynamo.
В submission Vera Rubin NVL72 использовали разделение prefill и decode и large-scale expert parallelism. NVFP4 уменьшает объём памяти под веса модели, attention и KV cache.
Связь тоже важна. NVIDIA заявляет для шестого поколения NVLink и NVLink Switch 10-кратно более высокую packet rate и в 3 раза меньшую задержку по сравнению с обычным Ethernet.
На WAN 2.2 одна стойка GB300 NVL72 достигла 0,65 видео 720p в секунду при 5,7 секунды на видео. Это в 9 раз выше throughput и в 7,5 раза ниже latency, чем у одного узла.
Связку можно поднять локально. Доки NVIDIA предлагают создать Python 3.12 venv и установить Dynamo с vLLM:
```bash uv venv --python 3.12 --seed uv pip install "ai-dynamo[vllm]" ```
Доступен и контейнер `nvcr.io/nvidia/ai-dynamo/vllm-runtime:<version>`. Локальная схема использует frontend на OpenAI-compatible API с портом 8000 и worker `python -m dynamo.vllm --model $MODEL`; в guide указан `Qwen/Qwen3-0.6B`.
В этом раунде NVIDIA сравнивает не отдельный ускоритель, а связку GPU, NVLink и serving через vLLM, Dynamo или TensorRT-LLM.
Первоисточник
