29 августа 2026 г.
DeepSeek V4 поднимается на своём железе целиком: vLLM довёл sparse MLA до спекулятивного декода
Заодно Kimi-K3 разогнали в 1,5–3 раза на уровне ядер, а шардинг общего эксперта освобождает около 17 GiB на каждой карте.

Апгрейд до vLLM 0.28.0 не бесплатный: bitsandbytes уехал из ядра в отдельный плагин.
Релиз вышел 26.08 и собран из 584 коммитов от 270 контрибьюторов, 76 из них пришли впервые. Вместе с новыми моделями он переставляет дефолты, на которых крутились прежние запуски.
Кроме bitsandbytes, из vLLM удалили рантайм-расчёт KV-масштабов `calculate_kv_scales` и флаг `override_attention_dtype`. Метрики KV-офлоада переименованы с `kv_offload_tiering_block_{queries,hits}` на `..._chunk_...`, так что панели мониторинга придётся править руками.
Дефолты сдвинулись. Раньше vLLM набивал пачку до 8192 токенов за проход. Теперь `max_num_batched_tokens` по умолчанию стоит на 16384. У Mamba-моделей prefix caching включён с порога, а на картах Blackwell захват CUDA graph по умолчанию поднят до 1024.
Большие модели поехали. У DeepSeek V4 sparse MLA работает целиком: обычный декод, MTP и спекулятивное декодирование DSpark. Под Kimi-K3 объединённые all-gather дают ускорение в 1,5–3 раза на уровне ядер, а адаптивный бюджет спекулятивных токенов улучшает время до первого токена примерно на 60% на DSpark.
Как поставить. `pip install vllm` тянет колесо под CUDA 13.0. Для другого бэкенда есть `uv pip install vllm --torch-backend=auto`, под ROCm колесо ставится с отдельного индекса `wheels.vllm.ai/rocm/0.28.0/rocm722`. В докере лежит `vllm/vllm-openai:v0.28.0` плюс образы под ROCm, CPU и XPU, рантайм переехал на Ubuntu 24.04.
Список поддержки пополнили Muse Glimmer, Ling 3.0 Flash в BF16 и FP8 и мультимодальный Dots3 NOTE. Заодно закрыта DoS-дыра, через которую подделанный sample rate обходил лимит длительности декода аудио.
Первоисточник