7 сентября 2026 г.
Gemma 4 ускоряется одним флагом vLLM: замер AMD дал 2,83x на 26B-версии
Один флаг в vLLM ускоряет крупную Gemma 4 в 2,83 раза, а маленькую Qwen3-8B в неудачной настройке замедляет вдвое.

Google обещает Gemma 4 «до 3x быстрее». В замере AMD и vLLM от 23.08.2026 26-миллиардная версия разогналась в 2,83 раза.
Ускорение даёт не новая версия модели, а спекулятивное декодирование. Маленькая модель-драфт пишет несколько токенов вперёд, большая проверяет их одним проходом и оставляет только угаданные.
Включается одним флагом. В vLLM приём поднимает `--speculative-config` у `vllm serve`, методов на выбор четыре: mtp, eagle3, dflash, dspark. Для встроенного MTP отдельный чекпоинт не нужен, хватает названия метода и числа токенов вперёд. Остальные три требуют драфт-чекпоинт под конкретную модель.
Раньше такой драфт приходилось обучать самому. Теперь готовые выкладывают шесть организаций на Hugging Face, включая Google с MTP-ассистентами ко всем пяти размерам Gemma 4 и Red Hat AI с драфтами для Llama, Qwen и GPT-OSS.
Выигрыш упирается в глубину драфта. На той же Gemma 4 с драфтом DFlash лучший результат дал N=7, это 2,87x. При N=15 скорость просела до 2,40x, потому что длинную догадку модель принимает целиком реже: 36% против 61%. Перебирать советуют N=3, 7, 11, 15, а у встроенного MTP начинать с N=1.
Может и замедлить. Qwen3-8B с EAGLE-3 при N=1 выдала 1 563 токена/с против базовых 3 530, вдвое медленнее обычного режима. Драфт угадывал 89% первых токенов, но обходился дороже выигрыша. Маленькой плотной модели приём даёт мало, крупные MoE берут больше: Qwen3.5-122B-A10B на встроенном MTP дала 2,20x.
Все замеры сделаны на датацентровых картах AMD Instinct MI300X и MI355X. На настольной Radeon AI Pro R9700 штатный vLLM выдаёт 20–30 токенов/с против 150–200 на форке Radiance, пишет разработчик под ником intothemild в треде Hacker News 07.09.2026.
Приём не привязан к Gemma: те же четыре метода в vLLM поднимаются на Llama, Qwen и Kimi.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник
