22 августа 2026 г.
Локальная модель тупеет не от весов, а от настроек: INT4 KV-кэш провалил tool call
Одни и те же веса дают разные ответы: четыре настройки инференса меняют токены, и расхождение растёт вместе с контекстом.

Модель на одном и том же промпте отправила команду не на тот интерфейс. Поменяли только attention backend.
Автор замеров на форуме Level1Techs 16.08 разобрал, почему локальная модель «тупеет»: дело не в весах, а в реализации инференса. Источников расхождения четыре: выбор attention backend, квантование KV-кэша, квантование весов и настройки сэмплера. Все они усиливаются с ростом контекста.
Сначала сэмплер. Первое, что советует автор: брать настройки с model card на Hugging Face, temperature 1.0, top-p 0.95, дальше по модели. Слишком низкая temperature и есть причина, по которой Qwen сидит в петле и не может выбраться из собственного THINK-блока.
KV-кэш не жать. В тесте на tool-calling INT8-кэш после ошибки выправлялся, INT4 задачу так и не выполнил, BF16 держался стабильно. По весам хуже всех показал себя NVFP4: только он завалил тот же вызов, а расхождение токенов у него набирается к 88k контекста. FP8, INT8 и AWQ прошли.
Меняет ответ даже разбивка модели по картам. При TP1 вызов проходил, при TP2 ломался, при TP4 снова проходил. Автор списывает это на возможные проблемы NCCL.
Стенд: NVIDIA RTX PRO 6000 Blackwell плюс арендованные H200 и B200, модели Qwen3.6-27B и Qwen3.8-27B, инференс на nightly-сборках vLLM. Мерили долю позиций, где топ-1 токен отличался от эталона, окнами по 8k токенов. За эталон взяли Triton Attention.
В обсуждении на Hacker News 23.08 практики свели рецепт к двум правилам: KV-кэш не квантовать вовсе, по весам не опускаться ниже Q8. Там же советуют вместо Ollama запускать llama.cpp, vLLM или SGLang, на Mac брать MLX: у Ollama отстают фичи и настройки, и модель ведёт себя хуже эталона.
Первоисточник