15 августа 2026 г.
Локальная модель дожала код на домашней видеокарте: Qwen3.8-27B взяла 12 задач из 12
На одной RTX 4090 Qwen3.8-27B закрыла 12 задач по коду из 12: её прошлое поколение той же величины взяло 8, Gemma 4 31B — 6.

Одна RTX 4090, три модели около 30B, двенадцать задач по коду. Qwen3.8 не завалила ни одной.
Открытая модель на 27B перестала быть компромиссом по железу: те же 19,0 ГБ видеопамяти на Q4_K_M теперь дают другой результат.
Поколение без роста параметров. Qwen3.6-27B вышла 22 апреля, Qwen3.8-27B — 14 августа. Terminal-Bench 2.1 поднялся с 63,4 до 73,0, LiveCodeBench с 83,9 до 90,3, SWE-bench Pro с 53,5 до 61,7 (canitrun.dev, 19.08).
Обзор kingy.ai от 17 августа прогнал все три модели в Q4_K_M на одной 4090 с Ryzen 9 7950X. На 12 задачах по коду Qwen3.8 прошла 12 из 12, Qwen3.6 остановилась на 8, Gemma 4 31B на 6. Скорость у всех примерно одна: 49 токенов в секунду у обеих Qwen против 45 у Gemma.
На вопросах по документам разрыв ещё резче. Qwen3.8 ответила верно в 23 случаях из 24, Gemma 4 в 22, а Qwen3.6 просела до 8.
Где Gemma не уступает. На многошаговых вызовах инструментов она закрыла 30 сценариев из 30 против 28 у Qwen3.8, и автор обзора оставляет её для картинок и строгих структур ответа.
Порог входа по железу — 24 ГБ: Q4_K_M просит 19,0 ГБ на 8K контекста. На 64K контекста Qwen занимает 20 266 MiB и оставляет 4,2 ГиБ запаса, а Gemma 4 31B с F16 K/V падает в CUDA OOM и влезает только с Q8_0 K/V.
Как поставить. Через llama.cpp одной строкой: `./llama-server -hf unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL -c 65536 -ngl 99`. На сервере Qwen предлагает `pip install vllm && vllm serve "Qwen/Qwen3.8-27B"`. Веса лежат на Hugging Face, официального тега в Ollama на старте нет.
первоисточник