14 августа 2026 г.
Домашняя видеокарта тянет Qwen3.8-27B: 18 GB весов и одна команда запуска
Alibaba выложила Qwen3.8-27B с открытыми весами 14 августа: в 4-bit модель влезает в 16 GB видеопамяти.

27 миллиардов параметров и 18 GB на диске: Qwen3.8-27B ставится одной командой.
Порог локального запуска упал до домашней видеокарты. Практики в r/ArtificialInteligence пишут, что новая модель закрывает им задачи, ради которых они платили за подписки.
Как поставить. `ollama run qwen3.8` поднимает тег 27b: 18 GB весов, окно 256K, на вход текст и картинки, глубина рассуждения задаётся параметром reasoning_effort. Официальные веса лежат на Hugging Face как Qwen/Qwen3.8-27B. Для сервера ставится vLLM командами `pip install vllm` и `vllm serve "Qwen/Qwen3.8-27B"`, а для llama.cpp и LM Studio карточка модели предлагает 547 готовых квантизаций.
Сколько нужно видеопамяти. В полной точности BF16 модель просит около 56 GB, в FP8 около 28 GB, в 4-bit 14–16 GB (Yotta Labs, 04.08). Сверху ложится KV-кэш, и он растёт с длиной контекста. На 24 GB RTX 4090 полная точность не помещается, работает только 4-bit, и сжатая сборка отвечает иначе, чем полная. Файл Q4_K_M весит 17,8 GB против 54,7 GB у полного BF16 (Kingy AI, 17.08).
Прошлая Qwen3.6-27B брала 53,5 на SWE-bench Pro, новая берёт 61,7. На QwenSWEBench разрыв шире: с 49,3 до 79,0 (Kingy AI, 17.08). На терминальных задачах Terminal Bench 2.1 модель отстаёт от Opus 4.6 Max, 73,0 против 78,2.
Скорость решает железо. На RTX 5090 замерили 206 токенов в секунду, на ноутбучном процессоре у сообщества выходит около 4 токенов в секунду, медленнее, чем человек читает вслух.
Дальше порог локального запуска двигает не модель, а объём видеопамяти на столе.
первоисточник