25 августа 2026 г.
Qwen3.8-27B тянет домашняя видеокарта: в 4-bit модель занимает 17 ГБ
Веса открыли 14 августа под Apache 2.0, и в 4-bit модель помещается на карту с 24 ГБ.
18 ГБ скачивания — и Qwen3.8-27B отвечает с твоей собственной машины.
Alibaba выложила веса 14 августа на Hugging Face и ModelScope под Apache 2.0, без ограничения по числу пользователей. Модель с картинками и контекстом в 262 тысячи токенов теперь считается не в чужом облаке, а на твоём железе.
Как поставить. Одна команда `ollama run qwen3.8:27b` скачивает 18 ГБ и поднимает модель локально. Она принимает текст и картинки, держит контекст 256 тысяч токенов. Для Apple Silicon в библиотеке Ollama лежит отдельный тег `qwen3.8:27b-mlx`.
Кому нужен сервер, тот ставит vLLM: `pip install vllm`, дальше `vllm serve "Qwen/Qwen3.8-27B"`. Второй путь — SGLang, командой `python3 -m sglang.launch_server --model-path "Qwen/Qwen3.8-27B"`.
Сколько памяти нужно. Цифры из гайда Yotta Labs и разбора Kingy AI (04.08 и 14.08), без учёта кэша контекста, который растёт вместе с длиной запроса.
- **4-bit, GGUF или AWQ** — 14–16 ГБ весов, хватает карты на 24 ГБ вроде RTX 4090 или 5090. - **FP8** — около 28 ГБ, нужна карта класса 48 ГБ. - **BF16, официальный формат** — 51.76 GiB весов плюс минимум 16 GiB под кэш, итого от 68 ГБ, это уровень H100.
Готовый Q4_K_M от Unsloth весит 17.11 ГБ плюс 0.87 GiB на разбор картинок. На карте с 24 ГБ он идёт при умеренном контексте. Полные 262 тысячи токенов на такой карте официальными форматами не помещаются.
Раньше и теперь. Против прошлой Qwen3.6-27B вендор показывает +9.6 пункта на Terminal-Bench, +20.4 на OSWorld и +28.9 на DeepSWE. На той же Terminal-Bench модель отстаёт от Claude Opus 4.8 на 5.2 пункта, от DeepSeek V4 Flash — на 9.7. Независимых воспроизведений на день выхода не было.
Первоисточник