17 августа 2026 г.
Модель с домашней видеокарты догнала топ индекса: Qwen3.8-27B и GPT-5.6 Luna по 52 балла
Qwen3.8-27B набрала в индексе Artificial Analysis 52 балла: ровно столько же у GPT-5.6 Luna с первого места. Веса открыты.

Cline
@cline
Artificial Analysis Intelligence Index ставит Qwen3.8-27B вровень с DeepSeek V4-Pro и GPT 5.6 Luna. Локальная модель впервые дотянулась до уровня топовых. Мы не ждали, что локальные модели дойдут до этого так скоро.

· 3,7 тыс. просмотров
Самый умный уровень моделей больше не требует облака: 27,78 млрд параметров влезают в видеокарту на 24 ГБ.
Раньше верх индекса держали закрытые модели в чужом API: платишь за токены и ждёшь ответа снаружи. Теперь те же 52 балла показывает модель, которую Alibaba выложила весами 14 августа под лицензией Apache 2.0.
Индекс Artificial Analysis, август 2026 - Qwen3.8-27B: 52 балла. Self-host, $0 за 1M токенов - GPT-5.6 Luna (max): 52 балла, 1-е место из 165 моделей. $0,20 вход и $1,20 выход за 1M токенов - DeepSeek V4 Pro 0813 (max): 53 балла. $0,69 за 1M токенов в смешанной цене
Индекс считает сторона. Свои цифры по Terminal-Bench 2.1 (73,0) и SWE-bench Pro (61,7) Qwen мерила сама.
Что нужно из железа. Квант Q4_K_M весит 15,93 ГиБ и влезает в карту на 24 ГБ. Unsloth рекомендует сборку UD-Q4_K_XL, ей нужно от 17 до 19 ГБ видеопамяти и оперативки вместе. Полный контекст на 262 144 токена добавляет сверху около 16 ГиБ на KV-кеш.
Ставится одной командой. Веса лежат на Hugging Face в репозитории Qwen/Qwen3.8-27B, сервер поднимается через `pip install vllm && vllm serve "Qwen/Qwen3.8-27B"`. Для домашней машины Unsloth собрал GGUF под llama.cpp с параметрами --temp 1.0 --top-p 0.95 --top-k 20.
Cline с локальной моделью просит трёх настроек: провайдер LM Studio, окно контекста руками на 262 144 токена, включённый Use compact prompt. Компактный промпт занимает около 10% от полного, но отключает MCP-инструменты. KV Cache Quantization в LM Studio выключается.
первоисточник