26 августа 2026 г.
Qwen3.8-Flash-Next можно поставить у себя: 62,5 против 53,4 у Opus 4.6 на SWE-bench Pro
Alibaba выложила веса 26.08: в модели 125B параметров, но на каждый токен работают 6B.

Qwen
@alibaba_qwen
⚡Знакомьтесь: Qwen3.8-Flash, мультимодальная MoE и ранний превью архитектуры Qwen4, теперь с открытыми весами! Production-версия Qwen3.8-Flash скоро появится в QwenCloud API — всего $0,16 за 1M входных токенов и $0,47 за 1M выходных. 125B параметров + 51B n-gram embeddings, при этом на токен активируются всего 6B. Непревзойдённая экономичность. Что нового: 🥳 - Архитектура следующего поколения: гибридное внимание GDN + QSA, Gated Residual, N-gram Embedding и оптимизатор Muon — предвестники той архитектуры, что пойдёт в Qwen4. - Резко дешевле обучение и инференс: обучили за 1/9 стоимости Qwen3.7-Plus, и при этом обходим её по всем направлениям, особенно сильный прирост в коде и офисных задачах. - Сильные результаты: 58.7 на DeepSWE 1.1, 62.5 на SWE-bench Pro, 73.9 на CoWorkBench, 84.5 на AndroidWorld и 95.7 на MathVision (с CI). - 262K нативного контекста, расширяется до 1M через YaRN. Мы также выкладываем веса Qwen3.8-Flash-Next — сообщество сможет заранее посмотреть на новую архитектуру, которую мы готовим для Qwen4.🚀 Ждём не дождёмся, что вы соберёте на Qwen3.8-Flash!👀👇 - Блог: https://qwen.ai/blog?id=qwen3.8-flash-next - Технический отчёт: https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf - Hugging Face: https://huggingface.co/Qwen/Qwen3.8-Flash-Next - ModelScope: https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
58,7 против 16,5 на DeepSWE 1.1, замере агентной починки багов: так новая модель Qwen оторвалась от прошлой.
Разрыв в три с половиной раза за один шаг линейки — редкость, и веса этой модели лежат открыто. 26 августа на Hugging Face появились репозитории Qwen/Qwen3.8-Flash-Next и Qwen/Qwen3.8-Flash-Next-FP8 под лицензией qwen-community-1.0, за первые часы их скачали около 2,95 тыс. раз.
Чем платят за дешевизну. В модели 125B параметров и ещё 51B n-gram embeddings, но на каждый токен просыпаются 6B. Обучение обошлось Alibaba в девять раз дешевле, чем Qwen3.7-Plus. Отсюда и обещанная цена в QwenCloud API: $0,16 за миллион входных токенов и $0,47 за миллион выходных, доступность названа словом «soon» — на страницах Alibaba Cloud этого прайса пока нет.
SWE-bench Pro, починка багов в живых репозиториях: - Qwen3.8-Flash-Next — 62,5 - Qwen3.8-27B — 61,7 - Qwen3.7-Plus — 55,8 - Claude Opus 4.6 — 53,4
Поднимается одной командой. Для vLLM это `pip install vllm`, дальше `vllm serve "Qwen/Qwen3.8-Flash-Next"`. У SGLang своя строка: `python3 -m sglang.launch_server --model-path "Qwen/Qwen3.8-Flash-Next"`. Для продакшна карточка модели советует SGLang, vLLM или KTransformers вместо голых transformers.
Контекст из коробки — 262 144 токена. Миллион включается руками: в config.json в блоке rope_parameters выставляются `rope_type: yarn` и `factor: 4.0`, потом сервер стартует с `--max-model-len 1000000` в vLLM или `--context-length 1000000` в SGLang.
Сборки для слабого железа уже делает сообщество. GGUF от unsloth ещё догружается, рядом лежат FP8 и NVFP4-варианты от RadixArk и Inferact, а карточка Qwen называет llama.cpp, Ollama, LM Studio и Jan.
Production-версию обещают в QwenCloud API «soon» — тогда заявленные $0,16 за миллион токенов проверятся счётом.
Первоисточник
