26 августа 2026 г.
Qwen3.8-Flash считает в 12 раз дешевле флагмана: $0,16 за миллион входных токенов
Alibaba открыла веса Qwen3.8-Flash: по замерам компании модель обгоняет старшую Qwen3.7-Plus и стоит в 12 раз дешевле.

Alibaba просит за миллион входных токенов $0,16, за миллион выходных — $0,47. Флагман той же компании берёт в 12 раз больше по обеим статьям.
Дешёвый вариант раньше означал слабый. Теперь Alibaba заявляет результаты выше Qwen3.7-Plus, у которой 397 млрд параметров против 125 млрд, а обучение новой модели обошлось примерно в девять раз дешевле.
Как устроено. Внутри работает MoE: на каждый токен просыпаются только 6 млрд параметров из 125 млрд, поэтому гигант отвечает по цене середняка. Отдельный слой n-gram-эмбеддингов на 51 млрд параметров хранит частые словосочетания записями и может лежать в обычной системной RAM, а не в видеопамяти. Окно контекста — 262 144 токена, через YaRN растягивается до миллиона.
Замеры пока только вендорские: SWE-bench Pro 62,5, LiveCodeBench v6 91,9, GPQA Diamond 91,7, DeepSWE 1.1 58,7.
Поставить у себя можно. Веса раздают на Hugging Face и ModelScope, есть готовый FP8-вариант. Локально модель поднимается одной строкой: `ollama run hf.co/unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL`. Кванты весят от 72,5 ГБ у однобитного до 111 ГБ у четырёхбитного, так что железо нужно серверное.
На сервере запуск идёт через vLLM: `vllm serve Qwen/Qwen3.8-Flash-Next --port 8000 --tensor-parallel-size 4 --max-model-len 262144`. API поднимается совместимым с OpenAI, поэтому код клиента переписывать не придётся. Альтернатива — SGLang с теми же параметрами.
Веса раздали 26.08.2026, независимые замеры появятся с первыми сторонними прогонами.
Первоисточник