Модель с SWE-Bench 76 теперь запускается на своём железе: Meta выложила веса Muse Glimmer
источник: arstechnica.com·
машинная выжимка · сверена с источником

Модель уровня SWE-Bench Verified 76,0 помещается в 20 ГБ памяти. 10 августа 2026 Meta выложила под Apache 2.0 веса Muse Glimmer на 30 млрд параметров, дистиллят своей закрытой модели Muse Spark. В полной точности Glimmer просит больше 55 ГБ, в 4-битном кванте меньше 20 ГБ, так что вместе с кэшем и энкодером зрения укладывается в 24-32 ГБ памяти MacBook M4-Max или RTX 5090.
Разворот стратегии. После провала Llama 4 Meta закрыла модели и продавала доступ к Muse Spark по API. Теперь та же линейка раздаётся бесплатно, а Apache 2.0 разрешает и коммерческое использование, и дообучение под себя.
Ставится одной командой. `ollama run muse-glimmer`. На Apple Silicon есть отдельный тег `muse-glimmer:30b-mlx` под движок MLX, поддержку NVIDIA и AMD в Ollama обещают в ближайшие дни. Через llama.cpp модель поднимается командой `llama serve -hf meta-models/Muse-Glimmer-30B-GGUF`, для vLLM в блоге Hugging Face дан свой рецепт с `--tensor-parallel-size 4`.
Скорость вытягивает драфтер DFlash: на RTX 5090 генерация ускоряется в 3,1 раза, на M5-Max в 1,8, на M4-Max в 1,5. У модели четыре уровня рассуждения от low до xhigh. Для кода и агентских задач Meta советует high или xhigh, ниже ставят, когда важнее скорость.
Считать теперь можно на своём железе. Закрытая Muse Spark 1.2 стоит $1.25 за миллион входных токенов и $4.25 за миллион выходных, при этом расход токенов у неё вырос на 53% на входе против версии 1.1, так что счёт за ту же задачу подрос при неизменном тарифе.
Глава Meta Superintelligence обещал открыть веса и старшей Muse Spark 1.2 - тогда локально поедет вся линейка.
первоисточник