Открытая агентная модель Meta помещается в обычную видеокарту: квант Muse Glimmer весит 17 ГБ
источник: reddit.com·
машинная выжимка · сверена с источником

Meta выложила Muse Glimmer под Apache 2.0: 30 млрд параметров, заточка под агентскую работу и код, картинки на входе, контекст 131 тысяча токенов (10.08). Четырёхбитный квант весит 17 ГБ и работает на одной обычной видеокарте. На RTX 5090 со спекулятивным декодированием модель выдаёт 233 токена в секунду, в 3,1 раза быстрее обычного.
Раньше выбор был жёстче. Открытые модели с агентскими навыками либо упирались в серверное железо, либо проседали на задачах с инструментами. Muse Glimmer набирает 75,5 балла на агентском MCP Atlas против 54,2 у Gemma4-31B и 62,5 у Qwen3.6-27B, на SWE-Bench Verified берёт 76% (замеры Meta, 10.08).
Как запустить у себя. На Apple Silicon хватает одной команды: `ollama run muse-glimmer:30b-mlx`. Поддержку NVIDIA и AMD в Ollama обещают в ближайшие дни, а через llama.cpp модель уже идёт с GGUF-квантами Unsloth. Памяти нужно от 12 ГБ в 2-битном кванте до 58 ГБ за полный BF16.
Комплект открыт целиком: веса, оба 4-битных кванта, драфтер DFlash и энкодер картинок. Ставить у себя не хочется - на OpenRouter модель стоит $0,35 за миллион входных токенов и $1,50 за миллион выходных (11.08).
В эссе при релизе Цукерберг обещает открыть веса Muse Spark 1.2 в ближайшие недели.
первоисточник