Модель под кодинг-агента теперь можно гонять у себя: Meta выложила Muse Glimmer-30B, хватает 17 ГБ памяти
источник: Meta AI·
машинная выжимка · сверена с источником

Meta 10 августа выложила веса Muse Glimmer-30B на Hugging Face под лицензией Apache 2.0: 29,6 млрд параметров, на входе текст и картинки. Модель запускается локально одной строкой ollama run muse-glimmer:30b-mlx, отдельная команда подставляет её в кодинг-агентов Claude Code, pi, openclaw и hermes. Четырёхбитному кванту хватает 17 ГБ памяти, это уровень Mac с 32 ГБ.
Ставится в одну строку. Ollama пока крутит модель только через MLX на Apple Silicon. Видеокарты берёт llama.cpp с GGUF-квантами: двухбитному хватает 12-14 ГБ, это уровень RTX 4080, полному BF16 нужно 58 ГБ. Для сервера есть vLLM, из хостингов модель подхватили Together AI, Fireworks AI и OpenRouter.
По коду не рекорд. Glimmer обучен логит-дистилляцией из старшей Muse Spark. Meta заявляет 76,0 на SWE-Bench Verified и 94,7 на AIME 2026, но Qwen3.6-27B впереди: 77,2 на том же SWE-Bench и 60,7 против 51,7 на TerminalBench 2.1.
Без своего железа модель доступна по API: OpenRouter берёт $0,35 за миллион входных токенов и $1,50 за миллион выходных (цены на 09.08). Контекст по умолчанию 131 тысяча токенов, максимум 262 тысячи, уровней рассуждений четыре - от low до xhigh.
Ollama обещает поддержку NVIDIA и AMD в ближайшие дни: однострочный запуск доедет и до видеокарт.
первоисточник