24 августа 2026 г.
llama.cpp теперь развивают внутри Hugging Face: команда GGML перешла в компанию 24 августа
Движок локального запуска и площадка, откуда качают веса, оказались под одной крышей.

Модель на 744 млрд параметров заводится на одной настольной машине: две команды в терминале, и GLM-5.3 отвечает локально.
Запускает её llama.cpp. 24 августа команда GGML, которая делает этот движок, перешла в Hugging Face — туда, откуда качают сами веса.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Теперь и веса, и движок, который их читает, живут в одной компании. Локальный запуск открытых моделей держится ровно на этой паре.
Что нужно на своей машине. Двухбитная сборка GLM-5.3 от Z.ai занимает 239 ГБ на диске и просит 245 ГБ памяти — в доках Unsloth от 28.08.2026 её гоняют на Mac Studio с 256 ГБ RAM или на связке из двух DGX Spark. Качают командой `hf download unsloth/GLM-5.3-GGUF`, запускают через `llama.cpp/llama-cli`.
Цена сжатия. Чем сильнее ужимаете веса, тем больше теряете. Двухбитная версия держит около 79% точности, четырёхбитная — 94,29%, но весит уже 372–475 ГБ. Кеш контекста жмётся отдельно: в q4_1 в память влезает примерно в 3,2 раза более длинный диалог, чем в дефолтном f16.
Своего железа под 245 ГБ нет. На арендованном сервере та же модель поднимается двумя строками: `pip install vllm` и `vllm serve zai-org/GLM-5.3`. По API Z.ai берёт $1,40 за входной миллион токенов и $4,40 за выходной.
Раньше эти две части делали разные люди: веса выкладывали на Hugging Face, читать их учил отдельный проект. Теперь это одна компания.
Ближайшая проверка — следующий крупный релиз открытых весов, где GGUF-сборки могут появиться рядом с ними сразу.
Первоисточник