26 августа 2026 г.
Модель из топа рейтингов теперь можно поднять у себя: Z.ai раскрыла Ox Alpha и открыла веса
Ox Alpha оказалась GLM-5.3-Flash: веса уже на Hugging Face под MIT, а вход по API дешевле старшей GLM-5.3 примерно в 19 раз.

С 20 августа на OpenRouter отвечала модель без имени: слаг `stealth/ox-alpha`.
За стелс-период она пропустила через себя 62 трлн токенов, 11 трлн из них за первые три дня (South China Morning Post, 27.08). Считала её ферма из 100 000 китайских чипов. 26 августа Z.ai призналась в авторстве: под маской работала GLM-5.3-Flash.
Раскрытие даёт практику две вещи сразу: веса лежат на Hugging Face под лицензией MIT, а по API вход стоит примерно в 19 раз дешевле старшего GLM-5.3.
Цена со скидкой. Flash берёт $0.075 за 1M входных токенов, $0.015 за кэшированный вход и $0.25 за 1M выходных (прайс Z.ai, 26.08). Это половина листовой цены, промо действует до 9 сентября 2026.
Как поднять у себя
Через vLLM хватает двух команд: `pip install vllm && vllm serve "zai-org/GLM-5.3-Flash"`. Тот же вес поднимает SGLang командой `python3 -m sglang.launch_server --model-path "zai-org/GLM-5.3-Flash" --host 0.0.0.0 --port 30000`.
Через API. Модель зовётся `glm-5.3-flash`, вендор советует ставить `reasoning_effort: max`. Рассуждения не отключаются, `thinking.type` принимает только `enabled`. Подписчикам GLM Coding Plan Flash даёт втрое больше квоты, чем GLM-5.3.
Что намерили
Карточка модели даёт 84.3 на Terminal Bench 2.1, 63.4 на Deep SWE и 55.3 на HLE (26.08). У прошлого GLM-5.2 на Deep SWE было 46.2, AutomationBench подрос с 26.2 до 48.8 (TestingCatalog, 26.08).
MoE на 320B параметров, на запрос просыпаются 18B, поэтому гигант отвечает по цене середняка. Окно 1 048 576 токенов, на вход модель берёт текст, картинки и видео.
Первоисточник