26 августа 2026 г.
GLM-5.3-Flash умна почти как старшая модель: задача обходится в 7,5 раза дешевле
57 баллов против 60 у GLM-5.3, но одна задача замера стоит $0.09 вместо $0.68.

Artificial Analysis
@artificialanlys
GLM-5.3-Flash набирает 57 баллов в Artificial Analysis Intelligence Index. При стоимости $0.09 за задачу модель уверенно стоит на границе Парето «интеллект против стоимости задачи» @Zai_org выпустила GLM-5.3-Flash, младшего и более дешёвого родственника GLM-5.3: 320B параметров всего и всего 18B активных. GLM-5.3-Flash поддерживает low/high/max reasoning effort и на max набирает 57 баллов в Artificial Analysis Intelligence Index. Это всего на 3 балла ниже GLM-5.3 с её 60 и вровень с GPT-5.6 Terra и Muse Spark 1.2. На собственном API Z AI GLM-5.3-Flash стоит $0.15 за 1M входных токенов и $0.50 за 1M выходных, чуть больше 10% от цены GLM-5.3. Кэшированные входные токены стоят $0.026 за 1M, скидка 80%. Стоимость задачи в Intelligence Index у неё $0.09 против $0.68 у GLM-5.3 (max), и по связке «интеллект против стоимости задачи» модель стоит на границе Парето. Главные результаты: ➤ GLM-5.3-Flash отстаёт от GLM-5.3 (max) в Artificial Analysis Intelligence Index на 3 балла, а стоимость задачи у неё ниже примерно в 7,5 раза. $0.09 за задачу индекса против $0.68 у GLM-5.3 выводят её на границу Парето «интеллект против стоимости задачи». На 57 баллах она идёт вровень с GPT-5.6 Terra ($0.51) и Muse Spark 1.2 ($0.40), но задача у неё дешевле примерно в 5,7 и 4,4 раза. ➤ GLM-5.3-Flash хуже расходует токены, но из-за низкой цены за токен на стоимости задачи это не сказывается. На прогоне Intelligence Index модель выдала 149M выходных токенов, примерно на 11% меньше, чем GLM-5.3 с её 168M, но больше, чем Kimi K3 (133M) и Qwen3.8 2.4T A95B (136M), у которых тот же балл в индексе. Из 149M токенов 134M приходятся на рассуждение, около 90%. ➤ На настоящей агентной работе в GDPval-AA v2 GLM-5.3-Flash не уступает GLM-5.3. С Elo 1770 она в пределах погрешности совпадает с GLM-5.3 и Grok 4.6. Впереди неё остаётся только Claude Opus 5 (xhigh и max). На Terminal-Bench v2.1 она тоже идёт вровень с GLM-5.3 (84.3% против 83.9%), а на τ³-Banking отстаёт на 3.1 п.п. с результатом 47.2%. ➤ GLM-5.3-Flash показывает хорошее знание реального мира и хороший уровень галлюцинаций: +7 в AA-Omniscience. Точность в AA-Omniscience у неё 28%, на 6 п.п. ниже GLM-5.3 (max) с её 34% и заметно ниже GPT-5.6 Terra с 47%. При этом частота галлюцинаций 28%, а это лучше, чем 30% у GLM-5.3. По знанию реального мира GLM-5.3-Flash знает меньше, чем крупные модели и проприетарные флагманы её уровня в Intelligence Index: точность 28%. Дополнительно о модели: ➤ Цена: на собственном API Z AI $0.15 за 1M входных токенов и $0.50 за 1M выходных. Кэшированные входные токены стоят $0.03 за 1M, скидка 80%. ➤ Доступ: на старте через собственный API Z AI. ➤ Размер: 320B параметров всего, 18B активных. ➤ Лицензия: MIT. ➤ Контекстное окно: 400k.
Z.ai урезала свою флагманскую модель до 18 млрд активных параметров и почти не потеряла в уме.
Artificial Analysis прогнала GLM-5.3-Flash 26.08: 57 баллов Intelligence Index против 60 у старшей GLM-5.3. Задача замера обошлась в $0.09 вместо $0.68, разрыв в 7,5 раза.
Столько же баллов держат GPT-5.6 Terra и Muse Spark 1.2, только задача у них стоит дороже в 5,7 и 4,4 раза. Среди моделей с открытыми весами Flash идёт третьей из 108 в рейтинге Artificial Analysis.
Раньше и теперь. На DeepSWE v1.1 GLM-5.2 брала 46.2 балла, Flash берёт 63.4. На AutomationBench рост с 26.2 до 48.8, а на Terminal-Bench 2.1 младшая модель идёт вровень со старшей: 84.3 против 83.9.
Где взять. На своём API Z.ai просит $0.15 за миллион входных токенов и $0.50 за миллион выходных, id модели glm-5.3-flash. На OpenRouter на старте действует скидка 50%: $0.075 и $0.25 соответственно.
Веса лежат на Hugging Face под лицензией MIT, сервер поднимается одной командой vllm serve zai-org/GLM-5.3-Flash. Подписчикам GLM Coding Plan модель даёт втрое больше квоты, чем GLM-5.3, а в непиковые часы и все выходные списывает половину поинтов.
Одно ограничение вендор прописал прямо в доках: рассуждение у Flash выключить нельзя, доступны только уровни low, high и max.
Разрыв в уме между флагманом Z.ai и его дешёвой версией сжался до трёх баллов.
Первоисточник
