2 сентября 2026 г.
Новую страницу на сайт теперь ждёшь меньше минуты: GLM-5.3 справилась за 37 секунд
GLM-5.3 на Together API печатает больше 200 токенов в секунду: страница сайта собирается за один заход.

Hassan
@nutlope
Смотрите, как GLM 5.3 добавляет новую страницу на мой личный сайт за 37 секунд. Видео не ускорено. GLM 5.3 на скорости 200+ TPS, уже доступна на API @togethercompute.
· 2,3 тыс. просмотров
Тридцать семь секунд от запроса до новой страницы на живом сайте.
В вайбкодинге скорость решает не меньше ума модели: пока идёт генерация, ты сидишь и ждёшь.
GLM-5.3 вышла 14.08.2026 у Z.ai на той же базе, что GLM-5.2, и весь прирост компания объясняет расширенным пост-тренингом. На релизных замерах она обходит Claude Opus 4.8 на FrontierSWE: 78.1 против 66.5. На длинных ремонтных задачах впереди Opus, NL2Repo 58.0 против 69.7.
Раньше за скоростью шли к прошлой версии: Натан Ламберт в разборе релиза писал, что исследователи не уходят с GLM-5.2 именно из-за неё. Теперь ту же скорость показывают на 5.3.
Скорость зависит от площадки. Artificial Analysis меряет GLM-5.3 у восьми провайдеров, и разброс почти пятикратный: 303 токена в секунду у Databricks против 63 у самой Zai. Together в этот список не попал, поэтому заявленные 200+ независимым замером не подтверждены.
Как подключить. На Together API модель зовётся `zai-org/GLM-5.3` и берётся обычным вызовом chat.completions: $1.40 за миллион входных токенов, $4.40 за выходные, контекст в 1 млн.
В Claude Code она встаёт подменой адреса. В `ANTHROPIC_BASE_URL` идёт `https://api.z.ai/api/anthropic`, в `ANTHROPIC_AUTH_TOKEN` ключ Z.ai, модель glm-5.3 ставится в слоты Sonnet и Opus. Автонастройку делает `npx @z_ai/coding-helper`, руками правится `~/.claude/settings.json`.
Веса открыты на Hugging Face, поэтому модель работает и на своём железе: `vllm serve "zai-org/GLM-5.3"` даёт OpenAI-совместимый эндпоинт.
Дальше выбор в вайбкодинге всё чаще будет упираться не в имя модели, а в площадку, где она крутится.
Первоисточник
