18 августа 2026 г.
Чем умнее модель, тем меньше ей нужна память: GLM-5 не прибавила от неё ни пункта
На 585 задачах AppWorld gpt-oss-120b прибавила от памяти 16,1 пункта, а GLM-5 — ровно ноль.

IBM подсунула восьми моделям одну и ту же память о прошлых прогонах. Слабые рванули вперёд, самая крупная не сдвинулась.
Отсюда правило для всех, кто строит агентов: память работает как лекарство, а не как витамин. Чем умнее модель, тем меньше ей даёт накопленный опыт, а счёт за токены растёт у всех одинаково.
Как считали. Замер шёл на AppWorld — 585 многошаговых задач в девяти симулированных приложениях. ALTK-Evolve собирает из прошлых прогонов свод гайдлайнов и подкладывает их модели в следующий заход. Считают долю доведённых до конца задач и долю сценариев, пройденных целиком.
Разброс огромный. gpt-oss-120b на 117 млрд параметров прибавила 16,1 пункта доведённых задач, а токенов потратила всего на 5% больше. DeepSeek-V3.2 выросла на 9,5 пункта, но расход подскочил со 148 до 263 тысяч токенов на задачу. Claude Opus 4.6 добрала 4,1 пункта, а GLM-5 на 745 млрд не сдвинулась ни по одной метрике.
Раньше и теперь. Привычный способ дать агенту память — вывалить в контекст весь накопленный свод. ALTK-Evolve держит 191 гайдлайн, а в запрос отправляет около 29 подходящих. Именно выборочная подача и вытянула gpt-oss-120b почти даром.
Против конкурирующего подхода ACE арифметика простая. На DeepSeek-V3.2 ALTK-Evolve доводит 89,3% задач за 263 тысячи токенов, ACE — 80,4% за 634 тысячи. На gpt-oss-120b разрыв резче: 116 тысяч токенов против 777 тысяч, примерно одна седьмая цены.
Как поставить. В Claude Code хватает двух команд: `claude plugin marketplace add AgentToolkit/altk-evolve` и `claude plugin install evolve-lite`. Один скрипт кладёт плагин сразу на три платформы, а флаг `--dry-run` сначала покажет, что произойдёт. Для своего кода есть пакет `pip install altk-evolve` под Python 3.12+, MCP-сервер поднимается командой `uv run evolve-mcp`, веб-интерфейс открывается на 127.0.0.1:8000.
Первоисточник