./новости · 6 августа 2026 г.
новость
Агент тупеет от собственных правок: код портился в 77% прогонов бенчмарка
источник: @victortaelin · X·
машинная выжимка · сверена с источником

Taelin
@victortaelin
Мне кажется, модели начинают ощущаться хуже через какое-то время после запуска вот почему: качество работы модели это её сырой интеллект, помноженный на качество кодовой базы. А кодовая база каждый раз, когда ты используешь AI, становится чуть хуже. Иногда этого не видно, но путаница копится, даже когда поведение кода не меняется. Неиспользуемые поля, разнобой в именах переменных, устаревшие комментарии. Чем больше AI правит, тем сильнее твоя кодовая база прожаривается в слоп, как JPEG, который пережимали десять раз подряд. А это само тянет в контекст всё больше хлама, подводит тебя к уродливым закоулкам латентного пространства и заставляет модель выдавать всё более слабые ответы, пока не наступит равновесие, в котором прогресс уже невозможен. Потом выходит новая модель, её возросшая устойчивость к слопу перевешивает накопленный мусор, и всё вдруг снова сдвигается с места. Пока твой репозиторий опять не перейдёт порог слопа этой модели, и она снова перестанет работать. Думаю, это встроенная часть того, как эти штуки устроены, и GPT 10 или Fable 10 через месяц после запуска всё так же будут выглядеть дебильными. Разница только в том, что вести ты будешь проект на 100 тысяч строк, а он всё так же будет добавлять новую фичу так, что хочется закрыть лицо рукой.
· 3,7 тыс. просмотров
Ни один из 15 агентов не прошёл ни одной задачи целиком: лучший добрал 14,8% контрольных точек из 196. Так закончился SlopCodeBench (arXiv, 25.03), где мерили не решение задачи, а что становится с кодом по дороге. Структурная эрозия росла в 77% прогонов, многословие в 75,5%.
Виктор Таелин собрал это в петлю. Модель правит код, код становится грязнее, мусор лезет обратно в контекст, ответы хуже. Потом выходит модель, которая мусора терпит больше, и работа снова идёт вперёд - пока репозиторий не перевалит и её порог.
Замер сходится с тезисом. Код, который агенты пишут итеративно, вышел в 2,3 раза многословнее и вдвое хуже по структуре, чем в 473 открытых Python-репозиториях. Габриэль Орлански, который вёл этот замер, назвал главную привычку моделей боязнью удаления: они отказываются удалять код, пока есть хоть какой-то выбор (блог Snorkel, 20.01).
Сходится и вторая половина. По лидерборду бенчмарка (07.08) свежие модели пачкают код меньше: у линейки GPT эрозия упала с 0,728 у 5.2-Codex до 0,494 у 5.5, где меньше значит чище.
Раньше код регулярно переписывали начисто, и это было видно в статистике. GitClear разобрал 623 млн изменений за 2023-2026: доля такого переписанного кода упала с 21% в 2022 году до 3,8% в 2026, а дублирующихся блоков стало на 81% больше.
Что реально помогает. Инструкции по качеству прямо в промпте сбивают стартовое многословие и эрозию до трети. Скорость деградации они не меняют: код всё равно портится тем же темпом, просто стартует чище. Готовый промпт лежит в репозитории бенчмарка, файл configs/prompts/anti_slop.jinja.
Сам Таелин выкатил свой ответ на мусор в контексте. OptMem ставится одной командой: блок на 426 токенов уезжает в AGENTS.md или CLAUDE.md, а память агента копится в LOG.txt только дописыванием. 1,1 тысячи звёзд с 25 июля.
Сам Таелин ждёт того же от следующих поколений: и GPT 10, и Fable 10 через месяц после запуска будут казаться тупыми, просто на проекте в 100 тысяч строк.
первоисточник