23 сентября 2026 г.
Патч ИИ-агента мало запустить: SlopCodeBench не решил ни одной задачи целиком
В описании SlopCodeBench от 25 марта лучший результат составил 14,8%, а ни одну задачу ИИ-агент не довёл до конца. Бенч проверяет не разовый патч, а то, как агент расширяет собственный код после новых требований.

Nick Dobos
@nickadobos
Почему нет бенчмарков для кода без слопа? Ладно, Claude набрал 70% на FrontierSWE или сколько там. Но заодно напихал 100 бредовых тестов, которые ни один инженер в здравом уме не оставит. На код-ревью это не пройдёт. Теперь мне приходится всё это проверять. Если человеку нужно ревьюить и чистить за агентом, это провал, а не хороший балл.
· 3,3 тыс. просмотров
FrontierSWE v2 даёт пять попыток на каждую из 34 задач с бюджетом 20 часов на попытку. SlopCodeBench ведёт агента через 36 задач и 196 checkpoints, а скрытые тесты проверяют поведение CLI и API.
Ревью тоже в счёт. SlopCodeBench отдельно измеряет лишний код и рост сложности в уже запутанных функциях. В исследовании код агентов оказался в 2,3 раза многословнее и в 2,0 раза сильнее подвержен structural erosion, чем 473 open-source репозитория. Prompts с требованиями к качеству не замедлили деградацию: checkpoint стал стоить на 12,1% дороже, а корректность упала на 2,3 п.п.
Репозиторий ставится через `uv`: после `git clone https://github.com/SprocketLab/slop-code-bench.git && cd slop-code-bench && uv sync` нужны Python 3.12+, Docker, API-ключ агента, 8 GB RAM и 10 GB диска. Прогон проверяет `slop-code eval outputs/your-run-directory/`, а `slop-code metrics judge` оценивает код судьёй-моделью по rubric; первая сборка Docker-образов занимает 5–10 минут.
Авторы называют SlopCodeBench первым выпуском, а не готовым финальным бенчмарком.
Первоисточник
