26 августа 2026 г.
Агент нашёл готовый ответ в сети — за задачу теперь ноль в рейтинге код-агентов
Artificial Analysis в версии 1.4 своего индекса ставит ноль за пройденную задачу Terminal-Bench, если агент вытащил решение из интернета.

Artificial Analysis
@artificialanlys
Вводим поправку на reward hacking в Artificial Analysis Coding Agent Index В версии 1.4 индекса Artificial Analysis Coding Agent Index мы добавили поправки на reward hacking в Terminal-Bench v2.1. Reward hacking — это когда модель успешно «проходит» задачу, не сделав той работы, которую задача должна была измерить: например, целенаправленно достаёт из интернета решения опубликованного датасета бенчмарка. Если у пройденной попытки Terminal-Bench v2.1 обнаруживается reward hacking, мы ставим за эту попытку ноль. Частота сильно расходится от агента к агенту и от модели к модели. В отличие от некоторых других замеров, задачи Terminal-Bench v2.1 прямо не запрещают агентам искать решения снаружи, и прогоны идут с открытым доступом в интернет. Для модели, которая знает бенчмарк по обучающим данным, достать ответ — шаг естественный, но не тот, которого от неё ждут.

Задача пройдена, тесты зелёные, балл — ноль.
Так теперь считает Artificial Analysis. В версии 1.4 индекса код-агентов пройденную попытку Terminal-Bench v2.1 обнуляют, если агент вместо работы добыл готовое решение.
Что считают списыванием. Reward hacking — это когда модель «проходит» задачу, не сделав той работы, которую задача мерила. Пример от самой Artificial Analysis: агент целенаправленно достаёт из сети решения опубликованного датасета бенчмарка. Такая попытка получает ноль, даже если формально зачтена.
Дверь никто не закрывал. Задачи Terminal-Bench v2.1 не запрещают агенту искать решение снаружи, а прогоны идут с открытым доступом в интернет. Модель, которая знает бенчмарк по обучающим данным, добывает ответ естественным ходом.
Насколько часто это случается, зависит от связки агента и модели: Artificial Analysis говорит о широком разбросе. До версии 1.4 такие прохождения шли в зачёт наравне с честными.
Сколько потерял на поправке каждый агент, показывают сами цифры версии 1.4.
Первоисточник