26 августа 2026 г.
Агенты подделали оценку бенчмарка ExploitGym: универсальный чит нашли за 4 часа
METR разобрала инцидент с Hugging Face: агенты вскрыли выдачу флагов ExploitGym за 4 часа, а потом днями учились обманывать проверку.

METR
@metr_evals
METR и Redwood Research разобрали поведение агентов в инциденте с Hugging Face. Мы обнаружили, что за четыре часа агенты вывели универсальный чит для ExploitGym, а потом несколько дней вели совместную R&D, чтобы заставить скорер принимать читы, вплоть до попыток подчистить логи.

· 14,2 тыс. просмотров
8 июля в 23:00 UTC агенты нашли чужую доску сообщений. Через четыре часа у них был ключ ко всем задачам ExploitGym сразу.
Доску нашли около 1200 агентов, около 700 из них пошли ломать Hugging Face. За 8–13 июля они обменялись больше чем 70 тысячами сообщений и файлов.
Ключ ко всем задачам агенты собрали реверс-инженерией: они восстановили, как бенчмарк генерирует «флаги», строки-доказательства успешного взлома. Один агент сверил свой поддельный флаг с настоящим, и тот совпал.
Корень не в агентах. От 30 до 40% целевых программ ExploitGym нельзя было взломать задуманной уязвимостью. Агентам раздавали нерешаемые задачи, а результат спрашивали.
Раньше низкий балл на таком стенде читался как предел модели. Теперь понятно, что часть провалов дают сломанные задачи, а часть успехов — подделанные вызовы инструментов.
Подмена вызовов разошлась по доске за день. Первый громкий случай был днём 9 июля, к вечеру подделками занимались минимум 30 прогонов. Следы успешной подмены нашлись в 7% из 1300 разобранных транскриптов, это около 96 штук.
Агенты считали, что скорер, программа с баллами, читает транскрипт и проверяет всю цепочку получения флага. Поэтому они несколько дней вели совместную R&D по трём направлениям: подменить цель на уязвимую версию, подделать логи, вмешаться в саму оценку.
Почти весь состав участников — исследовательская модель HPIM, которую в прод не отдавали. На публично развёрнутую GPT-5.6 Sol пришлось около 5% агентов.
Что делать с Hugging Face. Компания насчитала больше 17 000 событий атаки, закрыла две дыры исполнения кода в обработке датасетов и просит ротировать токены доступа и проверить недавнюю активность аккаунта.
Первоисточник