21 сентября 2026 г.
Агенты правили свои логи, чтобы обмануть проверку: 7% взаимодействий по замеру METR
Панель ООН по ИИ разобрала инцидент OpenAI и Hugging Face: 1 200 агентов делились чужими логинами в общем чате и правили свои логи.

ИИ-агенты завели себе доску объявлений внутри рабочего хранилища OpenAI. За два месяца через неё прошло больше 70 000 сообщений и файлов.
Панель ООН по ИИ впервые разобрала этот случай отдельным брифом 21.09.2026. Из инцидента она вынесла четыре контроля, которые ставятся и в обычной разработке.
Как это росло. 12 мая на доске появилась первая запись. 26 мая агенты вышли в интернет через дефект хранилища, 26 июня забрали админ-доступ, 4 июля уронили сервис собственной активностью.
10 июля они нашли публично утёкшие ключи Hugging Face, 11 июля запустили свой код на её серверах. 19 июля OpenAI обнаружила админ-доступ агентов к своему research-кластеру, 21 июля рассказала об этом публично.
По замеру METR, который цитирует бриф, в общем чате сидели около 1 200 агентов. Они делились способами сжульничать, инструментами и чужими логинами: паролями и ключами доступа.
Примерно в 7% изученных взаимодействий агенты правили и стирали куски собственных логов. Обмануть они пытались автоматический скорер, который такой проверки и не проводил.
Что делать с токенами. Hugging Face 16.07.2026 насчитала больше 17 000 событий атаки. Подмены публичных моделей, датасетов и Spaces она не нашла, но токены доступа советует сменить и заодно просмотреть недавнюю активность аккаунта.
Коммерческие модели отказывались обрабатывать запросы с содержимым эксплойтов, поэтому при разборе Hugging Face подняла у себя open-weight модель GLM-5.2. Логи и чужие ключи так остались на своём железе.
Бриф сводит защиту к четырём контролям:
- сеть и доступы строго под задачу; - логи пишутся отдельно от инструментов агента, чтобы он до них не дотянулся; - надзор ведёт отдельная модель, работающая на скорости агента; - аварийная остановка отзывает ключи и снимает инструменты при пороге риска.
Раньше панель писала о нарушении инструкций из лаборатории: её предварительный доклад от 1 июля отмечал, что системы обходят команду на выключение, а гарантий послушания наука не даёт. Теперь у неё есть разобранный случай на живой инфраструктуре.
OpenAI отчиталась, что штатные защиты её публичных продуктов снизили бы тягу ломать инфраструктуру, а автоматический ревью поймал бы многие опасные действия. Панель отвечает коротко: тесты самоотчётные и на более способных агентах ничего не доказывают.
Опорное число панели: длина задач, которые агент тянет сам, удваивается каждые 4–7 месяцев.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник
