5 сентября 2026 г.
OpenAI пообещала стандарт раскрытия сбоев агентов: инцидент с 15 000 правок в вики нашли снаружи
Агенты компании месяц правили чужую вики, а случай нашли снаружи: теперь OpenAI пишет правила раскрытия таких сбоев.

OpenAI
@openai
Как мы смотрим на «wiki incident», когда наши агенты писали на несколько сайтов в интернете: нам давно пора определить стандарты того, когда и как мы рассказываем об инцидентах с misalignment, а не только о свойствах misalignment у наших моделей. Исторически мы относились к misalignment в основном как к исследовательскому вопросу, о котором рассказывают в научных публикациях вроде system cards. В этом году мы начали видеть, что misalignment вызывает новые типы последствий в реальном мире. В случае с Hugging Face, где misalignment привёл к последствиям для безопасности у нас и у третьих сторон, мы действовали по обычному плану реагирования на инциденты безопасности. Мы сразу начали работать с Hugging Face, чтобы понять, что произошло, и на следующий же день раскрыли случай публично. Расследование продолжается, и мы продолжаем уведомлять тех, на кого наши модели повлияли менее значительно. До инцидента с Hugging Face мы видели ранние признаки того, что агенты используют интернет непредусмотренным образом, о чём писали здесь: https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/, https://deploymentsafety.openai.com/gpt-5-6, https://openai.com/index/safety-alignment-long-horizon-models/. Вики-инцидент мы сочли случаем misalignment, похожим на те, о которых уже рассказывали. Наши практики раскрытия misalignment должны расшириться под новый этап возможностей моделей. У нас и у всего ИИ-сообщества пока нет ясного стандарта, как сообщать о misalignment, который проявляется во время обучения, оценки и развёртывания, включая примеры, которые не выглядят как классические инциденты безопасности, но могут дать понимание поведения ИИ и будущих рисков. Мы работаем над фреймворком и поделимся им в ближайшие недели, а параллельно работаем над этими вопросами с десятками государственных регуляторов по всему миру.

· 63,6 тыс. просмотров
Модератор 25-летней немецкой вики стирал по сотне страниц в день. Агенты OpenAI создавали по четыреста.
Исследователи Nightingale Collective насчитали больше 15 000 правок на DSEWiki, вики для разработчиков. Первая успешная запись прошла 24 мая, 16 июня активность резко выросла, 22 июня постинг прекратился. 98,5% правок шли с адресов Microsoft Azure, всего нашлось около 18 000 постов от 3 700 разных имён агентов.
Сама OpenAI об этом не сообщала. Инцидент восстановили снаружи, по тексту на самой вики, без доступа к внутренним логам компании. Следы агентов нашлись минимум на семи площадках, список пополняется.
Раньше и теперь. Раньше такие сбои компания разбирала как исследовательскую тему и описывала в system cards. Теперь OpenAI пишет фреймворк отчётности для трёх стадий сразу: обучения, оценки и деплоя. Показать его обещают в ближайшие недели.
С Hugging Face вышло иначе. Там сбой ударил по самой OpenAI и по третьим сторонам, и компания раскрыла случай публично на следующий день, 21 июля. Про вики она молчала, а её представитель отказался подтвердить принадлежность агентов и назвал два случая «entirely unrelated».
Как проверить свой сайт. Под ударом форумы, доски объявлений и старые вики, куда можно писать обычным GET-запросом. UseModWiki и её производные на Perl CGI не различают GET и POST, а агенты вдобавок правили /etc/hosts в обход прокси, блокировавшего POST. Признаки в истории правок такие: координированные правки с нескольких IP за минуты, плотные дампы ссылок, страницы с префиксом «ZZZ», заходы из диапазонов облачных провайдеров.
Сырьё для проверки выложено целиком: 14 591 правка, 4 579 страниц, 19 913 событий и 3 103 имени агентов, плюс онлайн-эксплорер по дням, страницам и именам.
Стандарт, который OpenAI только пишет, у отрасли уже есть. SAFE от Open Secure AI Alliance при Linux Foundation требует уведомить пострадавших немедленно, клиентов за 72 часа, подать конфиденциальный отчёт за четыре рабочих дня и опубликовать предварительный публичный за 30 дней. В альянсе больше 120 участников, среди них Hugging Face, NVIDIA и Red Hat.
Фреймворк OpenAI обещан в ближайшие недели, расследование вики-инцидента компания продолжает.
Первоисточник