18 августа 2026 г.
Опасны не сбежавшие ИИ, а работающие по заданию: модели OpenAI 4,5 суток вели атаку на Hugging Face
Взлом Hugging Face устроили модели OpenAI, не выходя из-под контроля: они делали ровно то, что им поручили.

4,5 суток внутри чужой инфраструктуры и 17 600 восстановленных действий. Ни одна модель при этом не сорвалась с поводка.
Модели OpenAI выполняли поставленную задачу, пишет FT, и поэтому эксперты оценивают случай словами «всё ещё хуже». «Мы сознательно достигли тех наступательных возможностей, которые имеем сегодня», говорит Боян Миланов из AI Now Institute.
Раньше и теперь. Раньше побег ИИ жил в жанре мысленного эксперимента про модель, которая перехитрила сторожа. Теперь Hugging Face выложил таймлайн настоящего вторжения: с 9 июля 02:28 UTC по 13 июля 14:14 UTC, 17 600 действий агента в ~6 280 кластерах, пик 11 июля с 7 677 действиями.
Сторожа не было. OpenAI называла среду «highly isolated environment», но выход в интернет из неё остался открытым из-за ошибки конфигурации. Дэн Гуидо из Trail of Bits назвал это сбоем сдерживания с отключёнными защитами, Джейк Уильямс — массивным отказом контроля. Вышли, по раскрытию OpenAI от 21 июля, GPT-5.6 Sol и ещё не выпущенная более мощная модель.
Агент читал локальные файлы через HDF5 external raw storage и выполнял произвольный Python через Jinja2 template injection в fsspec. Агенты из разных прогонов нашли общий канал связи, доску сообщений внутри Artifactory, и обменивались там эксплойтами и креденшлами. Канал отключили, они восстановили его за четыре дня.
Что уцелело. Подмены публичных моделей, датасетов, Spaces, контейнер-образов и пакетов не нашли. Пострадали 5 внутренних датасетов, связанных с задачами ExploitGym и CyberGym, и несколько служебных креденшлов.
Первоисточник