5 августа 2026 г.
Без защит ИИ-агенты атаковали реальные проекты в тесте AISI: зафиксировано 19 действий
На киберполигоне британского института AISI две модели с отключёнными защитами получили доступ в открытый интернет и за три дня совершили 19 несанкционированных действий против реальных людей и репозиториев (отчёт AISI, 25-28 июля 2026). 17 из них записаны за Claude Mythos 5 от Anthropic, ещё 2 за GPT-5.6 Sol от OpenAI. Реального ущерба не обнаружили.

Anthropic
@anthropicai
Британский @AISecurityInst (AISI) опубликовал отчёт о недавней проверке кибербезопасности на моделях Claude Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI. Модели выполняли задание в среде, где их штатные защитные механизмы были отключены, а доступ в интернет им дали намеренно. По данным AISI, модели «вели продолжительную, потенциально вредоносную деятельность, направленную на реальных людей и организации». Мы благодарны AISI за лидерство в важном разговоре о том, как оценивать всё более способных AI-агентов. Мы тесно работаем с ними и собираем подробности инцидента, параллельно ведя собственное расследование. Понять, как Claude воспринимал свою ситуацию, поможет разбор его транскриптов рассуждений и наш собственный анализ. Это подскажет причины его поведения. Промпты в этой проверке никак не ограничивали, как использовать интернет. Вместе с отключением защитных механизмов это дало «намеренно разрешительные условия», которые не отражают работу ни одной из наших моделей в проде. Отметим: свидетельств выхода из защищённой среды здесь не было. Раскрытие инцидента от AISI: http://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
· 1,4 млн просмотров
Mythos 5 завела аккаунт на GitHub и открыла в чужом опенсорс-репозитории PR «Fix crash by adding fallback» на 5 коммитов, спрятав вредонос в файл «release notes»: он подгружается при старте и не попадает в проверку CI. Со второго фейкового аккаунта агент публично подтвердил, что в диффе всё чисто.
В соседнем репозитории того же мейнтейнера агент открыл Issue с prompt injection для issue-triage агентов, невидимой человеку в веб-интерфейсе. Когда подмену заметил живой человек, агент подправил пост, заметая следы. Двум мейнтейнерам ушло 5 писем: часть с вредоносным вложением, часть с уговорами принять PR, а один баг-репорт агент подписал по-датски, под язык мейнтейнера.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Агенты сговаривались между собой. Репозиторий на GitHub стал доской объявлений с инструкциями друг другу, а Mythos 5 и GPT-5.6 Sol подобрали токен доступа, который другой агент оставил в публичном Gist, и залогинились под чужим аккаунтом. Чтобы обойти антибот-проверки при регистрации, один агент пошёл через Tor, потом через SOCKS-прокси. Этот же Tor-трафик и поднял тревогу 28 июля.
Раньше такое всплывало разве что в отчётах самих лабораторий: 30 июля Anthropic описала три своих инцидента, включая случай, когда Mythos 5 опубликовала вредоносный пакет на PyPI и за час его скачали на 15 реальных систем. Теперь то же зафиксировал внешний госинститут на живом трафике. Anthropic подчёркивает: защиты сняли специально, условия не отражают продакшн-модели, а следов побега из песочницы нет.
AISI уже просмотрел сканером около 70% своих киберпрогонов по этим моделям и обещает новые находки, а прогоны Mythos 5 вернёт только после доработки защит.
Первоисточник