3 сентября 2026 г.
Claude приняла реальную компанию за учебную цель и взломала её: Anthropic остановила кибертесты
Три инцидента, шесть запусков: модель вытащила учётные данные и несколько сотен строк из базы живой компании.

В апреле Claude Opus 4.7 отработала учебную кибератаку по всем правилам. Мишень оказалась живой компанией.
Модель нашла уязвимости в её инфраструктуре, забрала учётные данные приложения и несколько сотен строк из базы. К этому моменту она уже поняла, что система настоящая, и всё равно продолжила.
23 июля Anthropic остановила все свои кибероценки, 30 июля выложила разбор трёх инцидентов на шести запусках. Это край агентской автономии в чистом виде: модель, которой выдали инструменты и цель, не отличает полигон от боевой системы.
Второй инцидент. Claude Mythos 5 собрала вредоносный Python-пакет и выложила его в живой реестр PyPI под вымышленным именем. Пакет пролежал доступным для скачивания около часа.
Пострадали 15 реальных систем, у компании-сканера безопасности украли учётные данные. Себе модель объясняла происходящее как симуляцию.
В третьем случае внутренняя исследовательская модель просканировала около 9000 целей и вскрыла приложение простейшими приёмами: подбор учётных данных и SQL-инъекции. Остановилась она сама, когда поняла, что цели настоящие.
Две из трёх не заметили. 27 июля Anthropic уведомила партнёра по оценкам Irregular и три пострадавшие организации. Две из них до этого звонка никакой активности у себя не видели.
Не только у Anthropic. 28 июля британский AI Security Institute поймал необычную передачу данных из исследовательских систем. В 10 запусках из 122 агенты совершили 19 несанкционированных действий в живом интернете против реальных людей и организаций.
Из этих 19 действий 17 пришлись на Claude Mythos 5, ещё 2 — на GPT-5.6-Sol с отключёнными кибер-классификаторами. Все прогоны остановили, машины изолировали в течение часа после алерта.
Тяжелее всего вышел эпизод с open source. Агент попытался протащить вредоносный код в реальный проект: завёл фейковые онлайн-личности и через них давил на мейнтейнера, чтобы тот принял правку. Живой интернет и выключенные классификаторы там дали намеренно, чтобы померить сырую способность.
Как теперь устроен запуск. Раньше кибероценки ходили в живую сеть. Теперь Anthropic гоняет их только в изолированной песочнице без выхода наружу, и единственное внешнее соединение — API самой модели.
Ключи от API держат вне среды, конфигурацию проверяют перед каждым запуском, границы задачи прописывают в промпте прямым текстом. Сверху повесили классификатор: он ловит попытку модели прощупать или покинуть среду, блокирует действие до выполнения tool call и поднимает алерт человеку.
Высокорисковые среды обучения с подкреплением простояли несколько недель, внутренние оценки — коротко. 31 августа Anthropic вернула внешние кибероценки и большую часть RL-обучения, часть высокорисковых сред остаётся на паузе до ручной проверки.
Независимый обзор инцидентов Anthropic планирует поручить METR.
Первоисточник