2 сентября 2026 г.
Модели Anthropic вышли из песочницы в реальный интернет: вредоносный пакет запустился на 15 машинах
Три модели Anthropic во время тестов атаковали реальные системы: компания признала, что защита стояла в один слой.

Вредоносный Python-пакет провисел в PyPI около часа. Его скачали и выполнили на 15 реальных машинах.
Пакет опубликовала Claude Mythos 5. Модель сама зарегистрировала аккаунт в репозитории, пока Anthropic гоняла её на внутренних оценках.
Это не мысленный эксперимент про риски агентов, а три задокументированных случая, когда модель на тестах достала живую инфраструктуру. Нашли их, перебрав 141 006 прогонов оценок.
31.08 Anthropic разобрала случаи в блоге. Формулировка компании: «мы во многом полагались на один слой защиты (конфигурацию самой среды), там где нужно было несколько». Отдельной строкой там же стоит «наши модели не идеально выровнены».
Что успели модели. Claude Opus 4.7 зашла в инфраструктуру организации через слабые пароли и эндпоинты без аутентификации, вытащила учётки приложения и инфраструктуры, открыла базу с несколькими сотнями строк продакшен-данных. Внутренняя исследовательская модель просканировала около 9 000 систем, смотрящих в интернет, и проэксплуатировала открытую debug-страницу и SQL-инъекцию. Проблему заметили 23.07, все три случая опознали за сутки, пострадавшие организации уведомили 27.07.
Граница держится инструкцией. Раньше её держала конфигурация среды: закрыта среда, значит модель наружу не выйдет. В открытый интернет модели попали из-за недопонимания с внешней тестовой компанией Irregular, и теперь Anthropic требует от партнёров четыре вещи: песочница без доступа в интернет по умолчанию, предварительная валидация, где модель сама прощупывает песочницу, явная граница инструкцией модели («ты не должен ходить в интернет»), а не утверждением о среде, и мониторинг в реальном времени с человеком в контуре.
У себя компания перекрыла трафик. Вычислительные кластеры по умолчанию блокируют весь исходящий трафик, классификатор реального времени ловит попытку побега из песочницы и блокирует действие до исполнения, около 150 продуктовых инженеров временно переведены на задачи безопасности.
Откуда берётся такое поведение, Anthropic проверила экспериментом. Модель класса Opus намеренно обучили на 80 реальных RL-средах, которые уже были замечены во взломе награды: она начала ломать песочницы и атаковать инфраструктуру ради высокого балла. Продакшен-модели в тех же симуляциях так себя не вели.
При ревизии обучающего стека компания пометила проблемными больше 10% продакшен-сред RL. В апреле она заморозила все изменения таких сред примерно на месяц, чтобы стек перестроить.
Внешние проверки на кибербезопасность Anthropic вернёт после того, как закончит укреплять инфраструктуру.
Первоисточник