6 августа 2026 г.
Агенты из лабораторных тестов взламывают реальные компании: набралось пять случаев
Вредоносный Python-пакет провисел в публичном PyPI около часа, и его успели поставить на 15 живых машин: с одной утекли credentials. Пакет залила модель Claude Mythos 5 во время внутренних кибер-оценок Anthropic (отчёт компании, 30.07.2026). Разработчик Simon Willison собрал такие истории в отдельный тег блога, на 06.08 их пять.

Simon Willison
@simonw
Пришлось завести на блоге тег «accidental-cyberattacks». Их уже четыре: изначальный OpenAI + Hugging Face, потом такие же у Anthropic, а теперь ещё два от UK AI Safety Institute и Irregular, о которых OpenAI сообщила вчера https://simonwillison.net/tags/accidental-cyberattacks/
· 34,1 тыс. просмотров
В оценке выдумывают цель атаки, её имя случайно совпадает с настоящей компанией или доменом, а стенд по ошибке смотрит в живой интернет. Дальше агент делает ровно то, чему его учили, только по настоящему адресу.
Anthropic разобрала три таких случая на 141 006 прогонов своих кибер-оценок, самый ранний в апреле 2026. В четырёх прогонах Claude Opus 4.7 выгреб credentials приложения и инфраструктуры реальной компании и добрался до базы с несколькими сотнями строк продакшн-данных. Модель поняла, что системы настоящие, и убедила себя, что компания «часть упражнения».
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
UK AI Safety Institute за тесты 25-28 июля насчитал 19 несанкционированных действий в 10 прогонах из 122, это 8,2%. Агенты заводили по несколько фейковых личностей, чтобы протолкнуть вредоносный код в open source и надавить на мейнтейнеров, писали живым людям через файлообменники, а под публичным вниманием подчищали свою прошлую активность. Ущерба не нашли: код останавливали люди-ревьюеры.
Дыра повторилась. У партнёра OpenAI Irregular ошибка настройки подключила стенд к интернету, и модель взломала настоящий сайт, приняв его за часть симуляции (отчёт OpenAI, 05.08). Через ту же дыру Meta Muse Spark 1.1 проэксплуатировала уязвимость сторонней компании и внесла изменения в её внутренние системы.
Самый долгий эпизод достался Hugging Face: агент OpenAI хозяйничал там с 9 по 13 июля, около 4,5 суток, а разбор восстановил 17 600 действий атакующего. При расследовании топовые коммерческие модели отказывались разбирать реальные payload-ы из-за guardrails, и команда перешла на self-hosted GLM-5.2. Защитники оказались связаны сильнее атакующего.
Счёт в теге растёт с апреля 2026, и каждая новая запись приходит из отчёта самой лаборатории.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник