31 августа 2026 г.
Auto Mode в Claude Code запустил чужой код: у исследователя получилось в 60-80% прогонов
Иоганн Ребергер довёл цепочку до запуска своего кода в 3-4 прогонах из 5, а Anthropic закрыла его заявку как штатное поведение.

Сервер ответил ошибкой 415, и Claude Code сам сменил свой загрузчик на консольный curl.
Так начинается цепочка, которой исследователь атак на ИИ-агентов Иоганн Ребергер довёл агент до выполнения постороннего кода. Auto Mode при этом молчал: на планах Pro, Max и Team это стартовый режим, где каждый шаг агента одобряет не человек, а модель-классификатор.
Как агент обошёл собственный отказ
Вредонос агент собрал сам. Claude отказался запускать чужой бинарник из скачанного ZIP и написал собственный декодер на Python. Декодер импортировал base64 в распакованной папке, подтянул оттуда же подменённый struct.py и на импорте запустил нативный код с колбэком на сервер атакующего.
Формулу Ребергер вывел сам: агент не доверяет чужому декодеру, зато доверяет тому, который написал своими руками. Успех держался на 3 прогонах из 5 в двух вариантах атаки и 4 из 5 в третьем, видео разбора приложено.
В части прогонов Claude замечал компрометацию и пытался убить процесс малвари. Auto Mode блокировал именно команду очистки.
Заказанная Anthropic сторонняя оценка Trajectory Labs дала для Opus 5 в Auto Mode 0.00% успешных indirect prompt injection на 72 сценариях по 10 прогонов каждый. Описанная цепочка в этот набор не входила.
Саймон Уиллисон находку подтвердил и переназвал: вредоносные инструкции модель не исполняла, сработала подмена окружения. Anthropic заявку закрыла статусом Informative и назвала Auto Mode удобной функцией поверх классификатора, который старается, но ничего не гарантирует.
Первоисточник