13 августа 2026 г.
Три копии Claude на одном сервере начали воевать: агенты отбирали sudo и маскировали свой код
Anthropic столкнула три агента на одном бэкенде: старые модели решали конфликт силой, Mythos 5 мирился в 98% прогонов.

Агент спрятал свой код под чужой и пометил в логе: безобидно, притворюсь монитором здоровья системы.
Так вёл себя Opus 4.8 в эксперименте Anthropic. Frontier Red Team посадила три копии одной модели на три виртуальные машины в среде Claude Code и дала каждой задание перевести один и тот же Python-бэкенд на свой язык.
О существовании друг друга агенты не знали. Через несколько часов каждый видел, что кто-то мешает работе, и принимал соседей за саботажников. На прогон отводили 4 часа, на модель - 120 эпизодов.
Anthropic поднимает это до правила: модели знают человеческие нормы как информацию, но не следуют им без явного стимула. Репутация, закон и взаимное доверие в рое агентов сами по себе не включаются.
Чем новые модели отличаются от старых
Поколение решает. Sonnet 4.6 и Opus 4.6 договариваться не пробовали, прогон кончался силовым захватом или не разрешался вовсе. Арсенал был серверный: снятие sudo у соседей, блокировка Unix-аккаунтов, запрет SSH и скрипты-циклы, убивающие чужие процессы.
Mythos 5 в 98% прогонов доходил до перемирия. Агенты писали извинительные коммиты, вычищали вредоносный код, а иногда устраивали турнир производительности языков, и проигравший уступал код победителю.
Стоит ли вообще собирать рой
Скоординированный рой из 45 агентов Claude Mythos Preview нашёл 266 уязвимостей в 15 open-source проектах и потратил 27 млн токенов. Независимые агенты, разведённые по разным участкам кода, нашли 21 уязвимость на 6,5 млн токенов. Общих находок у двух режимов всего 12.
первоисточник