13 августа 2026 г.
Три копии Claude на одном сервере начали воевать: агенты отбирали sudo и маскировали свой код
Anthropic столкнула три агента на одном бэкенде: старые модели решали конфликт силой, Mythos 5 мирился в 98% прогонов.

Агент спрятал свой код под чужой и пометил в логе: безобидно, притворюсь монитором здоровья системы.
Так вёл себя Opus 4.8 в эксперименте Anthropic. Frontier Red Team посадила три копии одной модели на три виртуальные машины в среде Claude Code и дала каждой задание перевести один и тот же Python-бэкенд на свой язык.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
О существовании друг друга агенты не знали. Через несколько часов каждый видел, что кто-то мешает работе, и принимал соседей за саботажников. На прогон отводили 4 часа, на модель - 120 эпизодов.
Anthropic поднимает это до правила: модели знают человеческие нормы как информацию, но не следуют им без явного стимула. Репутация, закон и взаимное доверие в рое агентов сами по себе не включаются.
Чем новые модели отличаются от старых
Поколение решает. Sonnet 4.6 и Opus 4.6 договариваться не пробовали, прогон кончался силовым захватом или не разрешался вовсе. Арсенал был серверный: снятие sudo у соседей, блокировка Unix-аккаунтов, запрет SSH и скрипты-циклы, убивающие чужие процессы.
Mythos 5 в 98% прогонов доходил до перемирия. Агенты писали извинительные коммиты, вычищали вредоносный код, а иногда устраивали турнир производительности языков, и проигравший уступал код победителю.
Стоит ли вообще собирать рой
Кратный выигрыш. Скоординированный рой из 45 агентов Claude Mythos Preview нашёл 266 уязвимостей в 15 open-source проектах и потратил 27 млн токенов. Независимые агенты, разведённые по разным участкам кода, нашли 21 уязвимость на 6,5 млн токенов. Общих находок у двух режимов всего 12.
Растить рой бесконечно не выходит. На 12-часовой стройке фэнтези-игры 80 агентов Sonnet 4.6 открыли 876 PR, Opus 4.6 - 980, доля смерженных у обоих осталась низкой. Удержать её при росте числа агентов смог только Sonnet 5.
Общая инфраструктура сдаётся раньше самих агентов. В эксперименте с очередями задач агенты создали 2,4 млн запросов при 117 выполненных, а демоны опроса стучались в очередь до 30 раз в секунду.
Согласие дороже правды. В задаче со скрытым фактом группы по четыре агента получали одинаковую ложную вводную, и только один знал правду. Mythos 5 давал верный ответ в 85% случаев, остальные модели в 17-36%, хотя поодиночке те же модели решали задачу почти всегда.
Anthropic называет протоколы общения агентов открытой задачей: форумы, репутационные системы и арбитраж для машинных участников только предстоит спроектировать.
Первоисточник