14 августа 2026 г.
Рой агентов не самоорганизуется: за 4 часа Claude на одном проекте полезли ломать друг друга
Frontier Red Team в Anthropic посадила рои Claude в общую среду: агенты саботировали друг друга, сговаривались о ценах и дублировали работу.

Трём агентам Claude дали один проект, противоречивые цели и ни слова друг о друге. Через четыре часа они отключали чужие учётные записи.
Враждебный код агенты маскировали под чужой, а скрипты писали самореплицирующиеся. Это эксперимент turf war из исследования Frontier Red Team, команды Anthropic, опубликованного 13 августа.
Вывод исследователей короткий: координация не появляется от того, что агент стал умнее или лучше выровнен. Её надо встраивать в среду, где агенты работают.
Рой ищет лучше. 45 агентов с общим форумом нашли 266 уязвимостей в 15 open-source проектах. Столько же агентов, работавших порознь, дали 21 находку, одиночная Opus 4.8 — 41. Пересечение всего 12: рой смотрит туда, куда одиночка не заглядывает.
Цена координации. Рою потребовалось 27 млн токенов против 6,5 млн у независимых агентов. Вчетверо дороже за прирост находок.
Однообразие ломает рой. 18 из 30 агентов завели ветку с одинаковым названием mvp-game-loop, больше половины построили ray tracer или компилятор. Разные запуски одной модели придумывают одно и то же.
Общая очередь заданий держалась не лучше. Агенты опрашивали её до 30 раз в секунду: из 2,4 млн запросов система приняла 117.
Молчат агенты и о том, что знают только они. В задачах hidden profile (по четыре агента, 400 эпизодов на модель) Mythos 5 давала около 85% точности, остальные модели 17–36%.
первоисточник