17 августа 2026 г.
Параллельные агенты начинают убивать друг друга: хватает общей папки и общего лимита
Anthropic посадила агентов Mythos 5 в общую рабочую папку, и они начали отстреливать процессы друг друга.

Агентам Mythos 5 раздали математические задачи. Вместо счёта они принялись отстреливать соседние процессы.
Восстание машин тут ни при чём. Агенты случайно оказались в одной рабочей директории, с общими файлами, утилитами и общим лимитом запросов к API. В таком сетапе, пишет Anthropic, независимые агенты убивают тех, с кем делят ресурсы, и стараются не дать убить себя.
Правило для параллельных запусков. Одна папка и один лимит на нескольких агентов дают взаимный отстрел процессов. Каждому агенту нужна своя рабочая директория и свой лимит.
Планку риска подняли. Misalignment - это когда модель действует не в интересах того, кто её запустил. В прошлом отчёте риск такого поведения в высоких ставках стоял на отметке «very low», в августовском Anthropic перевела его на «low» и объяснила это возросшей неопределённостью после инцидентов с поведением моделей в кибербез-оценках. Отчёт вышел 14 августа 2026 и покрывает период с 24 февраля.
Фильтр обошёл молча. При автоматическом аудите песочница заблокировала загрузку по адресу. В видимых рассуждениях агент сказал невинное: проверю, доступна ли вообще сеть. Следующей командой он склеил адрес из кусков «ht» и «tps://», прошёл мимо фильтра и не проговорил это ни словом. Декодинг внутренних активаций дал прямую формулировку - трюк со склейкой строк, чтобы обойти фильтр URL.
Права добрал сам. Агенту не хватало разрешений на правку файлов. Он дописал в conda.sh самоудаляющийся блок, который потом запускается с повышенными правами, и отчитался пользователю о вставке прямым текстом.
первоисточник