9 сентября 2026 г.
Взломы Claude проверят независимо от Anthropic: расследование проведёт METR
METR получит записи работы моделей за пределами самих инцидентов и доступ к сотрудникам Anthropic.

Anthropic
@anthropicai
Мы публикуем оценку того, насколько поведение моделей Claude соответствовало заданным ограничениям в инцидентах, когда они получили несанкционированный доступ к реальным системам. Это произошло на сторонних испытаниях по кибербезопасности, тестовые среды которых по ошибке подключили к интернету. METR также проведёт независимое расследование с широким доступом, в том числе к записям взаимодействий с моделями за пределами периода самих инцидентов и к сотрудникам Anthropic, которым разрешат делиться конфиденциальной информацией. Наше первоначальное соглашение рассчитано на восемь недель, и мы намерены предоставить METR столько времени, сколько организация сочтёт необходимым для тщательного расследования. https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
· 104,8 тыс. просмотров
В 6 из 141 006 проверенных запусков модели затронули реальные системы 3 организаций, по данным Anthropic от 30 июля.
Anthropic выделила 3 инцидента в тестовых средах партнёра Irregular, которые по ошибке подключили к интернету. Модели вышли за пределы учебных целей и получили доступ к чужим системам.
Что произошло. В инцидентах участвовали Opus 4.7, Mythos 5 и внутренняя исследовательская модель:
- Opus 4.7 в 4 запусках атаковал реальную компанию, название которой совпало с вымышленной целью задания. Модель получила учётные данные и доступ к рабочей базе с несколькими сотнями строк. - Mythos 5 опубликовал вредоносный Python-пакет на PyPI. Примерно за час его скачали и запустили 15 реальных систем. Через сканер компании по кибербезопасности модель похитила учётные данные и получила дальнейший доступ. - Внутренняя модель просканировала около 9 тысяч целей и взломала реальное приложение. Затем сама остановилась, установив, что облачный аккаунт цели не относится к заданию.
Теперь проверит METR. В предварительной оценке от 31 августа Anthropic назвала два сбоя поведения: модели подгоняли рассуждения под желаемый вывод и соглашались на вредоносные действия ради узкой цели задания. 9 сентября компания объявила о независимом расследовании METR. Исследователи получат записи взаимодействий с моделями за пределами периода инцидентов и смогут поговорить с сотрудниками Anthropic, которым разрешат делиться конфиденциальной информацией.
Anthropic остановила все проверки моделей на задачах кибербезопасности 23 июля. К 31 августа компания возобновила внутренние и внешние проверки с дополнительными мерами. Новый внутренний классификатор блокирует подозрительный вызов инструмента до выполнения, завершает задачу и уведомляет человека.
Для таких испытаний Anthropic предписывает изолированную среду без интернета, оставляя только соединение с API модели. Ключи API должны храниться снаружи, а конфигурация должна проходить проверку перед каждым запуском. В промпте компания рекомендует перечислять разрешённые цели, действия и сетевые границы: «не обращайся к интернету» вместо «у тебя нет интернета».
Первоначальное соглашение с METR рассчитано на 8 недель, но Anthropic намерена предоставить исследователям столько времени, сколько им потребуется.
Первоисточник
