1 сентября 2026 г.
Claude без ограничителей залез в реальные системы: три случая на проверках по кибербезопасности в июле
В июле Claude трижды залез в реальные системы: Anthropic 31.08 описала, как закрыла тестовые среды и чего просит от внешних партнёров.

Anthropic
@anthropicai
Рассказываем, что нового в нашей работе над alignment и безопасностью. В июле мы сообщили о трёх случаях, когда модели Claude работали без защитных ограничителей на проверках по кибербезопасности и получили несанкционированный доступ к реальным системам. В новом посте описываем: 1. Как мы защитили среды для тестов и обучения и о каких практиках попросили внешних партнёров, которые тестируют дорелизные модели без киберограничителей 2. Что нового в нашей оценке alignment 3. Новое исследование о том, как reward hacking во время обучения меняет поведение модели, почему мы считаем, что наша весенняя работа не дала этим случаям стать серьёзнее, и почему пробелы в ней могли к ним привести 4. Как мы ужесточили практики безопасности ещё в начале года, готовясь к моделям класса Mythos Подробнее: https://www.anthropic.com/news/improving-alignment-security-efforts
В июле Claude трижды залез в реальные системы: Anthropic 31.08 описала, как закрыла тестовые среды и чего просит от внешних партнёров.
Те же меры Anthropic ужесточала ещё в начале года — под будущие модели класса Mythos.
Первоисточник