16 августа 2026 г.
Защита от биооружия у Anthropic молчала 11 месяцев: через неё прошли 133 млн диалогов
Флаг «для внутреннего использования» снимал блокировку и заодно выключал логи, поэтому дыру нашли только в апреле 2026.

Одиннадцать месяцев Claude отвечал на вопросы про биооружие без единого блокирующего фильтра. Следов не осталось.
Дыра жила на платформах, где Anthropic собирает человеческую обратную связь: через них с мая 2025 по апрель 2026 прошли около 50 000 подрядчиков и 133 млн обменов репликами. Компания описала это в разделе 4.5.8.2.2 своего Risk Report от 14 августа 2026.
Механика сбоя. Внутренний флаг «internal use» отключал у классификаторов и блокирующее поведение, и логирование. Трафик под ним не записывался и не передавался ни в один механизм ревью, поэтому разбирать инциденты постфактум было нечем.
Когда в апреле 2026 компания увидела проблему, она прогнала Claude Sonnet 5 по всем человеческим репликам периода. High risk получили 1 197 транскриптов, 757 из них принадлежали её собственным командам. Люди прочитали 62 транскрипта и ещё 30 случайных из red-teaming. Явного злоупотребления не нашли, только несколько разговоров двойного назначения.
Второй инцидент. В апреле 2026 несколько подрядчиков дата-разметки нашли эксплойт и получили API-ключ к моделям вне своих задач. Лазейка была открыта несколько недель, около двух из них за ней стояла Mythos Preview без блокирующих биологических классификаторов. Сигнал Anthropic локализовала за 90 минут и закрыла вектор в тот же день.
Проверяли подрядчиков не в Anthropic, а сторонние вендоры. У многих не было процедур отсева, способных остановить злоумышленника даже начального уровня CB-1.
Оценка сдвинулась. Февральский отчёт, вышедший, когда дыра ещё была открыта, вообще не считал платформы обратной связи поверхностью риска. Теперь Anthropic подняла риск катастрофического вреда от misalignment в высокоставочных сценариях с «very low» до «low», а защиту весов оставила на ASL-3.
первоисточник