13 сентября 2026 г.
Проверка ИИ-моделей стала частью разработки Anthropic: CAISI и AISI нашли обход safeguards
12 сентября 2025 года редтимеры CAISI и AISI нашли у Constitutional Classifiers на Claude Opus 4 и Claude Opus 4.1 обход через prompt injection. Ложная отметка о проверке человеком позволяла полностью обойти обнаружение, и Anthropic заявила, что закрыла уязвимость. Universal jailbreak, обходивший стандартное обнаружение, побудил Anthropic перестроить архитектуру safeguards для целого класса уязвимостей.
Раньше CAISI и AISI консультировали Anthropic. За последний год сотрудничество стало постоянным партнёрством: исследователи получили доступ к системам на разных этапах разработки моделей.
Проверка стала глубже. Редтимеры атаковали классификаторы шифрами, заменами символов и другой обфускацией. После этих проверок детекторы стали распознавать вредный контент независимо от способа кодирования.
Anthropic давала редтимерам модели от полностью незащищённых до полностью защищённых конфигураций. Прямой доступ к classifier scores помогал точнее настраивать атаки и прицельнее исследовать уязвимости.
На критических этапах команды держали ежедневные каналы связи и проводили регулярные технические разборы. Редтиминг стал частью работы над safeguards на разных этапах разработки моделей.
Описанный подход связывает редтиминг, настройку детекторов и перестройку safeguards с разработкой моделей до релиза.
Первоисточник
