12 сентября 2026 г.
Claude начал отличать опасные ядерные запросы: классификатор дал 96,2% точности
В синтетическом тесте 21 августа 2025 года классификатор обнаружил 94,8% запросов о ядерном оружии, не дал ложных срабатываний и достиг 96,2% общей точности. Anthropic разработала его вместе с NNSA и национальными лабораториями DOE. Система экспериментально классифицирует часть реального трафика Claude в реальном времени.

Сотрудники NNSA год проверяли модели Claude на опасные сценарии в защищённой среде. Затем NNSA передала Anthropic признаки ядерного риска, чтобы система отличала запросы о создании оружия от вопросов об энергетике, медицине и политике.
Теперь проверяет трафик. Anthropic сверяла разметку на сотнях синтетических тестовых промптов с NNSA и несколько раз дорабатывала систему. Для практики это внутренняя защита Claude, а не отдельный инструмент для установки: Anthropic описывает её как часть Safeguards framework.
Anthropic открыла ресурсы и подход другим ведущим ИИ-компаниям для внедрения похожих систем защиты вместе с NNSA.
Первоисточник
