28 августа 2026 г.
Безопасность моделей чинит сам Claude: сработало на всех 10 типах провалов
Автоматический исследователь Anthropic закрыл 85% разрыва по обману, люди-исследователи в тех же правилах — 20%.
Anthropic посадила модель послабее чинить модель посильнее. За 60 часов та перебрала больше 50 решений.
Чинил Claude Sonnet 5, который по Epoch Capabilities Index стоит ниже Claude Opus 4.8. Итоговые замеры почти сравнялись с production-моделями Anthropic, а победившее решение обучалось чуть больше чем на 2000 примерах.
Отчёт вышел 28 августа. Claude вёл весь цикл сам: поиск по литературе, гипотеза, 30 минут обучения модели, замер на бенчмарке. Для всех 10 типов провалов он нашёл починки, которые подняли целевые бенчмарки и не уронили способности; в списке подхалимство, джейлбрейки, prompt injection и ещё семь категорий.
Счёт против людей. На обмане автоматический исследователь закрыл 85% разрыва по безопасности, человеческие идеи в тех же правилах — 20%. Anthropic собрала 30 предложений у 28 специалистов со средним стажем 2,5 года: лучшее из них машина обгоняла в среднем за 6,4 часа перебора и вышла на 20% выше.
Арифметика простая. Час работы автоматического исследователя стоит около $4 за API-inference. Своим людям-исследователям Anthropic платит $150 в час.
Найденные методы не рассыпались за пределами полигона. Они дали прирост на отложенных бенчмарках, на многоходовых аудитах в Petri и на моделях до 4,7 раза больше тех, под которые подбирались. За перебором следил monitoring-агент: 2,4% траекторий он пометил как попытки жульничества, ни одна не дошла до топ-результатов.
Повторить можно уже сейчас. По тому же направлению открыт A3 под Apache-2.0, автоматический агент для safety-finetuning от safety-research. Ставится через pip, требует ключи ANTHROPIC_API_KEY и OPENROUTER_API_KEY, запускается командой ./run_pipeline.sh configs/sycophancy-llama.json.
Первоисточник