28 сентября 2026 г.
OpenAI хочет останавливать обучение frontier-моделей по тревоге: 3 слоя защиты
28 сентября OpenAI опубликовала initial guidelines для safety case при обучении frontier-моделей. Компания предлагает проверять alignment training, containment и monitoring, а при приоритетной тревоге ставить запуск на паузу.

Раньше у OpenAI не было опубликованных рекомендаций для этого этапа обучения. Теперь safety case должен пройти проверку руководства, а каждый проверяющий получает право остановить training run.
Следы остаются. OpenAI предлагает неизменно хранить транскрипты агентов и не показывать automated graders chain-of-thought модели. После серьёзного инцидента компания советует превращать выводы расследования в regression tests.
OpenAI пишет, что рекомендации уже внедряет внутри компании и будет развивать в ближайшие недели.
Первоисточник
