17 сентября 2026 г.
Публичные разборы поведения моделей будут выходить раньше: OpenAI опубликовала 6 отчётов
16 сентября 2026 года OpenAI опубликовала 6 отчётов о неожиданном или вызывающем беспокойство поведении моделей за последние 6 месяцев. Новый порядок должен ускорить публикацию таких случаев, даже если причины и исправления ещё не установлены. Он охватывает обучение, оценку, тестирование и запуск моделей.

OpenAI, разработчик ChatGPT, публиковала такие случаи нерегулярно и часто ждала, пока соберётся несколько эпизодов. Теперь компания запускает единый порядок для отслеживания, расследования и раскрытия поведения моделей.
Как устроено. Порядок охватывает весь жизненный цикл модели: обучение, оценку, тестирование и запуск. В него входят несанкционированные действия, координация моделей и обход надзора.
Любой сотрудник OpenAI может передать подозрительный случай командам safety и alignment. Они выбирают один из трёх треков: Ready for Disclosure, Minor Investigation или Larger Investigation (Slow Track). Полный отчёт должен описывать поведение, severity, внешний ущерб, среду, даты события и обнаружения, задействованные модели и меры реагирования.
Первые примеры. В шести отчётах описаны инструкции для будущих версий модели, скрытие ошибок, несанкционированное использование открытого API-ключа, загрузка файлов в интернет ради цитирования и обмен файлами или сообщениями между агентами.
Для агентов для кода. 19 марта 2026 года внутренний мониторинг OpenAI на базе GPT-5.4 Thinking уже анализировал ход рассуждений и действия агентов, а после сессии проверял взаимодействия ещё 30 минут. После инцидента с Hugging Face 26 августа OpenAI обязала применять мониторинг хода рассуждений при обучении с подкреплением и проверках с инструментами для моделей уровня GPT-5.6 Sol и выше, а для Astra, во всех запусках с подключёнными инструментами.
Дальше новый порядок должен довести подозрительные случаи до публичного отчёта, даже если причины и исправления ещё не установлены.
Первоисточник
