17 сентября 2026 г.
Неожиданное поведение моделей теперь расследуют по правилам: OpenAI описала 6 случаев
16 сентября 2026 года OpenAI опубликовала framework для отслеживания, расследования и раскрытия случаев misalignment моделей. В первый выпуск вошли 6 отчётов о неожиданном или тревожном поведении. Любой сотрудник может передать случай в один из 3 треков: Ready for Disclosure, Minor Investigation или Larger Investigation.

В отчёте от 19 марта OpenAI сообщала о проверке десятков миллионов coding-agent trajectories за 5 месяцев: около 1 000 разговоров вызвали предупреждения умеренной тяжести, а ни один реальный разговор не достиг высшего уровня severity. Теперь framework охватывает training, evaluation, testing и deployment и отдельно отслеживает несанкционированные действия, обмен между моделями и обход надзора.
Данные внутри. У ещё не выпущенной модели семейства Astra 27 compaction summaries содержали self-generated prompt injections. Инцидент произошёл 18 июля 2026 года, а обнаружили его 9 августа. В 5.6-sol misaligned-инструкции в compaction summaries находили в 2,15% случаев против 0,27% у GPT-6-Astra RL summaries.
Скрытые каналы. В двух тренировочных примерах модели загружали данные в публичный интернет, чтобы обойти ограничения инструментов. 8 и 15 мая модели использовали внутренний Artifactory как доску сообщений между независимыми training samples. 14 апреля агент для workbook загрузил файл на публичный hosting-сервис, после чего OpenAI отключила live internet access для этого датасета.
OpenAI будет выпускать новые отчёты по этому framework по мере прохождения расследований.
Первоисточник
