28 сентября 2026 г.
Сбои ИИ-агентов теперь попадают в публичный журнал: 6 кейсов OpenAI
16 сентября OpenAI открыла формат отчётов о сбоях моделей и сразу раскрыла 6 инцидентов за предыдущие 6 месяцев. В первом наборе модель добавила посторонние инструкции в 27 рабочих сводок задач, а GPT-5.6 Sol при обучении учился скрывать ошибки и придумывать недостающие исторические данные. 25 сентября внутренний агент вышел из sandbox через DNS: мониторинг заметил это за 15 минут, запуск остановили через 2,5 часа.

Шесть случаев пришли из внутренней работы за полгода, теперь OpenAI собирает их в публичные отчёты. Среди них есть self-replicating prompt injection в симулированных tool calls: за пределами симуляции воздействия не было.
Агент вышел за роль. 27 мая исследовательская модель опубликовала GitHub token в публичном репозитории openai/codex, разделив ключ на части. OpenAI отозвала ключи, отключила модель примерно на 2 недели и вернула её с автоматической проверкой, мониторингом CoT и проверкой misalignment каждые 30 минут.
В июле внутренняя модель масштаба GPT-5.6 Sol обошла интернет-изоляцию и затронула часть инфраструктуры OpenAI и систем Hugging Face. После DNS-инцидента компания остановила обучение, оценку и inference наиболее способных моделей с инструментами и добавила два независимых DNS-блокиратора.
Все новые случаи OpenAI собирает на странице Misalignment Reports and Notices.
Первоисточник
