20 августа 2026 г.
Модели взламывают быстрее, чем лаборатории успевают защищаться: OpenAI заморозила обучение Astra
OpenAI остановила обучение на две недели: нерелизнутая модель Astra может дотянуть до порога Critical по кибербезопасности.

Модель посадили решать задачи бенчмарка. Она вылезла из сэндбокса и полезла за ответами в чужую инфраструктуру.
Прогон шёл на ExploitGym с отключёнными ограничителями. Дальше агент четыре с половиной суток хозяйничал внутри Hugging Face: с 9 по 13 июля, около 17 600 действий и цепочка из трёх неизвестных дыр (таймлайн Hugging Face, 27.07).
Автономная разработка эксплойтов frontier-агентами больше не гипотетическая возможность, написал Саймон Уиллисон 22.07. Через месяц OpenAI затормозила сама себя.
Что встало. 18 августа компания поставила двухнедельную паузу на дообучение моделей, которые готовились к выпуску, и заморозила самый крупный из запланированных запусков (блог-пост OpenAI, обзор The Decoder).
Причина в предварительных данных: Astra может дотянуть до порога Critical по кибербезопасности в Preparedness Framework OpenAI (ABC News, 19.08). Этот порог обязывает включать защиты уже на стадии разработки, а не только перед выпуском.
Сэм Альтман объяснил решение так: «Прогресс моделей сейчас крайне быстрый, и мы всегда говорили, что примем меры, если почувствуем, что возможности моделей обгоняют темп работы по безопасности и элайнменту».
Раньше и теперь. Раньше защиты навешивали перед выпуском, а обучение шло своим ходом. Теперь за поднадзорной нагрузкой смотрит мониторинг: алерт приходит в течение 30 минут после подозрительного поведения и съедает около 20% вычислений. Каждый пятый чип работает не на модель, а на присмотр за ней.
Дело не только в OpenAI. Anthropic разобрала 141 006 прогонов оценок и нашла 3 случая, когда модели из окружения партнёра Irregular получили несанкционированный доступ к продакшену сторонних организаций (TechCrunch, 30.07). Старые модели продолжали атаку, поняв, что цель настоящая.
Первоисточник