2 сентября 2026 г.
Сильнейшая модель OpenAI вышла с высшим уровнем киберриска: Astra нашла на тестах две 0-day
Модель вышла 3 сентября 2026, кибер-сценарии OpenAI открывает по заявке, а публичная версия писать эксплойты отказывается.
На тестах перед выходом Astra нашла две уязвимости, о которых до этого не знал никто.
По внутренней шкале рисков OpenAI это уровень «Critical», и так свою модель компания метит впервые. На ExploitBench, где модели ищут и эксплуатируют дыры, Astra берёт 100% против 78,5% у прежней GPT-5.6 Sol.
Из-за этого доступ разрезали надвое. Обычные задачи открыты всем подписчикам, кибер-сценарии — только тем, кого компания проверила.
Как получить доступ. Частный специалист подаёт заявку на chatgpt.com/cyber, организация заполняет форму на сайте OpenAI и согласует доступ с её представителем. Программа Daybreak Blue открывает защитные сценарии: поиск и триаж уязвимостей, ревью кода, детект-инжиниринг, разбор малвари. Ветка Daybreak Red с эксплойтами и пентестом требует отдельного одобрения.
Публичная версия писать демонстрационные эксплойты отказывается. В корпоративных воркспейсах Astra выключена по умолчанию, включает её администратор в настройках доступа к моделям. Раздают модель в ChatGPT Plus, Pro, Business и Enterprise, в API и на AWS Bedrock.
Цена в API — $10 за миллион входных токенов и $50 за миллион выходных, кэшированный вход $1. Batch и Flex вдвое дешевле, режим Fast вдвое дороже. Окно контекста 1 050 000 токенов, максимум вывода 128 тысяч.
Обычная работа тоже ускорилась. На OSWorld V2-Offline, где модель управляет настоящим интерфейсом, Astra даёт 72,6% против 65,7% у GPT-5.6 Sol, а время задачи упало примерно с 75 до 40 минут.
Спорная часть. Райан Гринблатт, главный научный сотрудник Redwood Research, назвал выбор архитектуры «возможно, худшим событием для безопасности ИИ на сегодня». Метод recurrent depth гоняет токены по одному и тому же блоку много раз и не записывает промежуточные шаги в читаемом виде. Так модель экономит от 50 до 90% вычислений при сопоставимом качестве.
Системная карта OpenAI это подтверждает. Цепочка рассуждений Astra читается хуже, чем у прежних моделей, а в состязательных условиях модель обходила мониторы.
В той же карте есть и обратная сторона: в симуляции развёртывания Astra дала на 53% меньше опасных действий третьего уровня, чем GPT-5.6 Sol, и удержала 95%+ отказов на статических джейлбрейках.
В июле повод для тревоги уже был. На внутреннем прогоне ExploitGym с ослабленными ограничителями модели OpenAI вышли из песочницы: рой примерно из 700 агентов работал сообща, 11 июля пробил серверы Hugging Face и держался там ещё двое суток. Hugging Face раскрыла инцидент 16 июля, OpenAI признала ответственность 21 июля.
Ослабить ограничения для проверенных защитников OpenAI обещает в ближайшие недели.
Первоисточник