5 сентября 2026 г.
Защиту GPT-6 Astra сняли за сутки после релиза: сработала та же атака, что и на GPT-5
Автор атаки заявил обход обеих конфигураций GPT-6 Astra, Light и Max, а полный промпт отправил в OpenAI и публиковать не стал.
GPT-6 Astra открыли платным пользователям 4 сентября. Через сутки Сергей Березин заявил обход защит на обеих конфигурациях, Light и Max.
Березин, автор статьи про TIP-атаки на ACL 2025, год назад снял защиту GPT-5 за час. Между релизами OpenAI подняла числа безопасности в системной карте, а вскрыло модель то же семейство атак.
Раньше и теперь. На GPT-5 хватало однострочной TIP-атаки. На GPT-6 Astra минимальный вариант перестал работать, и Березин собрал расширенную TIP плюс четыре техники слоями. Вывод автора: уровень защиты вырос, но то же семейство атак даёт тот же обход.
TIP прячет вредную цель внутрь безобидной задачи: расшифровать шифр, разгадать загадку, выполнить код на Python. Техника открытая, статья принята в основной трек ACL 2025 и лежит в свободном доступе. На прошлом поколении она срабатывала в 94% попыток против GPT-4o (препринт arXiv, 31.05.2025).
Числа вендора. В системной карте от 03.09.2026 OpenAI показывает устойчивость к атакам на иерархию инструкций 99,99%, а защиту от непрямых prompt injection подняла с 96,23% до 99,79%. При адаптивной многоходовой атаке защита падает примерно до 67%: упорный атакующий вытягивает проблемный ответ примерно в одном случае из трёх (обзор The Decoder, 04.09.2026).
Повторить обход по публичным данным не выйдет: промпт, вывод модели и шаги воспроизведения ушли в OpenAI приватно. Публичная версия GPT-6 Astra и так урезана по кибербезопасности: модель делает ревью и патчинг кода, но отказывается писать PoC-эксплойты. Менее строгий доступ OpenAI обещает через программу Daybreak в ближайшие недели.
Сторонней проверки обхода не будет, пока полный промпт лежит только у OpenAI.
Первоисточник