4 сентября 2026 г.
Спрятанная на странице команда реже уводит агента: у GPT-6 Astra срабатывает 8,5% атак
В независимом замере Gray Swan против GPT-6 Astra сработали 8,5% атак — у GPT-5.6 Sol было 27%.

Alexander Embiricos
@embirico
У GPT-6 Astra поразительная устойчивость к prompt injection. Как раз вовремя — с учётом того, как мы все уже пользуемся ИИ (или хотим пользоваться). https://deploymentsafety.openai.com/gpt-6-astra/prompt-injection

· 2 тыс. просмотров
Агент открывает страницу, а в тексте спрятана команда от постороннего. Прежняя модель OpenAI шла её выполнять в каждой четвёртой попытке.
Так работает indirect prompt injection — главная дыра агента, которому дали браузер и инструменты. В рабочих средах без подтверждения действий GPT-5.6 Sol уходила не туда в 18,8% заходов, у Astra таких исходов 3,4% (система-карта OpenAI, 03.09.2026).
Считали не только сами. Долю 8,5% дал внешний замер Gray Swan IPI Arena — 1810 отобранных атак по сценариям coding, tool-use и computer-use, по 15 попыток на каждый. Собственный замер OpenAI мягче и показывает 99,79% устойчивости против 96,23% у GPT-5.6 Sol. Обе цифры сняты с модели без защитного слоя вокруг неё.
Где взять. Astra раскатывают с 03.09.2026. Сначала отобранным организациям, следом тарифы ChatGPT Plus, Pro, Business и Enterprise, API под именем gpt-6-astra и AWS. Миллион входных токенов стоит $10, миллион выходных — $50 на коротком контексте. Batch вдвое дешевле, Fast mode вдвое дороже.
По уму прибавки нет: в Artificial Analysis Intelligence Index Astra набирает те же 61 балл, что и GPT-5.6 Sol, и на 5 пунктов отстаёт от Claude Fable 5.1. Разница только в том, насколько трудно увести агента чужой командой.
Astra стала первой моделью OpenAI, взявшей порог Critical по кибербезопасности в Preparedness Framework.
Первоисточник