16 июля 2026 г.
OpenAI показала GPT-Red - внутреннюю модель для поиска prompt-injection
OpenAI анонсировала GPT-Red - внутреннюю модель, которая ищет уязвимости к prompt-injection в масштабе. По словам OpenAI, прошлые модели уязвимы к её атакам, а GPT-5.6 обучали противостоять этим атакам состязательно.

🚨 AI News | TestingCatalog
@testingcatalog
OpenAI анонсировала GPT-Red, внутреннюю модель для поиска уязвимостей к prompt-injection в масштабе. GPT-Red - сильный red-teamer, и наши прошлые модели крайне уязвимы к его атакам через prompt injection. Мы используем GPT-Red для состязательного обучения GPT-5.6: так модель становится намного устойчивее к prompt injection.


· 20,9 тыс. просмотров
Почему это важно: Prompt-injection - главная дыра AI-агентов: чужой текст в инпуте подменяет инструкции. OpenAI ставит атакующую модель против защитной и гоняет их друг об друга - тот же приём, что RLHF, но против инъекций. GPT-Red наружу не отдают, цифр устойчивости GPT-5.6 в анонсе нет.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Ждать бенчмарк устойчивости GPT-5.6 к prompt-injection в цифрах - без него анонс проверить нельзя. Практику: гонять свой агент на инъекции самому, а не верить на слово.
Первоисточник