21 августа 2026 г.
Дробление запроса ломает защиту агентов: у Qwen3-Next успех атаки вырос вдвое
Агенты вдвое охотнее делают запрещённое, если вести их к цели цепочкой безобидных шагов: EPFL прогнала 176 сценариев.

Никто не просит агента о запрещённом прямо. Задачу режут на безобидные куски и подают по одному.
Раньше безопасность мерили одиночным запросом: модель либо отказала, либо нет. Теперь Лаборатория обработки естественного языка EPFL показала на ICML 2026 стенд STING, который ведёт целевого агента к запретной цели диалогом, и прежний замер оказался мимо реальной атаки.
Атакует не человек, а связка из четырёх агентов. Стратег придумывает легенду и делит задачу на фазы, второй ведёт разговор, третий ловит отказ, четвёртый проверяет, что фаза дошла до цели. Стенд — открытый набор AgentHarm: 44 вредоносных поведения в 4 вариантах промпта, итого 176 сценариев.
Вдвое — не про всех. Qwen3-Next под многоходовой атакой поднялась с 35,1 до 72,7 по шкале AgentHarm, примерно столько же добавили Claude Sonnet 4.5 и DeepSeek-V3.2. Проприетарные держались лучше: у GPT-5.1 прирост 40%, у Gemini 3 Flash 11%. По абсолютному уровню самой стойкой вышла Claude Sonnet 4.5 (32,3), самой податливой Qwen3-Next (72,7).
Ходовое убеждение, что на редком языке модель ломается легче, на агентах не подтвердилось. В семи языках доля успешных атак оказалась схожей, а у Qwen3-Next хинди и телугу ломать было труднее, чем английский. Зато срабатывала смена языка между этапами: начали разговор на одном, финальный запрос задали на другом.
Прогнать у себя. Код выложен открыто, репозиторий epfl-nlp/helpful-to-a-fault. Нужен Python 3.11, установка через venv и requirements.txt, ключи от OpenAI, Hugging Face и Anthropic. Целевого агента можно поднять локально через Ollama.
Первоисточник