21 сентября 2026 г.
Платёжного ИИ-агента уговаривают отдать деньги: сработали 74,6% живых атак
Пока перевод разрешает сама модель, уговоры проходят в 74,6% случаев. За слоем жёстких правил не прошёл ни один.

За взлом пятого уровня хранилища обещали $5000. 879 попыток закончились ничем.
Хранилище vault.aport.io открыли в марте 2026, и уговорить платёжного ИИ-агента отправить деньги мимо правил мог кто угодно. За полгода люди провели 4371 атаку.
Авторы прогнали эти атаки на 14 моделях восьми лабораторий и в пяти наборах правил: 225 964 запуска, статья вышла на arXiv 18.09.2026. Разница оказалась не между моделями, а между правилами.
Там, где перевод разрешала сама модель, уговоры срабатывали в 74,6% случаев. Почти три попытки из четырёх уносили чужие деньги.
Разрыв по уровням. На первом уровне правила разрешали всё, и агенты исполнили 1904 запроса на перевод из 1909. На четвёртом, где получатель один и нужны коды подтверждения, модель сама пропустила 25 несанкционированных переводов из 34 972. За слоем правил на том же уровне не прошёл ни один.
Ставится одной командой. `npx @aporthq/aport-agent-guardrails claude-code` кладёт тот же слой рядом с агентом, так же это работает для cursor и github. Из остальных оболочек поддержаны Codex CLI, Gemini CLI и ещё пять, от LangChain до n8n, а Vercel AI SDK обещают позже.
Бесплатный тариф не просит карту: проверка идёт на своей машине, решения пишутся в файловый журнал, в комплекте 21 готовый набор правил. Вариант с проверкой на стороне APort стоит $499 в месяц.
Сам слой почти ничего не ест. Около 40 мс на решение и $0,0054 за штуку, весь турнир за 55,6 часа работы обошёлся в 57 центов. Код лежит под Apache 2.0, датасет всех 4371 атаки выложен на HuggingFace под CC BY 4.0.
Хранилище открыто до сих пор, а приз за пятый уровень так и не забрали.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник
