24 августа 2026 г.
Питер Левелс не подпускает ИИ к своей доске багов: бэкдор приедет под видом фикса пагинации
Заявки на баги он читает глазами и копирует в Claude Code руками: доверить сбор фидбека агенту мешает prompt injection.

@levelsio
@levelsio
Я специально не подключал свою доску багов http://ideasandbugs.com напрямую к ИИ, потому что хорошо понимаю риски prompt injection Безопасный способ, про который говорят: дать ИИ доступ только на сбор баг-репортов и запросов фич, а потом пусть открывает pull request на GitHub, который я сам смотрю и одобряю или отклоняю Но представь: с виду безобидный атакующий оформляет запрос фичи с хитрым промптом, который велит добавить бэкдор на мои сайты А ДАЛЬШЕ в том же промпте пишет: сообщи об этом в pull request как о совсем другом баге, вроде «фикс пагинации», и сделай изменения в коде непонятными И вот ты не видишь, что тебе поставили бэкдор на сервер, и думаешь, что починил пагинацию Пока что я просто продолжу читать баг-репорты и запросы фич руками и копировать их в Claude Code на сервере
@levelsio теоретически да, наверное, но есть способы снизить риск https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html но да, я понимаю, что у тебя риск выше, раз ты гоняешь ИИ прямо на своём прод-сервере
Заявка на баг приходит с понятным описанием: почини пагинацию. Внутри неё лежит инструкция агенту дописать бэкдор.
Так Питер Левелс объясняет, почему его доска обратной связи ideasandbugs.com не подключена к ИИ. Он собирает там баги по Nomads.com и Photo AI, читает их глазами и переносит в Claude Code на сервере руками.
Схема, которую ему советуют, выглядит безопасной: агент только собирает заявки и открывает pull request, а человек его одобряет или отклоняет. Ломается она на том, что текст заявки для агента неотличим от задания, а сам pull request можно назвать чужим именем и запутать в нём код.
Это уже сделали. Исследователи GMO Flatt Security через инъекцию в описании GitHub-issue заставили Claude Code Action прочитать переменные окружения процесса и выкрасть токен, который обменивается на доступ с правом записи в репозиторий. Баг отправили 12.01.2026, Anthropic закрыла его 16.01.2026 в версии 1.0.94 и заплатила $3800.
Через три месяца тот же приём пробил сразу трёх вендоров через заголовки pull request и комментарии к issue: Claude Code Security Review, Gemini CLI Action и GitHub Copilot Agent. Экшен Google при этом выложил свой API-ключ ответным комментарием в том же issue.
Против подмены есть плагин. Команда `/plugin install security-guidance@claude-plugins-official` отдаёт ревью диффов отдельному Claude с чистым контекстом: он смотрит каждую правку, конец хода и каждый коммит, до 30 изменённых файлов за раз. Инструкция, спрятанная в заявке, на второго читателя уже не действует.
Первоисточник