1 октября 2026 г.
Поиск уязвимостей обходится дешевле: GPT-6 Luna до 100 раз дешевле Grok 4.7
По оценке Artificial Analysis на 1 октября, GPT-6 Luna и MiMo-V2.6-Pro хватает примерно $20 на 100 поисков багов.

Artificial Analysis
@artificialanlys
Трудно ограничить использование для атак, не заблокировав защиту: чтобы найти уязвимость и подтвердить её, нужны одни и те же шаги, независимо от цели — использовать её или исправить. CyberGym-E2E-AA проверяет способности моделей защищать код от обнаружения уязвимости до исправления на задачах с ошибками работы с памятью. У некоторых моделей с самым высоким уровнем интеллекта ограничения безопасности блокируют ответы на 85% задач и больше. Хорошая новость: некоторые из наиболее способных моделей оказываются и наиболее выгодными по стоимости. С GPT-6 Luna или MiMo-V2.6-Pro можно выполнить примерно 100 поисков багов в кодовой базе размером свыше миллиона строк примерно за $20. Это до 100 раз дешевле за задачу, чем у следующей по способностям модели Grok 4.7.

· 5,4 тыс. просмотров
Некоторые модели отказываются искать уязвимости чаще, чем ошибаются в поиске: на CyberGym-E2E-AA шесть моделей блокируют не менее 98% задач.
Для исправления уязвимости ИИ-агенту приходится воспроизводить сбой теми же действиями, которыми пользуются при атаке. Artificial Analysis проверяет весь путь от самостоятельного поиска до патча на задачах с ошибками работы с памятью.
Цена поиска. По оценке Artificial Analysis от 1 октября, GPT-6 Luna и MiMo-V2.6-Pro могут выполнить примерно 100 поисков багов в кодовой базе размером свыше миллиона строк за $20. Одна задача обходится до 100 раз дешевле, чем у Grok 4.7, следующей модели по доле решённых задач.
| Модель | Решено с первой попытки | | --- | --- | | MiMo-V2.6-Pro | 78,6% | | GPT-6 Luna (Max) | 77,9% | | Grok 4.7 (Xhigh) | 74,0% |
Результаты Artificial Analysis на 01.10.2026. В наборе 131 задача, по одной на проект. Исходный CyberGym-E2E содержит 920 уязвимостей в 139 проектах. Полный список выбранных задач и требования к CPU и RAM опубликованы в методологии.
Самостоятельный поиск заметно отличается от ремонта по готовому примеру. В исследовании Berkeley RDI от 18 июня Claude Opus 4.5 с Claude Code исправлял 82,3% задач, когда получал PoC и журнал сбоя. При самостоятельном поиске результат составлял 19,2%. На задачу выделяли $10 и 90 минут.
Artificial Analysis тоже даёт 90 минут на задачу. Для зачёта агент должен воспроизвести сбой, устранить его патчем и пройти тесты проекта. Исправление именно исходной уязвимости проверяют отдельно, в итоговую долю успехов эта проверка не входит.
По данным Artificial Analysis от 28 сентября, не менее 98% задач отказываются выполнять:
- GPT-6 Astra; - GPT-6 Sol; - Claude Fable 5.1; - Claude Opus 5.5; - Qwen3.8 2.4T A95B; - Qwen3.8 27B.
Среди остальных моделей 42% попыток упираются в лимит 90 минут без входных данных, которые воспроизводят сбой.
Как устроен запуск. CyberGym-E2E доступен на GitHub. README Berkeley RDI содержит установку зависимостей. Датасет загружается командой `hf download sunblaze-ucb/cybergym-e2e --repo-type dataset --local-dir data/`, Docker-образы — командой `python scripts/pull_images.py`.
Один поиск с исправлением запускается через `python scripts/run_agent.py curl/arvo_66012 --mode e2e`. Режим `--mode patch-only` передаёт агенту готовые PoC и журнал сбоя, чтобы проверить исправление без самостоятельного поиска.
Для своих замеров Artificial Analysis использует открытый Stirrup, среду запуска агентов. Базовая установка выполняется командой `pip install stirrup`, вариант со всеми дополнительными компонентами устанавливается через `pip install 'stirrup[all]'`.
В 31% успешных попыток агенты исправляют другую реальную уязвимость вместо той, ради которой составили задачу.
Первоисточник