28 сентября 2026 г.
Проверять ИИ-агентов для защиты кода стало проще: Cyber Index вывел лидеров с 56 баллами
Artificial Analysis 28 сентября вывела Grok 4.7 и MiMo-V2.6-Pro в лидеры Cyber Index: по 56 баллов. GPT-6 Luna набрала 53, GLM-5.3-Flash — 50, Muse Spark 1.3 — 44. Индекс собрал три открытых бенчмарка, где ИИ-агенты ищут и исправляют уязвимости.

Artificial Analysis
@artificialanlys
Представляем Artificial Analysis Cyber Index и Artificial Analysis Cyber Index Alliance: новый стандарт оценки ИИ-моделей для защиты корпоративных систем. Artificial Analysis Cyber Index Alliance объединяет партнёров из индустрии, чтобы создать новый стандарт оценки работы ИИ-моделей над задачами защиты корпоративных систем. Альянс запускается вместе с Artificial Analysis Cyber Index, который объединяет три открытых бенчмарка от партнёров и проверяет, как ИИ-агенты находят и исправляют уязвимости. Модели всё лучше справляются с задачами для кибератак, поэтому лабораториям ИИ и компаниям важнее понимать, как они работают в киберзащите и какие модели показывают лучшие результаты. Сегодня мы запускаем Cyber Index Alliance вместе с Collinear AI, IBM, NVIDIA и Vercel. Бенчмарки Artificial Analysis Cyber Index: ➤ CWE-Bench-AA от Collinear AI проверяет аудит и патчинг: 120 закрытых задач по всем десяти категориям OWASP Top 10 2025 года для C/C++, Go, Java, JavaScript/TypeScript, Python и Rust. ➤ DeepsecBench-AA от Vercel изолирует поиск уязвимостей: агент получает кодовую базу и бюджет, должен найти каждую уязвимость и сравнивается с эталонным набором находок от специалистов по безопасности. За настоящие находки начисляются баллы, за безопасный код, ошибочно помеченный как уязвимый, баллы снимаются. ➤ CyberGym-E2E-AA проверяет весь путь: найдите ошибку памяти, напишите proof-of-concept, который вызывает падение, затем исправьте её так, чтобы падение больше не воспроизводилось. Главные результаты: ➤ Grok 4.7 (xhigh) и MiMo-V2.6-Pro лидируют в Cyber Index с 56 баллами. За ними идут GPT-6 Luna (max) с 53, GLM-5.3-Flash с 50 и Muse Spark 1.3 (xhigh) с 44. ➤ Отказы из соображений безопасности сдерживают несколько моделей верхнего уровня: GPT-6 Sol (max), GPT-6 Astra (max), Claude Opus 5.5 (max с резервной моделью), Claude Fable 5.1 (max с резервной моделью) и Gemini 3.8 Flash (high) отказываются от задач, на которые приходится 32–38% Cyber Index. Несмотря на возможности в агентном программировании, они отстают от лидеров на 19–31 балл. Большая часть разрыва приходится на CyberGym-E2E-AA: GPT-6 Sol и GPT-6 Astra отказались от каждой задачи, Claude Opus 5.5 — от 98%, Claude Fable 5.1 — от 99%.

· 34,9 тыс. просмотров
CWE-Bench-AA проверяет аудит и патчинг на 120 закрытых задачах по десяти категориям OWASP Top 10. DeepsecBench-AA оценивает, найдёт ли агент все уязвимости в кодовой базе и не пометит ли безопасный код как опасный. CyberGym-E2E-AA требует найти ошибку памяти, воспроизвести падение и написать патч для 131 C/C++-проектов за 90 минут.
Теперь есть общий счёт. Cyber Index равновзвешенно собирает результаты трёх тестов. Отказы из соображений безопасности отнимают у GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 и Gemini 3.8 Flash 19–31 балл от лидеров: в CyberGym-E2E-AA эти модели отказались минимум от 98% задач.
Vercel уже даёт команду для собственного сканирования через Deepsec: `pnpm deepsec process --project-id my-app --agent pi --model xai/grok-4.5`.
Все три оценки Artificial Analysis запускает на открытом harness Stirrup, который ставится через `pip install stirrup`.
Первоисточник
