19 сентября 2026 г.
Рейтинг ИИ-агентов теперь считает отказы: Fable 5.1 дала 8,8% fallback в Claude Code
18 сентября 2026 года Artificial Analysis добавила в Coding Agent Index v1.5 метрику Safety Refusal Rate. Она считает попытки, где модель или провайдер отказались начать или продолжить задачу. Claude Fable 5.1 показала максимальную долю fallback: 8,8% веса индекса в Claude Code и 7,1% в Devin Fusion.

Artificial Analysis
@artificialanlys
Отчётность по отказам из соображений безопасности теперь доступна в Artificial Analysis Coding Agent Index. В последней версии Coding Agent Index v1.5 мы добавили отчётность по отказам из соображений безопасности, чтобы объяснить поведение моделей и разницу в баллах. Такой отказ происходит, когда провайдер или модель отказывается начать или продолжить задачу по соображениям безопасности. Агент может переключиться на другую модель, чтобы продолжить работу, или остановить попытку с блокировкой. У Claude Fable 5.1 была самая высокая доля fallback в Claude Code и Devin Fusion: такие попытки составили 8,8% и 7,1% веса индекса соответственно. Поэтому эти результаты включают показатели моделей, на которые происходило переключение. На наблюдаемые доли могут влиять разброс отказов, накопление контекста в harness, настройки усилий и стратегии повторных попыток.

· 2 тыс. просмотров
До v1.5 индекс не выделял отказы по безопасности отдельной метрикой. Теперь Safety Refusal Rate показывает долю попыток, где модель или провайдер не начали или не продолжили задачу. Индекс собирает результат из 303 задач в трёх равновесных бенчмарках: DeepSWE v1.1, Terminal-Bench 4.0 и SWE-Atlas-QnA. Каждую задачу запускают трижды.
Как считается результат. При fallback Claude Code и Devin Fusion могут переключиться на другую модель или продолжить той же моделью, а попытка получает обычную оценку. У Claude Fable 5.1 такие попытки заняли 8,8% веса в Claude Code и 7,1% в Devin Fusion. Заблокированная попытка получает ноль, а 2% blocked safety refusals могут снизить итоговый индекс максимум на 2 пункта.
Итоговый балл v1.5 уже включает производительность моделей, на которые происходил fallback.
Первоисточник
