1 октября 2026 г.
Кто дописал код после отказа: Coding Agent Index теперь показывает запасную модель
Результат агента в рейтинге включает работу запасной модели, если она завершила задачу после отказа основной.

Artificial Analysis
@artificialanlys
В Artificial Analysis Coding Agent Index теперь можно увидеть, когда происходят отказы по соображениям безопасности и какие модели используются вместо отказавших. Мы добавили два способа изучить результаты: ➤ Момент отказа: можно увидеть, отказался ли агент сразу по условию задачи или позже, когда уже начал работать. ➤ Запасная модель: можно увидеть, на какую модель агент переключился после отказа, а также попытки, которые были остановлены. Claude Code с Sonnet 5.5 (max) сейчас занимает первое место в Index. Его доля отказов по соображениям безопасности составляет 4,5%, почти вдвое меньше 8,9% у Claude Code с Opus 5.5 (max). Около 94% отказов Sonnet 5.5 произошли после первого хода. После отказа агент почти всегда переключался на Opus 4.8. Мы наблюдаем разные схемы переключений в зависимости от модели и конфигурации агента. С Fable 5.1 Claude Code преимущественно переходил на Opus 4.8, а у Devin Fusion в Index на Opus 5 приходилась гораздо большая доля переходов. Оба вида доступны для общего Index и каждого бенчмарка. Провайдер настраивает отказы по соображениям безопасности и переходы на запасные модели и может менять эти настройки со временем. Эти доли отражают поведение, которое мы зафиксировали при тестировании.

· 3,5 тыс. просмотров
У Claude Code с Sonnet 5.5 (max) почти 94% отказов произошли уже после начала работы. После отказа агент почти всегда переходил на Opus 4.8.
Раньше Artificial Analysis показывала долю отказов. С 1 октября можно узнать, когда агент отказался и кому передал задачу. При выборе ИИ-агента для кода итоговый балл стоит читать как результат всей связки, включая запасную модель.
Лидер тоже переключается. Claude Code с Sonnet 5.5 (max) занимает первое место в Index и отказывается почти вдвое реже конфигурации с Opus 5.5 (max). Artificial Analysis зафиксировала такие результаты на 1 октября:
| Модель в Claude Code | Доля отказов | | --- | --- | | Sonnet 5.5 (max) | 4,5% | | Opus 5.5 (max) | 8,9% |
Запасную модель выбирают по настройкам провайдера. С Fable 5.1 Claude Code преимущественно переходил на Opus 4.8. В Devin Fusion на Opus 5 приходилась заметно большая доля переходов.
В результатах v1.5 от 18 сентября Fable 5.1 имела наибольшую долю переходов на запасные модели. Эти переходы уже входили в итоговые оценки:
| Агент с Fable 5.1 | Доля переходов в весе Index | | --- | --- | | Claude Code | 8,8% | | Devin Fusion | 7,1% |
Где посмотреть замены. В Coding Agent Index откройте Safety Refusals → Safety Refusal Rate. Переключатель Timing разделяет отказы сразу по условию задачи и отказы после начала работы. Fallback model показывает остановленные попытки под меткой Blocked и переходы на Claude Opus 4.8, Claude Opus 5 или GPT-5.6 Sol.
Оба вида доступны для общего Index и отдельных бенчмарков:
- DeepSWE v1.1. - Terminal-Bench 4.0. - SWE-Atlas-QnA.
Artificial Analysis учитывает в Safety Refusal Rate и остановки, и переходы на запасную модель. Каждый бенчмарк получает одинаковый вес, а повторные попытки, которые заменили другими, исключаются из расчёта.
За Blocked агент получает 0 баллов, а завершённую запасной моделью задачу оценивают обычным образом. Доля Blocked в 2% означает потерю максимум 2 пунктов Index.
Провайдеры могут менять настройки отказов и запасных моделей, поэтому эти доли относятся к зафиксированным прогонам.
Первоисточник