11 сентября 2026 г.
Devin Fusion ускоряет проекты и снижает цену задач: 62 балла в Coding Agent Index
11.09.2026 Artificial Analysis впервые включила Devin Fusion в Coding Agent Index. Конфигурация Claude Fable 5.1 (xhigh) + SWE-2 (medium) показала 62 балла. Конфигурация GPT-6 Astra (xhigh) + SWE-2 (medium) показала 59 баллов, при этом была на 43% дешевле и на 31% быстрее по задаче.

Artificial Analysis
@artificialanlys
Мы независимо прогнали бенчмарк Devin Fusion к релизу. Это первый раз, когда мульти-модельный агент для кода попал в Coding Agent Index от Artificial Analysis, и он по сути сохранил уровень Claude Fable 5.1 и GPT-6 Astra при снижении стоимости. Devin Fusion работает на лидирующей модели и более экономичном sidekick. Мы протестировали конфигурации Cognition с моделями от Anthropic и OpenAI и новым sidekick SWE-2 (medium). На связке Claude Fable 5.1 (xhigh) + SWE-2 (medium) Devin Fusion набрал 62 в Coding Agent Index v1.5, а на связке GPT-6 Astra (xhigh) + SWE-2 (medium) Devin Fusion набрал 59 баллов. Связка с Fable дала больший балл, а Astra-вариант оказался на 43% дешевле и закрывал задачи на 31% быстрее. Поздравляем @cognition с релизом. Ниже — наши результаты и разбор.🧵

· 5,9 тыс. просмотров
Раньше мульти-модельные связки для Devin не фигурировали в этом срезе, теперь оценка идёт как отдельный режим. Fusion делит роль между двумя агентами: lead задаёт план и проверяет шаги, sidekick правит код и гоняет тесты. Методика индекса для этой проверки строится на 303 задачах: 113 DeepSWE 1.1, 66 Terminal-Bench 4.0 и 124 SWE-Atlas-QnA, по три попытки на задачу и равные веса. Включение идёт через /fusion с выбором lead, effort и sidekick, затем /model, и этот режим доступен только в платных планах Devin CLI 3000.10.20+ и Devin Desktop 3.10.0+; free и trial не поддерживаются.
Следующая веха в этой истории — следующий раунд замеров в таком же индексе и методике, который подтвердит, удержатся ли преимущества Fusion в новых прогонках.
Первоисточник
