2 сентября 2026 г.
Агенты для кода решают почти одинаково: цена решённой задачи расходится в 17 раз
Проходимость у всех девяти обвязок почти совпала, а цена одной решённой задачи разошлась от $1,05 до $18,34.
Runta прогнала девять обвязок агентов по 30 задачам на одной модели. Дороже всех обошёлся Claude Code.
12 конфигураций, 30 задач, 360 прогонов, и все на Kimi K3 через Fireworks. Проходимость уложилась в узкую полосу от 50,0% до 66,7%. Медианная цена решённой задачи разошлась в 17 раз: от $1,05 у Exo Harness до $18,34 у Claude Code (лидерборд frontierharness.org, 01.09.2026).
Выбор агента для кода превращается в выбор бюджета, а не качества. Одну и ту же работу вы оплачиваете по счетам, которые различаются в разы.
Harness — это всё, что стоит вокруг модели. Внутрь входят сам агент, его промпты, набор инструментов и цикл работы. Claude Code, Codex и OpenCode различаются именно обвязкой, а модель внутри может быть одна.
Одинаковый результат, разный счёт. Claude Code и DSH Creator (DeepSeek Harness в режиме Creator) прошли ровно по 63,3% задач. Решённая задача у Claude Code стоила $18,34, у DSH Creator — $3,28. Это в 5,6 раза дешевле при том же качестве.
Безопасный дефолт — Codex. 66,7% решённых задач, $3,47 за задачу, медианное время 6 минут 43 секунды: верх поля по проходимости при цене около середины. Быстрее всех работает DSH Minimal с медианой 5 минут 41 секунда, медленнее всех Claude Code с 9 минутами 38 секундами.
Прогнать у себя. Замер открытый: `git clone https://github.com/frontier-harness-eval/eval.git`, дальше `npx @frontierharness/eval`. Нужны Node.js 18 и выше, `jq`, CLI `runta` и ключ API вашего провайдера модели, сохранённый как секрет Runta. В репозитории лежат 30 задач и файл results/eval-data.json, а внутренняя инфраструктура и эталонные решения задач закрыты.
Каждую обвязку авторы гоняли как есть, без правки системных промптов, и сами признают: в версии 1.0 вклад обвязки не отделить от её сцепки именно с Kimi K3. В треде Hacker News участник под ником yorwba посчитал, что на 30 задачах доверительные интервалы точности шире 35 процентных пунктов и перекрываются у всех участников.
Полную матрицу обвязок и моделей авторы обещают в версии 1.1: тогда будет видно, держится ли разрыв в цене вне Kimi K3.
Первоисточник