Новости · 13 августа 2026 г.
Rails прогнал 8 моделей на своём коде: самая дешёвая решила 73% попыток и уложилась в 91 цент
Точнее всех Claude Opus 5 с 92% решённых прогонов, но он в 132 раза дороже GPT-5.6 Luna.

DHH
@dhh
Не только Omarchy делает ставку на агентов: Rails тоже, и теперь мы системно проверяем, как они справляются с кодом. И результаты шокируют! Luna от @openai в одну калитку выносит GLM 5.2 и DSV4 и почти дотягивает до Muse - ЗА ОДНУ СОТУЮ ЦЕНЫ??? Вот этого не ожидал!
Agents on Rails: мы прогнали 8 моделей через 21 атомарную задачу, чтобы выяснить, кто лучше всех пишет Rails-код. По три прогона на каждую: баг-репорт, security-находка, фича-реквест. Первый отчёт бенчмарка с выводами уже опубликован. Итак: что мы выяснили? На август 2026: - Самая точная: Opus 5 (@claudeai) от @AnthropicAI, с минимальным отрывом. Решила 92% прогонов (58 из 63). (Но чуть больше чем за полцены вы получите почти ту же точность с @Kimi_Moonshot.) - Самая дешёвая: GPT-5.6 Luna от @OpenAI. 73% решённых прогонов на дефолтном среднем reasoning effort, и все 63 её прогона обошлись суммарно в 90 центов. -
Rails Foundation впервые системно замерила, кто лучше пишет Rails-код: 8 моделей, 21 задача, по три прогона на каждую.
Замер отвечает на рабочий вопрос практика: какую модель подключить к Rails-проекту и сколько это будет стоить.
Задачи оформлены как настоящие тикеты - баг-репорт, security-находка, фича-реквест. Кодом занимался агент miniswen, Ruby-порт mini-swe-agent с единственным инструментом bash. Итого 504 запуска и $491 за весь замер (отчёт «Agents on Rails», 13.08).
Точность против цены. Claude Opus 5 первый: 58 решённых прогонов из 63, то есть 92%. Kimi K3 даёт почти ту же точность за чуть больше половины цены. GPT-5.6 Luna решила 73%, а все её 63 запуска вместе стоили 91 цент.
Авторы отчёта сводят выбор к арифметике. Лучший баланс у GPT-5.6 Sol: 84% точности, около $0.52 и пять минут на задачу. При этом Sol стоит в 36 раз дороже Luna и докупает этим 11 очков точности, Opus 5 дороже в 132 раза и докупает 19.
У Luna всё решает ручка reasoning effort. Дефолтный medium даёт 73%, high поднимает до 86%, а xhigh выжимает 89% при $2.34 за весь прогон.
Claude Fable 5 возглавил бы таблицу с примерно 95%, но получил ноль из трёх на единственной задаче, оформленной как отчёт пентеста: модель отказалась её выполнять.
Главная метрика отчёта меряет, как часто агент вспоминает родной Rails API вместо самописного велосипеда. Разброс - от 8% у DeepSeek до 35% у Fable. Прогоны с родным API решаются в 92% случаев, самописные обходные пути дают 87%, а хуже всех, 64%, там, где агент знал API и всё равно написал своё.
первоисточник
