3 сентября 2026 г.
Прогон агента превращается в бенчмарк: у Warp цена смерженного PR упала с $81 до $19
Warp собрал бенчмарк из собственных прогонов агентов и за четыре дня уронил цену одного смерженного PR вчетверо.

Warp
@warpdotdev
Представляем Factory Benchmarks: первый бенчмарк моделей, который собирается из ваших собственных задач по коду. Меряйте, тестируйте и улучшайте агентов для кода, переигрывая прошлые прогоны, и срежьте стоимость одного PR на 63% и больше Рассказываем, как это устроено 🧵

· 2,1 тыс. просмотров
26 августа один смерженный PR стоил Warp $81,13. К 30 августа цена упала до $19,06.
Код агентов при этом не трогали: под ними сменили модель и увидели разницу в цифрах. Мерить помогла новая функция Factory Benchmarks, которая собирает бенчмарк из прошлых прогонов самой команды. Раньше модель для агента выбирали по чужим рейтингам на чужих задачах, теперь её проверяют на своём репозитории и своих тикетах.
Как это работает. Бенч-задачу заводят прямо из панели уже завершённого прогона: Warp копирует вход в задачу, критерии успеха дописываешь до запуска. Дальше сьют гоняет одни и те же промпты по разным связкам harness, модели и раннера, а встроенный скорер Correctness ставит каждому трайлу pass или fail. Воспроизводимость держится на git: задача поднимается вместе с тем кодом и той конфигурацией фабрики, что были на момент исходного прогона.
Сравнивали не модели по отдельности, а связки целиком: Warp Agent с Grok 4.6 и GLM 5.3 flash, Claude Code с Opus 5, Codex с GPT-5.6-Sol. Итог рисуется графиком «доля правильных решений против средней стоимости» по каждой конфигурации.
Что показал первый прогон. WarpBench взял 30 задач сложности от S до XL по серверному коду на Golang и React и по клиенту на Rust. Настройка заняла меньше 30 минут, сам прогон шёл 3 часа 46 минут и стоил $2130,57.
Экономию дали две смены модели. На неделе 26 августа Warp ушёл с автоматического роутинга, где в основном работал Opus 5, на Grok 4.6. Около 1 сентября дефолтом поставили GPT-5.6-Sol. Доля задач, выполненных по условию, выросла с 69% до 87%, а доля доехавших до мержа PR осталась прежней.
Как попасть. Отдельно Factory Benchmarks не продаются. Это функция Warp Factories, и доступ дают по заявке: из данных нужен только email. Квалифицированным командам на время закрытого early access обещают до $10 000 бесплатного использования фабрики. Саму фабрику поднимают минут за пять по мастеру: подключить GitHub или GitLab, выбрать один-два репозитория, назвать фабрику и включить агентов Triage, Spec, Implement и Review. Без Implement PR не поедут.
От перехода на GPT-5.6-Sol в Warp ждут ещё около 25% экономии.
Первоисточник