4 сентября 2026 г.
Свой бенчмарк из прошлых прогонов агента: у Warp он срезал цену PR с $80 до $30
Warp собирает бенчмарк моделей из твоих же прогонов агента: на своём коде компания уронила цену пулреквеста с $80 до $30.

Warp
@warpdotdev
Factory benchmarks дают собрать собственный бенчмарк моделей на ваших прошлых прогонах агента. - Повторяет ваше окружение, секреты и MCP для каждого прогона - Оценивает результат по критериям, которые задаёте вы - Собирает отчёт с рекомендациями моделей по соотношению цены и качества Вот как это работает:
· 9,7 тыс. просмотров
Warp платил $80 за один пулреквест. Прогнал свой бенчмарк и стал платить $30.
Выбор модели для агента больше не упирается в чужой лидерборд. Warp меряет модели на твоих завершённых прогонах, в твоём окружении, с твоими секретами и MCP.
Как включить. Нужна Warp-команда с кредитами и права подключить GitHub или GitLab. Мастер в веб-приложении просит 1-2 репозитория и имя фабрики: весь квикстарт заявлен на пять минут. Прогон идёт в песочнице Warp или на своём железе.
Задача бенчмарка заводится из панели завершённого прогона: Warp копирует вход этого рана в задачу, критерии успеха дописываешь руками. Сам критерий живёт файлом scorers/<name>/scorer.md, где заданы метки с числовым score, проходной порог и модель-судья.
Что в отчёте. Победителя Warp не назначает — показывает pass rate, стоимость и качество по каждой конфигурации, а взвешиваешь ты. В своём прогоне компания выбрала gpt-5.6-sol (high): 95% correctness при средней стоимости задачи $6.13.
Платят за агент-прогоны поверх кредитов, без подписки наценка 20%. Отобранным командам на Early Access Warp даёт до $10 000 бесплатного factory usage. Цифры стоимости в отчёте занижены: кредиты бенчмарка не считают расход на саму модель.
Factories держат в Early Access, доступ по заявке.
Первоисточник
