23 сентября 2026 г.
Чем больше багов исправляет агент, тем дороже прогон: 37 моделей Bug Hunt Bench
На 23 сентября Bug Hunt Bench собрал 133 строки от 37 моделей: цена прогона растёт по экспоненте с числом исправленных багов.

Раньше на карте Score vs cost приходилось сравнивать число исправленных багов и цену по строкам. Теперь Павел Хурын наложил через ChatGPT линию тренда: модель выше неё исправляет больше багов за свои деньги.
В июльской волне GPT-5.6 Luna на max исправила 33 из 105 багов за $1.80. Fable 5 исправила 24 бага за $68.07.
Одинаковый маршрут. Каждая модель получает один prompt и по одному прогону в двух репозиториях с 105 заранее внесёнными багами. Независимый судья вслепую сверяет diff со скрытым ключом.
Стоимость на доске бывает фактическим счётом, расчётом по прайсу, нижней оценкой или нулём для free. Автор просит не ранжировать суммы разных типов как сопоставимые доллары.
Автор добавляет модели после GitHub Issue с названием модели, её собственным CLI и способом запуска.
Первоисточник
