12 сентября 2026 г.
ИИ-агенты решают меньше половины задач на реальном коде: лидер Real-SWE решил 38,8%
Real-SWE проверил 8 связок модели с тестовой средой на 10 задачах из приватных production-кодовых баз (Specific Labs, 13.09.2026). Лидер Fable 5.1 + Claude Code решил 38,8% задач, GPT-6 Astra + Codex CLI набрал 33,8%, Gemini 3.8 Flash + Gemini CLI 31,2%. Всего авторы провели 640 прогонов. Resolution rate равен pass@1, его считают по 8 независимым запускам каждой задачи и показывают с 95%-ными доверительными интервалами.

По сравнению с FrontierCode и DeepSWE эталонное решение в Real-SWE меняет 11 файлов против 6 в медиане (Specific Labs, 13.09.2026). Медианная инструкция содержит 1742 символа.
Сложность. В 6 из 10 задач resolution rate ниже 15%: Analytics stream reducer дал 0%, а Tax jurisdiction 3,1%. Один rollout стоит от $2,50 у Gemini 3.8 Flash до $6,96 у Fable 5.1.
По длительности прогонов разница небольшая: неудачей закончились 71,4% запусков короче 10 минут и 73,4% более длинных. В выборке есть Luma/Partiful с 200 тысячами+ пользователей, финтех-платформа для частных клиентов со 100 тысячами+ банковских выписок и корпоративные платформы продаж с ИИ.
Проверка. Каждый агент работал в изолированной песочнице. Задачи использовали формат Harbor, а проверяющие добавлялись во время оценки.
Повторить замер со страницы пока можно только через запрос доступа к sample tasks: публичной инструкции установки там нет.
Первоисточник
