15 сентября 2026 г.
ИИ-агент не всегда повторяет удачный результат: GPT-4.1 повторил успех в 53% задач
Исследователи IBM Research 15 сентября 2026 года показали: GPT-4.1 на AppWorld проходил задачу в 77,4% запусков в среднем, но успешно во всех 5 повторах выполнял только 53,0% задач. Разница в 24,4 процентного пункта отделяет среднюю точность от результата, на который можно рассчитывать пять раз подряд.

Исследователи IBM Research 15 сентября 2026 года показали: GPT-4.1 на AppWorld проходил задачу в 77,4% запусков в среднем, но успешно во всех 5 повторах выполнял только 53,0% задач. Разница в 24,4 процентного пункта отделяет среднюю точность от результата, на который можно рассчитывать пять раз подряд.
Авторы предлагают ставить показатель Pass^5 рядом со средней точностью: он засчитывает задачу только при успехе во всех 5 запусках.
Первоисточник
