23 июля 2026 г.
Агенты пока не заменяют профессионалов: лучшая модель решила 24% задач теста Berkeley
GPT-5.5 закрыла 24% заданий Agents' Last Exam - это лучший результат на тесте, о котором Hi-Tech Mail.ru написал 23 июля 2026. Berkeley собрал больше 1500 задач из 55 профессий, от разработки софта до морской инженерии, и на самом сложном уровне ноль решённых задач у всех: у Fable 5, Composer 2.5, Gemini 3.1 Pro и двух открытых китайских моделей.

GPT-5.5 закрыла 24% заданий Agents' Last Exam - это лучший результат на тесте, о котором Hi-Tech Mail.ru написал 23 июля 2026. Berkeley собрал больше 1500 задач из 55 профессий, от разработки софта до морской инженерии, и на самом сложном уровне ноль решённых задач у всех: у Fable 5, Composer 2.5, Gemini 3.1 Pro и двух открытых китайских моделей.
Что дальше: Прогнать свой реальный модуль на GPT-5.5 и Fable 5 и сравнить счёт: результат у них примерно равный, а одно задание у Fable 5 обошлось исследователям в 4-12 раз дороже.
Первоисточник