./новости · 23 июля 2026 г.
новость
Лучшая модель решила 24% рабочих задач в тесте Беркли: на сложном уровне у всех 0%
источник: @Hi-Tech Mail.ru на X ↗·
машинная выжимка · сверена с источником
На самом сложном уровне теста Agents' Last Exam ни одна модель не выполнила ни одного задания: 0%. Тест собрали в Center for Responsible, Decentralized Intelligence Калифорнийского университета в Беркли, разбор опубликован 23 июля 2026: 1500+ заданий из 55 профессий, от разработки ПО и графдизайна до морской инженерии и звукорежиссуры. Лучший результат у GPT-5.5 - 24%; проверяли также Fable 5, Composer 2.5, Gemini 3.1 Pro и две открытые китайские модели.
Почему это важно: Прежние бенчмарки мерили ответы на вопросы: модель отвечает, счёт растёт. Здесь мерили работу от начала и до конца, и счёт упал до четверти заданий. Проваливается там, где нужны глубокое знание предмета, длинное рассуждение и большой объём входных данных: ровно та часть работы, ради которой агента и нанимают. Второй результат замера про деньги: Fable 5 показала примерно то же, что GPT-5.5 и Composer 2.5, но одно задание у неё стоило в 4-12 раз дороже. Отрасль привлекла больше 1,6 трлн долларов; абсолютную цену задания в материале не называют, только разницу.
Что дальше: Возьмите свой типовой рабочий тикет целиком, а не отдельный вопрос, и прогоните двумя наборами моделей: сравните долю доведённых до конца задач и счёт за прогон.