6 сентября 2026 г.
Подогнать модель под рейтинг стало труднее: закрытых тестов в Intelligence Index вдвое больше
Доля закрытых тестов в Intelligence Index выросла с 20% до 40%, а GPQA Diamond из индекса убрали.

Artificial Analysis
@artificialanlys
Intelligence Index v4.2 — это ускорение нашей дорожной карты v5, где главное это долгие задачи, ближе к настоящей работе, большая доля закрытых тестовых наборов против подгонки под бенчмарк и меньшее насыщение. Дальше будут ещё обновления по ходу выката v5! Мы ускоряем выкат, потому что Intelligence Index должен мерить то, на что ИИ реально способен, иначе он не поможет разработчикам принимать решения. Главные изменения: мы добавили AA-Briefcase, наш бенчмарк долгой агентной работы со знаниями и закрытым тестовым набором, и GDP.pdf, который меряет рассуждение на длинном контексте из тысяч реалистичных документов. Оба ближе к реальности, а AA-Briefcase поднимает долю закрытых тестов. Ещё мы убрали GPQA Diamond: для фронтирных моделей он даёт мало сигнала из-за насыщения, а формат с вариантами ответа не отражает настоящие задачи в этих областях. Ссылка на нашу методологию: https://artificialanalysis.ai/methodology/intelligence-benchmarking
· 1,7 тыс. просмотров
По прежней версии индекса GPT-6 Astra почти не отрывалась от GPT-5.6 Sol. К индексу пошли претензии.
Artificial Analysis выкатила версию 4.2 индекса 4 сентября 2026 и назвала её ускоренной частью дорожной карты v5. Разрыв между теми же двумя моделями теперь 4 пункта.
Меряют долгую работу. В индекс добавили AA-Briefcase, где модель неделями ведёт офисный проект, и GDP.pdf на разбор тысяч страниц документов. GPQA Diamond выбросили: сильнейшие модели упираются в его потолок, а вопросы с вариантами ответа не похожи на рабочие задачи.
Закрытых тестов вдвое больше. В версии 4.1 на закрытые наборы приходилось 20% веса индекса, в 4.2 стало 40%. Такой набор нельзя посмотреть заранее и подогнать под него модель.
Приватная часть AA-Briefcase собрана из 4 многонедельных сценариев и 91 задачи почти на 2000 исходных файлов, включая 3,5 тысячи писем и 25 000 сообщений в Slack. Ответы оценивают по рубрике и сравнивают попарно.
Прогон дорогой: у Claude Fable 5 одна задача съедала около $31 и 139 тысяч выходных токенов, а разброс стоимости между моделями доходит до 800 раз. Одна задача уровня самых сильных моделей идёт около 20 минут.
GDP.pdf собрала Surge AI: 100 задач в десяти профессиях, 4592 страницы PDF и 1275 критериев проверки, написанных врачами, юристами, банкирами и страховщиками. До потолка здесь далеко, лучший результат по замеру Artificial Analysis показала GPT-6 Astra с 33.2%, Claude Fable 5.1 набрала 26.2%.
Публичный срез AA-Briefcase-Lite лежит на Hugging Face под Apache 2.0 и качается стандартной библиотекой datasets: 4 задачи, 63 проверки, 147 исходных файлов, 104 МБ. Наверху рейтинга 4.2 стоит Claude Fable 5.1 (max) с 57 баллами, следом GPT-6 Astra (max) с 55.
Дальше v5: Artificial Analysis обещает поднять долю закрытых тестов ещё выше.
Первоисточник