5 сентября 2026 г.
Рейтинг моделей стало труднее подогнать: 40% Intelligence Index закрыто от лабораторий
Artificial Analysis обновила Intelligence Index 4 сентября: доля закрытых тестов выросла вдвое, до 40% веса.

Artificial Analysis
@artificialanlys
Представляем Artificial Analysis Intelligence Index v4.2. Мы ускоряем часть работ по будущему релизу v5 и выпускаем промежуточные обновления, чтобы поспевать за фронтиром. В индексе v4.2 задачи стали сложнее и ближе к реальности, а закрытых тестовых наборов стало больше, чтобы под них нельзя было подстроиться. Чейнджлог Intelligence Index v4.2: + AA-Briefcase, наша оценка агентной работы со знаниями, с закрытым тестовым набором + GDP.pdf от @HelloSurgeAI, рассуждение по длинному контексту из документов на 4592 страницы PDF - GPQA Diamond, отличная оценка научного рассуждения, которая теперь насыщена … плюс больший вес отложенных тестовых наборов, чтобы под них нельзя было подстроиться, и обновление инфраструктуры оценивания ради устойчивости Это обновление приближает индекс к реальным сценариям: задачи сложнее, ближе к жизни, а закрытые наборы не дают под них подстроиться. Элементы индекса v5 мы планируем и строим уже несколько месяцев: прошло 8 месяцев с запуска индекса v4 в январе. Мы намеренно придерживали обновления, чтобы индекс оставался стабильным во время недавних крупных запусков моделей. Но фронтир в последние недели двигается так быстро, что нам важно выпустить промежуточное обновление прямо сейчас: индекс должен оставаться таким же актуальным и полезным для пользователей, как раньше. Помимо этого промежуточного обновления команда вовсю работает над v5 индекса. В ближайшее время планируем ещё несколько поэтапных релизов. Оставайтесь на связи! Изменения Intelligence Index v4.2 в подробностях: ➤ Добавили AA-Briefcase: наша внутренняя оценка с закрытым отложенным тестовым набором. AA-Briefcase проверяет модели на реалистичных агентных задачах работы со знаниями внутри сложных проектов, собранных отраслевыми экспертами. Модели оцениваются на многонедельных проектах, в каждом из которых много связанных задач и тысячи исходных файлов. AA-Briefcase сочетает оценку по рубрике и попарное сравнение, чтобы измерить проверяемый успех задачи, качество анализа и качество подачи, и даёт целостную картину агентных способностей в работе со знаниями. ➤ Добавили GDP.pdf: оценка от @HelloSurgeAI проверяет однораундовое рассуждение по профессиональным документам на 100 PDF из десяти областей. Модель должна свести воедино данные, разбросанные по 4592 страницам: текст, таблицы, графики, сноски, исключения. Ответы оцениваются по 1275 атомарным критериям, написанным экспертами, а главная метрика All-pass Rate засчитывает задачу, только если выполнены все критерии. ➤ Вес ради измерения реальной работы и защиты от подгонки: теперь 40% веса индекса приходится на закрытые отложенные тестовые наборы, вдвое больше, чем в v4.1. В закрытые данные входят AA-Briefcase, AA-Omniscience и решения для CritPt. Лабораториям стало труднее подстраиваться под оценки. В индексе v5 доля закрытого вырастет ещё. ➤ Улучшили инфраструктуру оценивания: в AA-LCR v1.1 мы добавили системный промпт для оценивания и исправили ошибки и неоднозначности в ключах ответов, так что оценки стали точнее. Для GDPval-AA v2 и AA-Briefcase мы улучшили сэмплирование и заново заякорили шкалу Elo: рейтинги стабильнее при добавлении новых моделей. Для SciCode мы сделали песочницы оценивания устойчивее, чтобы медленный, но верный код не считался ошибкой. Главные результаты: ➤ Индекс возглавляют Anthropic и OpenAI: первое место у Claude Fable 5.1 от Anthropic, следом идёт GPT-6 Astra от OpenAI, прибавивший 4 пункта к GPT-5.6 Sol. Третья лаборатория в таблице лидеров - Meta, дальше SpaceXAI, Moonshot/Kimi, Z AI и Google ➤ Границу Парето по стоимости задачи делят четыре лаборатории: на обновлённой границе Парето «стоимость за задачу» стоят Anthropic, OpenAI, Meta и Z AI ➤ GPT-6 Astra доминирует на границе Парето по выходным токенам: GPT-6 Astra экономнее по токенам, чем почти любая другая модель рядом с границей интеллекта, а по краям кривой стоят Claude Fable 5.1, Grok 4.5 и Gemini 3.5 Flash-Lite (модели ниже 25 по индексу не учитываются)

· 2,7 тыс. просмотров
GPQA Diamond из индекса выбросили: модели решают его почти без промахов, различать по нему больше нечего.
Место освободили под закрытые наборы. Теперь на тесты, которых нет в открытом доступе, приходится 40% веса индекса: вдвое больше, чем в версии 4.1. Натренировать модель под вопросы, которых лаборатория не видела, нельзя.
Что добавили. AA-Briefcase ведёт модель через многонедельные рабочие проекты: связанные задачи и тысячи исходных файлов, оценка идёт и по результату, и по качеству разбора. GDP.pdf от Surge AI просит собрать ответ из 100 документов на 4592 страницы и проверяет его по 1275 критериям, причём задача засчитывается, только когда выполнены все.
Кто наверху. Первое место у Claude Fable 5.1, второе у GPT-6 Astra: он прибавил 4 пункта к GPT-5.6 Sol. Третьей лабораторией идёт Meta, за ней SpaceXAI, Moonshot/Kimi, Z AI и Google.
По расходу токенов GPT-6 Astra экономнее почти всех моделей у верхней границы. По краям этой кривой стоят Claude Fable 5.1, Grok 4.5 и Gemini 3.5 Flash-Lite.
Версия 4 индекса вышла в январе, восемь месяцев назад. Правки придерживали, пока выходили крупные модели, а часть версии 5 компания вытащила раньше срока.
Долю закрытых наборов Artificial Analysis обещает поднять ещё в индексе версии 5, который выйдет частями.
Первоисточник