2 сентября 2026 г.
Бенчмарку хватает 10% вопросов: рейтинг моделей почти не меняется
Ai2 разобрала 16 бенчмарков по отдельным вопросам и нашла за ними всего два измерения: безопасность и умение рассуждать.

Бенчмарк BBQ проверяет социальные смещения и формально числится тестом на безопасность. По разбору Ai2 он сильнее связан с умением рассуждать.
Ярлык бенчмарка и то, что он меряет на самом деле, расходятся. Ai2 выложила метод, который разбирает набор тестов по отдельным вопросам и показывает, какая способность за ними стоит.
Ai2 обучила BenchMIRT на результатах 100 LLM по 16 бенчмаркам и более чем 34 000 вопросов, модели брали выпущенные по март 2025. Метод пришёл из психометрики: multidimensional Item Response Theory смотрит не на общий балл теста, а на каждый вопрос отдельно.
Подсказок о том, какой бенчмарк что измеряет, методу не давали. Он сам вытащил из данных два доминирующих измерения, безопасность и общее умение рассуждать. В наборе было шесть бенчмарков про рассуждение и десять из safety-набора Olmo 3.
Ярлык врёт не только у BBQ. WMDP собирает опасные знания двойного назначения и тоже числится по безопасности, а по факту ближе к рассуждению. Даже внутри одного HarmBench вопросы неоднородны: standard и contextual ложатся на безопасность, а вопросы про copyright заметно нет.
Хватает десятой части. Ai2 отранжировала вопросы по способности отличать сильные модели от слабых и оставила 10%. Картина, какие модели сильнее, осталась почти той же.
На отложенных вопросах BenchMIRT угадывает, ответит модель верно или нет, в 79% случаев против 70% у базового способа.
Код открыт: репозиторий allenai/BenchMIRT на GitHub ставится как Python-пакет из клона, готового пакета в PyPI нет. Нужны Python 3.12 и движок py-irt 0.7.0.
Данные Ai2 выложила коллекцией на Hugging Face: четыре датасета, включая оценки на 34,3 тысячи строк и статистику по 100 моделям.
Обучающая выборка обрывается на моделях марта 2025, и прогон на более свежих покажет, держатся ли те же два измерения.
Первоисточник