13 августа 2026 г.
У умения рассуждать появился свой рейтинг: первым в нём идёт Opus 5 с 73,6 балла
Индекс собрала Anthropic - и первое место в нём заняла её собственная модель.

Бенчмарк меряет не код, а умение разобрать чужой аргумент. Такого числа у моделей до сих пор не было.
Anthropic выложила Conceptual Reasoning Index 12 августа. На 10 августа таблицу возглавляет Opus 5 с 73,6 балла из 100, разброс замера ±2,1 балла.
Что меряют. CRI складывается из трёх бенчмарков с весами 60/20/20: основной вес несёт LMCA, где модель критикует чужую позицию. В нём 560 текстов-позиций, 1461 аргумент против них и 2140 оценок экспертов. Ноль на шкале означает случайное угадывание. Методику авторы описали в статье на arXiv 29 июля, писали её исследователи Redwood Research и Итан Перес из Anthropic.
Потолок индекса авторы оценивают примерно в 91 балл. LMCA упирается в 85 из-за шума в человеческих оценках, а DTBench уже почти насыщен: Fable 5 отвечает там правильно в 98% случаев. С конца 2024 года баллы растут линейно, плато пока не видно.
Данные открыты наполовину. Главный датасет LMCA дают по заявке через Google-форму, ссылка стоит в самом посте. ACCoRD лежит открыто в репозитории casparoe/accord_public на GitHub: архив constraints_no_human_ratings.zip, 13 286 файлов, пароль к архиву coherence. Живой лидерборд и полная методология живут на conceptualreasoning.ai, авторы обещают обновлять сайт по мере выхода новых моделей.
Топовый комментарий в обсуждении на Hacker News собрал 77 баллов: закрытый бенчмарк оплатила Anthropic, и она же в нём первая. Там же разбирают процедуру замера - когда Fable 5 отказывалась отвечать, в зачёт шли ответы Opus 5.
LMCA, по оценке авторов, начнёт насыщаться примерно через год, и тогда главный вес индекса придётся отдать другому бенчмарку.
первоисточник