21 августа 2026 г.
ИИ пока не вытягивает разбор медкарт: лидер замера MLCR-AA взял 64,4%
Artificial Analysis прогнала модели по медицинским делам на 150 страниц. Лидер набрал 64,4%, медианная модель не дотянула до 15%.

Artificial Analysis
@artificialanlys
Представляем MLCR-AA, нашу таблицу по бенчмарку MLCR (Medical Long Context Reasoning) от Wisedocs: рассуждения по длинным медицинским делам. Мы гоняем самые тяжёлые категории вопросов из закрытой части, лучший результат у Claude Fable 5 — 64,4%. MLCR-AA проверяет модели на реалистичных синтетических медицинских и страховых делах, которые собрала команда @wisedocsai по той работе с документами, на которой специализируется их платформа. Наша таблица считается на приватной отложенной выборке из 60 вопросов двух самых сложных категорий: Expert, где нужно специализированное медицинское рассуждение по всему делу целиком, и Compound, где в один запрос упаковано несколько независимых вопросов. Каждый вопрос задаётся к полному делу на ~70–150 страниц, а ответ оценивает панель из трёх моделей-судей по полноте и точности, плюс тест на краткость, который ограничивает многословные ответы по сравнению с экспертными. Точность проверяет, что ответ опирается на исходные документы и контекст дела, а полнота оценивает, выдала ли модель те же ключевые детали, что есть в размеченных экспертами ответах. Тест на краткость проверяет, что модели не выдают чрезмерно длинный текст (больше 5x длины экспертных ответов). В MLCR-AA лидируют свежие релизы Claude от @AnthropicAI: Claude Fable 5 с 64,4% и Claude Opus 5 (от 53,9% до 59,4% на разных бюджетах рассуждений). Kimi K3 (max) от @Kimi_Moonshot — лучшая модель с открытыми весами, 38,3%. Главное из результатов MLCR-AA: ➤ Разбор медицинских документов сегодня частично по силам ИИ, но дорого и с запасом для роста: лучшая модель (Claude Fable 5) набирает 64,4% при цене $1 за задачу, медианная модель — меньше 15% ➤ Модели держатся исходных документов, но упускают ключевые детали, нужные для полного ответа: почти 40% протестированных моделей берут выше 80% по точности, подавляющее большинство остаётся ниже 50% по полноте. Модели в основном правы в том, что сообщают, и опускают много информации. GPT-5.6 Terra (max) показывает лучшую точность, 93,7%, и всё равно занимает 10-е место из-за полноты ➤ Модели Anthropic лидируют за счёт полноты, а не точности: самые высокие оценки у моделей Anthropic, но их точность сопоставима с сильнейшими моделями OpenAI или ниже. Отрыв даёт покрытие всего объёма эталонного экспертного ответа Спасибо Wisedocs за создание MLCR и за сотрудничество, благодаря которому бенчмарк приехал в Artificial Analysis!
Модель получает историю болезни на 150 страниц и вопрос, который обычно решает профильный врач. Лучший ответ дотягивает до 64,4% от эталона.
Так устроен MLCR-AA, таблица Artificial Analysis по бенчмарку MLCR от Wisedocs, открытая 21.08.2026. Модели разбирают синтетические медицинские и страховые дела, собранные по реальной работе с документами, на которой специализируется платформа Wisedocs.
Что меряют. 60 вопросов из закрытой части, две самые тяжёлые категории. Expert требует рассуждения профильного врача по всему делу целиком, Compound упаковывает несколько независимых вопросов в один запрос. Ответы судит панель из трёх моделей по точности и полноте. Отдельно штрафуют многословие: ответ длиннее эталонного в пять раз не проходит.
Модели не врут, а недоговаривают. Почти 40% участников берут выше 80% по точности, но подавляющее большинство остаётся ниже 50% по полноте. GPT-5.6 Terra (max) показала лучшую точность замера, 93,7%, и всё равно заняла десятое место: подвела полнота.
Модели Anthropic вышли вперёд именно полнотой: по точности они на уровне сильнейших моделей OpenAI или ниже. Claude Fable 5 закрывает 64,4%, Claude Opus 5 набирает от 53,9% до 59,4% в зависимости от бюджета рассуждений. Лучшая модель с открытыми весами — Kimi K3 (max) с 38,3%.
Разбор одного дела у лидера стоит $1. Медианная модель на том же наборе вопросов остаётся ниже 15%.
Следующая планка — полнота: пока лучшие модели дают меньше половины деталей эталонного ответа.
Первоисточник
