13 августа 2026 г.
Специализация не спасла медицинский ИИ: OpenEvidence дал 26,7% по кардиологии против 66,7% у ChatGPT
Первый систематический обзор 11 работ: выдуманных ссылок у платформы меньше, чем у универсальных моделей, а точность скачет от 27% до 94%.

Первый систематический обзор OpenEvidence вышел 12 августа в npj Digital Medicine: 11 исследований за 2024-2026 годы.
Платформу собирали как медицинскую замену универсальным чат-ботам, и с источниками она аккуратнее: выдуманных ссылок меньше, чем у обычных LLM. Дальше начинается разброс.
Разброс по темам. По костно-суставным инфекциям платформа ответила верно в 119 случаях из 126, по неврологическим рекомендациям попала в 82%, в имплантологии в 80%. По структурным заболеваниям сердца дала 26,7% верных ответов, а ChatGPT-4o на тех же вопросах 66,7%.
На живых вопросах врачей картина переворачивается. Из 50 таких вопросов OpenEvidence дал релевантный ответ в 48% случаев, универсальные модели меньше чем в 5%.
Тесты говорят иначе. Двумя месяцами раньше Nature Medicine прогнала те же системы по бенчмаркам. На MedQA из 500 вопросов OpenEvidence набрал 89,6%, Gemini 3.1 Pro 97,4%. На HealthBench разрыв шире, 62,6 против 88,0 у GPT.
Ещё одна находка обзора: система чаще подтверждает уже принятое врачом решение, чем меняет его.
Доступ бесплатный для верифицированных медработников. Регистрация идёт через NPI, десятизначный номер провайдера США, либо через рабочую почту или загрузку диплома, у студентов по студенческому. Есть приложения для iOS и Android.
Без NPI автоматическая проверка обычно не проходит, и Pro-режим с безлимитными запросами не открывается. Внутри платформы для тяжёлых вопросов работает DeepConsult: на 100 субспециальных случаях он дал 38-41% точности против 31-34% у быстрого режима, но отвечает 259 секунд вместо 13.
первоисточник