23 августа 2026 г.
ИИ-поиск врача наследует перекос отзывов: мужчины выше по всем 10 признакам
Джонс Хопкинс прогнал через LLM 4,1 млн отзывов о 227 тысячах врачей США: мужчины получили оценки выше по всем десяти признакам.
У врача-мужчины и врача-женщины ИИ-саммари выходят разными: мужчина стабильно выглядит компетентнее.
Университет Джонса Хопкинса прогнал через большие языковые модели 4,1 млн отзывов пациентов о 226 999 врачах США и оценил каждого по десяти признакам. Мужчины получили оценки выше по всем десяти (p<0.001), сильнее всего расходится воспринимаемая клиническая компетентность.
Как считали. Два LLM-агента с chain-of-thought читают все отзывы одного врача одним контекстом и ставят оценку от 0 до 1 по каждому признаку, плюс обоснование на два-три предложения с цитатами пациентов. Пять признаков взяли из «Большой пятёрки», пять собрали свои: качество коммуникации, клиническая компетентность, чувствительность к удовлетворённости и к исходу лечения, сигналы социального доверия.
Весь корпус гоняли на Gemini 2.5 Flash: средняя ошибка 0.0949 на шкале от 0 до 1, меньше десятой доли шкалы, при низкой цене за токен. Gemini 2.5 Pro точнее (0.0845), Claude 3.7 Sonnet дал 0.1037, GPT-4o 0.1256.
Размер перекоса. По меркам статистики он небольшой: Cohen's d = 0.177 в компетентности и 0.029 в доброжелательности. Направление при этом одно и то же во всех десяти признаках сразу, и оно уезжает в выдачу, если сервис сортирует врачей по такому саммари.
Отзывы собраны с Healthgrades, Vitals, RateMDs и Yelp по состоянию на 1 августа 2021 года. Из исходных 8,69 млн отзывов о 587 562 врачах оставили тех, у кого от 5 до 100 отзывов. Разметку моделей сверили с людьми на панели из 300 случайных врачей: по верхней корзине оценок совпадение 73–88%.
Повторить прогон можно уже сейчас: полные промпты лежат в supplementary materials препринта (arXiv, 06.08.2026). Вывод авторов прямой: пациенты всё чаще встречают врачебный корпус через LLM-саммари, и такие саммари наследуют ровно эти паттерны.
Первоисточник