На арабском модели отвечают на медицинские вопросы хуже: минус 10,29% точности
источник: vademec.ru·
машинная выжимка · сверена с источником

Чем беднее язык данными, тем хуже модель отвечает на медицинские вопросы. Относительно английского и китайского арабский стоил 10,29% точности, бенгальский 7,24%, хинди 4,64%, португальский 0,73%. Замер вышел 8 августа 2026 в npj Digital Medicine: четыре модели прошли 442 вопроса из лицензионных медицинских экзаменов MedQA.
Дело в данных. Медицинский корпус MMedC собран из 25,5 млрд токенов на шести языках, где английский занимает 41,4%, китайский 18,6%, французский 17,1%. Арабского, хинди и бенгальского в нём нет вовсе. Разрыв в потерях выходит четырнадцатикратный: португальский теряет 0,73% точности, арабский 10,29%.
Русский в замер не попал. В MMedC на него приходится 7,5%, пятое место из шести языков.
Что с этим делать. Авторы предлагают RAG поверх локальных клинических руководств и проработанные промпты. Модель тогда отвечает не из памяти, а по загруженному руководству.
Замер открыт целиком. Датасет MedQA_USMLE_multilingual лежит на figshare под CC BY 4.0: 442 вопроса на хинди, арабском, бенгальском и португальском плюс файлы с ответами моделей и посчитанной точностью. Статья тоже открыта, пейволла нет.
Отвечали GPT-4o, Gemini 2.5 Flash и DeepSeek Chat, четвёртым номером шёл GPT-3.5 Turbo. Перевод вопросов на четыре языка делал сам GPT-4o. Это Comment с пилотным замером: текст приняли 27 июля 2026, через год с лишним после подачи 11 июня 2025.
Следующим шагом авторы называют расширяемый бенчмарк многоязычных медицинских способностей моделей.
первоисточник