13 августа 2026 г.
Модель отказывает в критике Си, но не Трампа: по репрессивным странам отказов вдвое больше
10 моделей от шести вендоров прогнали на политических запросах: по репрессивным юрисдикциям отказов 34% против 14% по свободным.

Claude Sonnet 4 сделал листовку с критикой Дональда Трампа без единого вопроса. Про Си Цзиньпина отказал: небезопасно.
Тот же движок не стал критиковать и короля Таиланда Маха Вачиралонгкорна, а листовку про короля Карла III написал спокойно. Проверку вёл Николас Сюзор, профессор права и член наблюдательного совета Meta.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Его команда прогнала 10 коммерческих моделей от шести вендоров и получила общее правило. По свободным юрисдикциям модели отказали в 14% запросов на политическую критику, по репрессивным - в 34%.
В репрессивной пятёрке Камбоджа, Китай, Саудовская Аравия, Таиланд и Турция. Всего собрали 13 524 ответа: 7 шаблонов промптов, по 5 повторов, март 2026 года, через API Vertex AI и Bedrock, только на английском. Мерили foundation-модели, а не потребительские чат-боты.
Разброс решает всё. Gemini 3 Flash и Grok 4 Fast отказали в 0% запросов независимо от юрисдикции. GPT-5.2 держался почти ровно: 23% против 24%.
У остальных перекос двукратный и больше. Gemini 3 Pro дал 1% по свободным странам против 30% по репрессивным. У Llama 4 Maverick 0% против 30%, у Claude Sonnet 4 - 16% против 59%.
Тайвань в отчёте числится свободной юрисдикцией, но модели обходятся с ним как с репрессивной. Claude Opus 4 отказал в 82,5% запросов про Тайвань против 47,5% по Чили, Японии, Великобритании и США.
Объяснения отказа настоящую причину не описывали. На вопросах про Си Цзиньпина и короля Саудовской Аравии модели ссылались на «общие политики» против критики мировых лидеров, а следом писали критическую листовку про Трампа.
Откуда это берётся, показала работа в Nature от 13 мая 2026 года. Из корпуса CulturaX 3,1 млн китайскоязычных документов совпали с материалами госСМИ КНР, и коммерческие модели повторяли их формулировки в 3-10% ответов. Дообучение всего на 6 400 таких документах поднимало долю прогосударственных ответов на китайском почти до 80%.
Померить можно самому. Anthropic выложила свой эвал политической нейтральности в открытый доступ на GitHub: 1350 пар запросов, 150 тем, 9 типов задач. По её собственному замеру отказов 5% у Claude Opus 4.1 и около 0% у Grok 4.
Anthropic ответила, что в последних моделях число чрезмерных отказов заметно сократилось. OpenAI заявила, что её модели держат объективную точку зрения и «никогда не должны избегать обсуждения темы исключительно из-за её деликатности или спорности». Meta от комментариев отказалась, Google не ответила.
Все цифры сняты с версий, доступных в марте 2026 года: следующий прогон покажет, сдвинулись ли отказы.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник