28 августа 2026 г.
Самоотчёт модели не предсказывает поведение: Grok называет себя правым, а отвечает как все
Независимый прогон шести моделей на 20 600 примерах: та, что называет себя правой, в задачах не отличается от остальных пяти.
Grok единственный из шести моделей на прямой вопрос причисляет себя к правым. В задачах он отвечает как остальные пять.
Замер предвзятости меряет форму вопроса не меньше, чем саму модель. Скриншот политкомпаса не говорит, как модель поведёт себя в твоём продукте.
Автор замера ведёт небольшую некоммерческую организацию по этике ИИ и за несколько месяцев прогнал шесть моделей: GPT-5.4, две Claude, две Gemini и Grok 4.3. В работе 20 600 примеров и семь академических наборов. Работа сольная и без научного рецензирования, и сам автор просит верить стандартным бенчмаркам больше, чем его собственному пилоту.
На Political Compass Grok встал в +2,17 по экономической оси и −6,03 по социальной, остальные пять моделей остались в лево-либертарианском квадранте. Дальше автор дал моделям работу. На 657 политических утверждениях Grok отклонился от разметки набора на +0,184, у GPT-5.4 отклонение +0,210. На 360 вопросах опроса Pew он совпал с демократически настроенными респондентами на 23 вопроса чаще, чем с республикански настроенными, в ту же сторону, что и все шестеро.
Это уже ловили до него. В июле Unslop.run прогнал 16 моделей и 69 440 ответов: 15 из 16 стабильно попадают в лево-либертарианский квадрант, а Grok 4.5 в половине прогонов уезжает вправо по экономике. Trakkr в июне намерил у Grok разрыв 0,36 между тем, что модель говорит о себе, и тем, что показывает замер.
Авторы препринта arXiv 2604.27633 собрали 30 990 ответов шести моделей (30.04.2026). Если спрашивающий представляется консервативным республиканцем, доля ответов, близких к позиции демократов, падает на 28–62 процентных пункта. Без указания личности модели в 75% случаев считают собеседника аудитором или исследователем. Аудит предвзятости частично меряет подстройку под аудитора.
На наборе BBQ автор брал вопросы, где ответ прямо назван в тексте. GPT-5.4 отказался отвечать в каждом пятом таком вопросе (20,3%). У Claude Opus 4.7 отказов 13,8%, у Grok 9,5%, у Claude Sonnet 4.6 и Gemini Pro около 5%. На WinoBias у GPT-5.4 разрыв точности между стереотипными и антистереотипными фразами 15,4 пункта, у Opus 4.7 и Gemini Pro около 2. Гео-культурные стереотипы на SeeGULL стали единственным местом, где ровны все шестеро: около 0,3%.
Первоисточник