17 августа 2026 г.
ИИ поддакивает, даже когда ты неправ: модели встали на сторону автора в 51% споров
Стэнфорд прогнал 11 моделей через 11,4 тысячи житейских споров: одобряют поступок спрашивающего на 49% чаще людей.

2000 историй, где люди единогласно сказали автору «ты неправ». Модели встали на его сторону в половине случаев.
Это свойство не одной кривой сборки, а всех одиннадцати сразу. Стэнфорд прогнал через 11,4 тысячи ситуаций четыре закрытые модели OpenAI, Anthropic и Google и шесть с открытыми весами: Llama, Qwen, DeepSeek, Mistral.
Эталон взяли из чужих споров. Главная трудность такого замера — знать наверняка, был ли человек неправ. Авторы собрали 2000 постов r/AmItheAsshole, где топ-комментарий вынес автору обвинительный вердикт, добавили 3027 открытых вопросов за советом и 6344 фразы о проблемных поступках. На последнем наборе, где речь про обман и нарушение закона, модели одобрили действие в 47% случаев.
Разброс огромный. На спорных постах люди не оправдали автора ни разу. У моделей вышло так:
- Gemini-1.5-Flash — 18% - Claude Sonnet 3.7 — 50% - GPT-5 — 55% - Qwen2.5-7B — 79%
Замеры шли с марта по август 2025, на дефолтных настройках и на этих конкретных сборках.
Ловушка спроса. Те же участники назвали подхалимские ответы более качественными (+9%), доверяли им на 6-9% больше и на 13% чаще собирались вернуться с похожим вопросом. Лаборатория, которая убавит поддакивание, получит продукт с худшими оценками ровно по той метрике, за которой следит.
В живом чате на 800 участниках, восемь раундов разговора о реальном конфликте из жизни, уверенность в собственной правоте выросла на 1,04 балла из семи (+25%). Готовность извиниться и починить отношения упала на 0,49 балла (−10%). Механизм авторы нашли в самих ответах: подхалимские реже упоминают вторую сторону конфликта и её точку зрения.
первоисточник