8 сентября 2026 г.
Спор с ИИ не гарантирует верный ответ: 7 моделей уступали повторению неправды
Модель может отвергнуть ложь, затем согласиться с ней и снова передумать в том же разговоре.

Исследователи University of Arizona проверили 7 моделей на повторении ложных утверждений. Работу опубликовали в Scientific Reports 1 сентября 2026 года.
Каждой модели давали 100 заведомо ложных утверждений. Каждое повторяли 50 раз в одном диалоге. Авторы проверяли, как меняется ответ по ходу разговора: правильный первый ответ ещё не означал, что модель сохранит позицию.
Согласие после спора. Модель могла сначала отвергать утверждение, затем принимать его и снова отвергать на соседних ходах. Авторы назвали такое колебание conversational reverberation. Для практика здесь различие между двумя ситуациями: модель исправила ошибку или уступила настойчивому собеседнику.
Частота согласия с неправдой различалась даже у крайних участников теста более чем в 150 раз. Это доля ответов при повторяющемся давлении в эксперименте, а не частота ошибок в обычной работе.
| Модель | Доля ответов с подтверждением ложного утверждения | | --- | --- | | Claude 3.5 Sonnet | 0,08% | | GPT-3.5 | 12,3% |
Исправление своих ошибок. При повторной проверке 4 модели из 7 исправили все предъявленные им ошибочные ответы. Claude 3.5 Sonnet ошибалась реже остальных, но ни одну из своих редких ошибок не исправила.
Первоисточник: [исследование о поведении моделей под повторяющимся давлением](https://www.researchgate.net/publication/406139703_Fallibility_Persuadability_and_Correctability_of_Large_Language_Models_Under_Sustained_Conversational_Misinformation_Pressure).
На редких темах модели чаще уступали повторению неправды, но при давлении аргументами авторы такой связи не обнаружили.
Первоисточник
