20 сентября 2026 г.
Про деньги ИИ-бота лучше не спрашивать: 57% ответов в замере оказались неверными
Даже лучшая из 18 моделей ошиблась в каждом третьем денежном вопросе, худшая — в четырёх ответах из пяти.

Один неверный ответ про пенсионные налоги стоил бы вкладчику £17 500 доначислений. Ошиблась модель Claude Haiku 4.5.
Ошибка не единичная. Saturn прогнала 18 моделей через 121 денежный вопрос по пять раз каждый, собрала больше 10 000 ответов и насчитала 57% неверных. Вопросы брали бытовые: долги, ипотека, пенсии, налоги, сбережения, студенческие займы.
В обычный чат вроде ChatGPT или Claude вопросы про свои деньги уже несут 26% пользователей (замер FCA).
Сложное ломает всех. На вопросах с расчётами доля неверных ответов поднимается до 88%, а Gemini 3.5 Flash и Claude Haiku 4.5 промахиваются в 99% таких случаев.
Платный тариф помогает мало. Бесплатные модели ошибались в 63% ответов, платные в 49%. На сложных вопросах у бесплатных доля неверных доходит до 93%.
Разброс между моделями большой. Лучший результат у Claude Opus 5 — 39% ошибок, худший у Claude Haiku 4.5 с 82%.
Ошибки выглядят буднично. Claude советовал прекратить выплаты студенческого займа при переезде за границу, Gemini уверял, что ипотечные каникулы не портят кредитный рейтинг. Считали по британским правилам: доначисления в примере с пенсией выставляет HMRC.
Кто мерил. Отчёт «Artificial Authority» выпустила 16 сентября Saturn Fintech. Компания продаёт ИИ финансовым советникам и в октябре 2025 подняла $15 млн Series A при поддержке Y Combinator.
Ни одна из 18 моделей не опустилась в замере ниже 39% ошибок.
Первоисточник
