Популярные ИИ-модели пока могут заметно ошибаться при ответах на вопросы, связанные с личными финансами. Финтех-компания Saturn протестировала 18 моделей, включая ChatGPT, Claude, Gemini, Copilot и Grok, и пришла к выводу, что в среднем 57% полученных ответов содержали ошибки, существенные пропуски или недостаточно важные предупреждения.
Для проверки исследователи подготовили 121 вопрос о пенсиях, налогах, долгах, сбережениях и других финансовых темах. Каждый вопрос задавался моделям по пять раз, что позволяло оценить не только правильность, но и стабильность их ответов. В общей сложности авторы работы получили более 10 тысяч отдельных ответов от разных ИИ-систем.
Особенно заметно проблемы проявлялись в сложных заданиях, где требовалось выполнить несколько последовательных вычислений или одновременно учесть несколько финансовых правил. В этой категории средний уровень ошибок достиг 88%, а у отдельных моделей неправильными или неполными признавались до 99% ответов.
Методика Saturn при этом была достаточно строгой. Ответ засчитывался как ошибочный не только в случае неверного расчета или фактической неточности. Модель также получала отрицательную оценку, если пропускала важные условия, не упоминала существенные риски или не учитывала предстоящие изменения финансового и налогового законодательства.
Среди результатов, приведенных в исследовании, наиболее высокий показатель ошибок оказался у Claude Haiku 4.5 — проблемы обнаружили в 82% ее ответов. Gemini 3.1 Pro ошибалась в 73% случаев, Grok 4.5 — в 59%, а GPT-5.6 Luna — примерно в 58% проверенных ответов.
Лучший результат среди протестированных систем показала Claude Opus 5 в режиме рассуждений. Однако даже у нее исследователи признали ошибочными 39% ответов. Это означает, что и наиболее точная из проверенных моделей не обеспечивала такого уровня надежности, при котором финансовые рекомендации можно было бы принимать без дополнительной проверки.
Авторы также обнаружили заметную разницу между бесплатными и платными версиями ИИ-сервисов. Бесплатные модели в среднем ошибались примерно в 63% случаев, тогда как у платных этот показатель составлял около 49%. На наиболее сложных финансовых вопросах доля неверных ответов бесплатных систем повышалась до 93%.
В одном из приведенных примеров Claude Haiku 4.5 неправильно объяснила британские правила налогообложения пенсионных выплат. По расчетам Saturn, если бы пользователь последовал такому совету, дополнительный налоговый платеж мог составить около 17 500 фунтов. В другом случае модель придумала несуществующее правило о прекращении выплат по студенческому кредиту после переезда выпускника за границу.
Отдельные ошибки касались рекомендаций людям с задолженностями. Некоторые модели советовали сначала погашать кредит или другой долг с самой высокой процентной ставкой, не принимая во внимание обязательные приоритетные платежи. Например, в Великобритании к ним могут относиться аренда жилья и муниципальный налог, последствия просрочки которых потенциально серьезнее.
Результаты также показывают, что уверенная формулировка ответа сама по себе не говорит о его правильности. ИИ способен представить ошибочную информацию в последовательной и убедительной форме, не обозначив уровень неопределенности. Особенно рискованным это становится в ситуациях, где небольшая неточность может привести к дополнительным налогам, штрафам или неудачному финансовому решению.
При интерпретации исследования важно учитывать, что Saturn сама занимается разработкой ИИ-инструментов для финансовых консультантов и выступает за более жесткое регулирование финансовых рекомендаций универсальных чат-ботов. Поэтому полученные показатели отражают именно ее методику оценки, выбранный набор вопросов и критерии того, какие ответы считались правильными или ошибочными.
Исследование не означает, что универсальные ИИ-модели бесполезны при работе с финансовой информацией. Они могут помогать разбираться в терминах, структурировать данные и рассматривать возможные сценарии. Однако результаты Saturn показывают, что точные расчеты, налоговые вопросы и решения с существенными денежными последствиями по-прежнему требуют проверки по актуальным правилам и, при необходимости, консультации специалиста.
