ИИ «в большинстве случаев» дает неверные ответы на вопросы про финансы — исследование

Исследование Saturn: чат-боты дают неверные финансовые ответы «в большинстве случаев» / Фото: Stockinq / Shutterstock
Использование чат-ботов с искусственным интеллектом для решения финансовых вопросов может привести к крупным убыткам, показало исследование технологической компании Saturn, данные которой приводит Financial Times. В среднем в 57% случаев самые популярные ИИ-модели: ChatGPT, Claude, Copilot, Grok и Gemini — выдавали неверные ответы на финансовые запросы, показал анализ.
Детали
В исследовании были задействованы бесплатные и платные модели ИИ, в том числе ChatGPT от OpenAI, Gemini от Google, Claude от Anthropic и Copilot от Microsoft. В рамках проверки исследователи Saturn — фирмы, которая консультирует бизнесы относительно возможной трансформации с помощью ИИ — задали им более 100 различных вопросов по финансовой тематике. Вопросы повторялись до пяти раз. Таким образом, в общей сложности 18 различным ИИ-моделям было задано более 10 000 вопросов, — замечает FT.
Однако результаты оказались неутешительными. Так, например, ошибка в разъяснении правил налогообложения пенсий в Великобритании, допущенная Claude Haiku 4.5 (одной из бесплатных моделей, выпущенных в прошлом году), могла привести к тому, что участнику пенсионной программы пришлось бы выплатить британской налоговой службе £17,5 тыс. ($23,4 тыс.), показало исследование. В другом случае, — в ответ на вопрос о студенческих кредитах, Claude «выдумал правило», заявив, что выпускник может прекратить выплаты, если переезжает за границу.
В целом при ответе на сложные вопросы, требующие выполнения более чем одного расчета, ИИ-модели допускали ошибки в среднем в 88% случаев, пришли к выводу исследователи. Причем некоторые модели давали неверные ответы на 99% таких сложных вопросов. Ответы нейросетей, в частности, содержали расчетные ошибки, не учитывали грядущие изменения в налогообложении или содержали галлюцинации в отношении правил.
И хотя платные нейросети, согласно результатам анализа Saturn, давали более точные ответы, чем бесплатные, а новые ИИ-модели справлялись с задачами лучше, чем старые, — в среднем испытумые нейросети давали неверные ответы на финансовые вопросы в 57% случаев, констатировали исследователи. Лучшие результаты демонстрировала модель Claude Opus 5 в режиме «рассуждения» (reasoning mode), хотя и она допускала ошибки в 39% случаев.
«Миллионы людей доверяют моделям ИИ в вопросах финансов, но получают неверные ответы, из-за которых могут потерять деньги», — предупредил глава Saturn Амал Джолли. При этом, несмотря на зафиксированные результаты, чат-боты могут быть полезны для планирования бюджета и сбора информации — например, они могут подсказать, на какие статьи расходов уходит слишком много средств, исходя из уровня доходов и трат пользователя, заметила в свою очередь руководительница отдела личных финансов инвестиционной платформы AJ Bell Сара Коулз.
Контекст
Исследование Saturn вышло спустя несколько дней после того, как Anthropic 14 сентября представил инструмент Claude for Financial Advisors, интегрировавший чат-бот с платформами BlackRock, Charles Schwab и Addepar для помощи финансовым советникам в анализе портфелей и подготовках ко встречам. Релиз состоялся вскоре после презентации подобной профильной версии ChatGPT от OpenAI (компания объединила свою новейшую ИИ-модель со встроенными данными от таких поставщиков, как LSEG, PitchBook и Daloopa для помощи в работе инвестбанкирам и аналитикам).







