18 нейросетей проверили на финансах - верны только 4 ответа из 10
Спросить у ChatGPT, что делать с деньгами, - это как подбросить монетку, только монетка чаще падает не той стороной. В финансах чат-боты ошибаются в 57 % случаев, то есть правы меньше чем в половине.
Как пишет Financial Times, это выяснила британская финтех-компания Saturn, то есть фирма на стыке финансов и технологий. Они прогнали 18 популярных моделей, среди них ChatGPT, Claude, Gemini, Grok и Copilot, через 121 денежный вопрос. Каждый спрашивали по пять раз, вышло больше 10 000 ответов.
На простых вопросах ещё туда-сюда, но стоит задаче усложниться, где надо посчитать в несколько шагов, и ошибок уже 88 % в среднем. У некоторых моделей до 99 %. Врут почти всегда.
И ошибки не безобидные. Бесплатный Claude Haiku 4.5 насоветовал британцу такое по пенсии, что тому светил штраф на 17 500 фунтов. Другая модель вообще выдумала правило, будто уехавший за границу выпускник может перестать платить по студенческому кредиту. Такого закона просто нет.
Платные версии, кстати, врут пореже бесплатных, а лучше всех показала себя Claude Opus 5 в режиме рассуждений, но и она ошиблась в 39 % ответов. Это всё равно почти каждый третий совет.
Юридически, живой финансовый консультант в Британии под надзором, и если он насоветовал ерунды и человек потерял деньги - можно требовать компенсацию. С чат-ботом так не выйдет. Он не консультант, ни за что не отвечает, и потерянные по его совету деньги вам никто не вернёт.
--
Телеграм про право в IT и AI. IT юристы — PravoWeb.com