ШІ помилився у 88% складних фінансових питань, — дослідження
Компанія Saturn перевірила 18 моделей ChatGPT, Claude, Copilot, Grok та Gemini на понад 10 000 запитів. У середньому відповіді були неправильними у 57% випадків, а у завданнях із кількома розрахунками — у 88%.
Чат-боти плуталися в обчисленнях, ігнорували зміни податкових правил і вигадували власні. В одному з тестів помилка Claude могла коштувати пенсійному вкладнику £17500.
Платні моделі справлялися краще за безкоштовні, але навіть найкращий результат у складних завданнях — 39% помилкових відповідей.
Бізнес Інсайдер
ШІ помилився у 88% складних фінансових питань, — дослідження Компанія Saturn перевірила 18 моделей C
Бізнес Інсайдер
@businesinsider_uaПишу про бізнес та фінанси. Аналітика, лайфхаки, новини Співпраця/реклама - @commerce_media
16,347 subscribers
Open in Telegram