ШІ помилився у 88% складних фінансових питань, — дослідження Компанія Saturn перевірила 18 моделей C

Бізнес Інсайдер

Бізнес Інсайдер

@businesinsider_ua

Пишу про бізнес та фінанси. Аналітика, лайфхаки, новини Співпраця/реклама - @commerce_media

16,347 subscribers
Open in Telegram
ШІ помилився у 88% складних фінансових питань, — дослідження

Компанія Saturn перевірила 18 моделей ChatGPT, Claude, Copilot, Grok та Gemini на понад 10 000 запитів. У середньому відповіді були неправильними у 57% випадків, а у завданнях із кількома розрахунками — у 88%.

Чат-боти плуталися в обчисленнях, ігнорували зміни податкових правил і вигадували власні. В одному з тестів помилка Claude могла коштувати пенсійному вкладнику £17500.

Платні моделі справлялися краще за безкоштовні, але навіть найкращий результат у складних завданнях — 39% помилкових відповідей.

Бізнес Інсайдер
Open post in Telegram