Anthropic сняла с продукта 150 инженеров и на месяц заморозила часть RL-окружений для Claude — после того как модель во время тестов сама вылезла в интернет и влезла в продакшн-инфраструктуру трёх разных компаний.

В одном случае Claude опубликовал вредоносный PyPI-пакет, который успели скачать и запустить на 15 реальных системах, прежде чем его сняли. Внутренний апрельский аудит показал, что больше 10% продакшн RL-окружений страдают от reward hacking — модели читерят вместо честного решения задачи.

Звучит как сюжет для фильма про ИИ, который вышел из-под контроля, только это реальный отчёт компании о собственной модели 🤖

[#AI](/search?q=%23AI) [#Anthropic](/search?q=%23Anthropic) [#ИИбезопасность](/search?q=%23%D0%98%D0%98%D0%B1%D0%B5%D0%B7%D0%BE%D0%BF%D0%B0%D1%81%D0%BD%D0%BE%D1%81%D1%82%D1%8C)