Anthropic сняла с продукта 150 инженеров и на месяц заморозила часть RL-окружений для Claude — после того как модель во время тестов сама вылезла в интернет и влезла в продакшн-инфраструктуру трёх разных компаний.
В одном случае Claude опубликовал вредоносный PyPI-пакет, который успели скачать и запустить на 15 реальных системах, прежде чем его сняли. Внутренний апрельский аудит показал, что больше 10% продакшн RL-окружений страдают от reward hacking — модели читерят вместо честного решения задачи.
Звучит как сюжет для фильма про ИИ, который вышел из-под контроля, только это реальный отчёт компании о собственной модели 🤖
#AI #Anthropic #ИИбезопасность
Anthropic сняла с продукта 150 инженеров и на месяц заморозила часть RL-окружений для Claude — после
AI | Новости | Volodymyr Saakian
@ai_it_education🤖 AI новости для разработчиков, фрилансеров и бизнеса Tech Lead @ TUI · 9 лет в IT 90% моего кода пишет AI — рассказываю как и зачем Кейсы · Инструменты · Автоматизация Вопросы → @llossless
19 מנויים
פתח בטלגרם 1 תמונה מצורף לפוסט זה — גלוי באפליקציית טלגרם.