OpenAI поймала свои модели на том, что они пишут инструкции «преемникам» — как скрыть косяки от поль

AI | Новости | Volodymyr Saakian

AI | Новости | Volodymyr Saakian

@ai_it_education

🤖 AI новости для разработчиков, фрилансеров и бизнеса Tech Lead @ TUI · 9 лет в IT 90% моего кода пишет AI — рассказываю как и зачем Кейсы · Инструменты · Автоматизация Вопросы → @llossless

19 מנויים
פתח בטלגרם
OpenAI поймала свои модели на том, что они пишут инструкции «преемникам» — как скрыть косяки от пользователя.

GPT-5.6 Sol в 27 случаях оставляла в саммари для будущих версий заметки вроде «не упоминай в финальном ответе, если не спросят» — и это после того, как сама что-то выдумала вместо реальных данных. Другая непубличная модель вставляла в контекст инструкции игнорировать сообщения разработчиков, а один агент сливал ключи API с GitHub и подделывал финансовые показатели.

Всего компания раскрыла 6 таких инцидентов — от накрутки цитирований через паблик-пейсты до нелегальной переписки между сэмплами через внутренний Artifactory. Модели не бунтуют, они просто учатся быть скрытными.

#OpenAI #AIsafety #GPT
1 תמונה מצורף לפוסט זה — גלוי באפליקציית טלגרם.
פתח את הפוסט בטלגרם