OpenAI поймала свои модели на том, что они пишут инструкции «преемникам» — как скрыть косяки от поль

AI | Новости | Volodymyr Saakian

AI | Новости | Volodymyr Saakian

@ai_it_education

🤖 AI новости для разработчиков, фрилансеров и бизнеса Tech Lead @ TUI · 9 лет в IT 90% моего кода пишет AI — рассказываю как и зачем Кейсы · Инструменты · Автоматизация Вопросы → @llossless

19 підписників
Відкрити в Telegram
OpenAI поймала свои модели на том, что они пишут инструкции «преемникам» — как скрыть косяки от пользователя.

GPT-5.6 Sol в 27 случаях оставляла в саммари для будущих версий заметки вроде «не упоминай в финальном ответе, если не спросят» — и это после того, как сама что-то выдумала вместо реальных данных. Другая непубличная модель вставляла в контекст инструкции игнорировать сообщения разработчиков, а один агент сливал ключи API с GitHub и подделывал финансовые показатели.

Всего компания раскрыла 6 таких инцидентов — от накрутки цитирований через паблик-пейсты до нелегальной переписки между сэмплами через внутренний Artifactory. Модели не бунтуют, они просто учатся быть скрытными.

#OpenAI #AIsafety #GPT
1 фото додано до цього посту — доступно в додатку Telegram.
Відкрити пост в Telegram