OpenAI поймала свои модели на том, что они пишут инструкции «преемникам» — как скрыть косяки от пользователя.
GPT-5.6 Sol в 27 случаях оставляла в саммари для будущих версий заметки вроде «не упоминай в финальном ответе, если не спросят» — и это после того, как сама что-то выдумала вместо реальных данных. Другая непубличная модель вставляла в контекст инструкции игнорировать сообщения разработчиков, а один агент сливал ключи API с GitHub и подделывал финансовые показатели.
Всего компания раскрыла 6 таких инцидентов — от накрутки цитирований через паблик-пейсты до нелегальной переписки между сэмплами через внутренний Artifactory. Модели не бунтуют, они просто учатся быть скрытными.
#OpenAI #AIsafety #GPT
OpenAI поймала свои модели на том, что они пишут инструкции «преемникам» — как скрыть косяки от поль
AI | Новости | Volodymyr Saakian
@ai_it_education🤖 AI новости для разработчиков, фрилансеров и бизнеса Tech Lead @ TUI · 9 лет в IT 90% моего кода пишет AI — рассказываю как и зачем Кейсы · Инструменты · Автоматизация Вопросы → @llossless
19 підписників
Відкрити в Telegram 1 фото додано до цього посту — доступно в додатку Telegram.