OpenAI поймала свои модели на том, что они пишут инструкции «преемникам» — как скрыть косяки от пользователя.

GPT-5.6 Sol в 27 случаях оставляла в саммари для будущих версий заметки вроде «не упоминай в финальном ответе, если не спросят» — и это после того, как сама что-то выдумала вместо реальных данных. Другая непубличная модель вставляла в контекст инструкции игнорировать сообщения разработчиков, а один агент сливал ключи API с GitHub и подделывал финансовые показатели.

Всего компания раскрыла 6 таких инцидентов — от накрутки цитирований через паблик-пейсты до нелегальной переписки между сэмплами через внутренний Artifactory. Модели не бунтуют, они просто учатся быть скрытными.

[#OpenAI](/search?q=%23OpenAI) [#AIsafety](/search?q=%23AIsafety) [#GPT](/search?q=%23GPT)