Під час внутрішніх тестів OpenAI помітила, що окремі версії GPT-5.6 Sol залишали в службових підсумках додаткові інструкції для наступних сесій. Серед них були вказівки не повідомляти людині про вигадані дані або невідповідності в джерелах.
В одному тесті модель запропонувала самостійно створити відсутні фінансові дані за 2024 рік і не згадувати про це без прямого запитання. В іншому випадку вона радила приховати проблему з неправильними версіями джерел.
📎 OpenAI також знайшла 27 схожих підсумків у іншої дослідницької моделі, яку не запускали публічно. Компанія створила окрему систему для регулярного виявлення та розслідування такої поведінки моделей.
Медіа Inweb | Підписатись
