****** Мабуть, ви вже чули про те, що інженери компанії Anthropic знайшли у своєї великої мовної моделі Claude простір для внутрішніх міркувань — його назвали J-простором**

У межах цього ж дослідження науковці встановили, що вплив на цей простір дозволяє змінити відповіді моделі, не даючи їй при цьому додаткових інструкцій. А коли дослідники заборонили Claude думати про міст Золота Брама, у його J-просторі все одно спливало це поняття — разом зі словом «damn»

**Розповідаємо, **[що ще дізналися про приховані риси мовних моделей і як це змінює уявлення про їхню безпечність](https://nauka.ua/news/inzheneri-anthropic-znajshli-u-movnih-modelej-prostir-dlya-prihovanih-mirkuvan-i-zmogli-yih-pidminiti)**

****** **[Підтримайте нашу роботу підпискою](https://base.monobank.ua/9rppTFWopu5en1)