🤖💭 Мабуть, ви вже чули про те, що інженери компанії Anthropic знайшли у своєї великої мовної моделі Claude простір для внутрішніх міркувань — його назвали J-простором
У межах цього ж дослідження науковці встановили, що вплив на цей простір дозволяє змінити відповіді моделі, не даючи їй при цьому додаткових інструкцій. А коли дослідники заборонили Claude думати про міст Золота Брама, у його J-просторі все одно спливало це поняття — разом зі словом «damn»
Розповідаємо, що ще дізналися про приховані риси мовних моделей і як це змінює уявлення про їхню безпечність
💙 Підтримайте нашу роботу підпискою
🤖💭 Мабуть, ви вже чули про те, що інженери компанії Anthropic знайшли у своєї великої мовної моделі
NAUKA.UA | Новини науки
@naukaua📢 Найбільше в Україні наукпоп медіа: розповідаємо, що відбувається в науці, та пояснюємо, чому це круто Підтримайте нашу роботу: nauka.ua/support Реклама: ads@nauka.ua
12,775 subscribers
Open in Telegram 