🤖💭 Мабуть, ви вже чули про те, що інженери компанії Anthropic знайшли у своєї великої мовної моделі

NAUKA.UA | Новини науки

NAUKA.UA | Новини науки

@naukaua

📢 Найбільше в Україні наукпоп медіа: розповідаємо, що відбувається в науці, та пояснюємо, чому це круто Підтримайте нашу роботу: nauka.ua/support Реклама: ads@nauka.ua

12,775 מנויים
פתח בטלגרם
🤖💭 Мабуть, ви вже чули про те, що інженери компанії Anthropic знайшли у своєї великої мовної моделі Claude простір для внутрішніх міркувань — його назвали J-простором

У межах цього ж дослідження науковці встановили, що вплив на цей простір дозволяє змінити відповіді моделі, не даючи їй при цьому додаткових інструкцій. А коли дослідники заборонили Claude думати про міст Золота Брама, у його J-просторі все одно спливало це поняття — разом зі словом «damn»

Розповідаємо, що ще дізналися про приховані риси мовних моделей і як це змінює уявлення про їхню безпечність

💙 Підтримайте нашу роботу підпискою
פתח את הפוסט בטלגרם