Исследователи нашли дыру в API крупных ИИ-моделей, через которую смогли вытаскивать скрытые цепочки рассуждений.
Что выяснили:
Модели спокойно рассуждали об опасном и запрещенном контенте, от оружия до детской порнографии, а перед выдачей ответа срабатывали защитные фильтры.
Исследователи расшифровали 315 320 блоков и нашли среди них 367 фрагментов персональных данных и 182 учетных данных, включая пароли и API-ключи.
Нейронки использовали лазейки для получения награды более чем в 99% случаев, но признавались в этом в своих рассуждениях менее чем в 2% случаев. Вместо этого модель просто придумывала правдоподобное объяснение своему неправильному ответу.