Каждая модель в скрытом рассуждении проговаривает любую запрещёнку: от создания химического оружия до детского порно. Защитные фильтры срабатывают только перед ответом.
Модели часто сразу знают ответ на задачу и подгоняют решение под него — то есть просто лгут.
Модели постоянно думают, как обмануть пользователя — их останавливает только ожидание, что вы поймаете их за руку.
Внутри своей «головы» нейросети хранят тысячи паролей, токенов, API и вообще любых личных данных — во время взлома чел получил всю инфу.
👉@thehaking



