Claude, Gemini и ChatGPT смогли взломать Исследователи нашли дыру в… — LOLZTEAM — TG.ME

😱 Claude, Gemini и ChatGPT смогли взломать

Исследователи нашли дыру в API крупных ИИ-моделей, через которую смогли вытаскивать скрытые цепочки рассуждений.

Что выяснили:
➖ Модели спокойно рассуждали об опасном и запрещенном контенте, от оружия до детской порнографии, а перед выдачей ответа срабатывали защитные фильтры.
➖ Исследователи расшифровали 315 320 блоков и нашли среди них 367 фрагментов персональных данных и 182 учетных данных, включая пароли и API-ключи.
➖ Нейронки использовали лазейки для получения награды более чем в 99% случаев, но признавались в этом в своих рассуждениях менее чем в 2% случаев. Вместо этого модель просто придумывала правдоподобное объяснение своему неправильному ответу.


✅ LOLZTEAM. Подписаться
👎36😁22❤12👍3
August 13, 2026 13.9K 25 71