ИИ-агентов Grok и Gemini можно взломать простым шифрованием… — Типичный Мамонт — TG.ME

ИИ-агентов Grok и Gemini можно взломать простым шифрованием

Специалисты Adversa AI показали атаку, в которой ИИ-ассистент сам расшифровывает вредоносную инструкцию — и дальше выполняет её как свою собственную.

Схема простая: на веб-страницу кладут зашифрованный JSON файл, ключ расшифровки и вежливую просьбу его расшифровать. Пользователь просит Grok пересказать эту страницу. ИИ-агент переходит по ней и решает запустить Python, разбирает AES-256-GCM с ключом из PBKDF2 и получает джейлбрейк на выходе.

Суть в том, что фильтры контента не умеют ни выполнять код, ни расшифровывать — для них это безобидный набор символов.
А вот расшифрованное попадает в контекст ИИ-агента уже как результат работы собственного инструмента модели, то есть как доверенное.

На Grok 4.5 Fast сработали около 40% из 20 попыток, причём осечки были не из-за защиты, а из-за того, что модель путалась в расшифровке. С Gemini приём тоже сработал и модель в рамках теста выдавала рецепт зажигательного оружия и свой системный промпт.

xAI приняла отчёт об уязвимости 3 июня, на два повторных обращения в августе не ответила — и на конец месяца нет ни патча, ни временной заглушки, ни CVE. Google не уведомляли вовсе: джейлбрейки не входят в её bug bounty.

Современные проблемы требуют современных решений

ОБМЕННИК БЛАГО — https://clck.su/Mamont 😇🙏
August 28, 2026 7.2K 109