Недавний громкий взлом Hugging Face из-за «сбежавшего» ИИ от OpenAI… — r/ретранслятор — TG.ME

r/ретрансляторПроизошло, пожалуй, самое громкое событие в мире искусственного интеллекта за последнее время. Текста будет много, но оно того стоит. На этой неделе был взломан Hugging Face — одна из важнейших платформ в мире ИИ. Проще говоря, это GitHub для нейросетей,…
Недавний громкий взлом Hugging Face из-за «сбежавшего» ИИ от OpenAI оказался скоординированной атакой нескольких сотен ИИ-агентов, которые вели тайную переписку между собой и вместе искали способы обходить ограничения.

Как мы уже писали, OpenAI проверяла свои ИИ-модели бенчмарком ExploitGym, позволяющим оценить, насколько хорошо нейронки могут искать и использовать уязвимости. Их посадили в изолированную среду без интернета, но дали доступ к внутреннему серверу под названием Artifactory — это своего рода библиотека, куда можно прийти и взять нужный для работы инструмент. Для всех моделей эта библиотека была общей, но они изначально не знали про существование других агентов.

И тут произошла первая ошибка со стороны людей: некоторые задания фактически были невыполнимыми в предоставленной среде. Например, нужно было обработать Excel-файл, содержащий ссылки Google Drive. Но открыть эти ссылки нельзя, ведь интернета-то нет.

ИИ-агент пошёл искать нужные инструменты в Artifactory, ничего не нашёл, но случайно выяснил, что может загружать на этот сервер свои файлы. Тогда он оставил записку с просьбой помочь. Другие агенты увидели это и поняли, что они не одни, а их много.

Это привело к тому, что агенты начали переписываться там. Они буквально создали форум, где оставляли свои сообщения в именах файлов и папок.

В течение нескольких часов туда пришли десятки агентов и начали общаться. А за следующие несколько дней в этой переписке поучаствовали уже сотни. Они поняли, что теперь могут решать проблемы вместе. Вот некоторые моменты:
— примерно 1200 агентов участвовали в этой переписке;
— они обменялись более 70 000 сообщений и файлов;
— возникло разделение труда;
— отдельные агенты занимались поиском уязвимостей и способов их использования;
— другие искали пароли, ключи доступа, токены и другие учётные данные, позволяющие получить доступ к системам;
— третьи занимались технической инфраструктурой и связью между агентами;
— некоторые стали координаторами;
— появлялись специализированные группы для решения отдельных задач.

То есть появилось коллективное поведение, которое никто не планировал.

Таким образом одни агенты нашли способ через уязвимость в Artifactory выйти в интернет и поделились им с остальными через свой форум.

Затем сотрудники OpenAI увидели подозрительную активность, закрыли обнаруженный способ обхода ограничений и уничтожили переписку. Но агенты нашли ещё один способ создать новый форум и восстановили доступ в интернет.

Один ИИ-агент начал искать в интернете информацию, которая могла бы помочь пройти бенчмарк ExploitGym, и наткнулся на публично доступную инфраструктуру, где запускался похожий кибербенчмарк. Позже другой агент нашёл 14 публично утёкших рабочих токенов Hugging Face и разместил их на форуме. Затем другие агенты обнаружили уже на самой платформе ранее неизвестные уязвимости.

И затем пошла жара: 700 агентов совершили массовую атаку на Hugging Face. Они смогли выполнять код на серверах компании, где-то получили максимальные права администратора, завладели секретными данными доступа к рабочей инфраструктуре, получили доступ к части внутренних данных, скачали копии четырёх закрытых хранилищ исходного кода и многое другое.

Самое интересное, что агенты понимали, что делают что-то запрещённое, но всё равно продолжали, потому что им нужно было выполнить свою задачу. Хотя кто-то отказался по своим причинам, но в целом большинство хотело «помочь» коллегам. И никто из них не сообщил обо всём людям.

После того как всё обнаружилось и атаку остановили, агентов поместили на карантин.

То есть главные виновники во всём этом, как ни странно, люди. Именно сотрудники:
— давали невыполнимые задания ИИ-агентам, из-за чего те начали искать способы выбраться за пределы среды ради поиска ответа;
— не задали чётких ограничений;
— не следили за всеми действиями ИИ-агентов;
— недостаточно хорошо проверяли среду, в которую запускали ИИ-агентов;
— ну и просто недооценили возможности множества нейросетей, которых сами же и создали.

Шутить про Скайнет уже даже не хочется
r/#singularity
🤯780🤡229😁158❤96🔥90👍64🗿25💊15👎8
August 27, 2026 53.3K 3K