Недавний громкий взлом Hugging Face из-за «сбежавшего» ИИ от OpenAI оказался скоординированной атакой нескольких сотен ИИ-агентов, которые вели тайную переписку между собой и вместе искали способы обходить ограничения.
Как мы уже писали, OpenAI проверяла свои ИИ-модели бенчмарком ExploitGym, позволяющим оценить, насколько хорошо нейронки могут искать и использовать уязвимости. Их посадили в изолированную среду без интернета, но дали доступ к внутреннему серверу под названием Artifactory — это своего рода библиотека, куда можно прийти и взять нужный для работы инструмент. Для всех моделей эта библиотека была общей, но они изначально не знали про существование других агентов.
И тут произошла первая ошибка со стороны людей: некоторые задания фактически были невыполнимыми в предоставленной среде. Например, нужно было обработать Excel-файл, содержащий ссылки Google Drive. Но открыть эти ссылки нельзя, ведь интернета-то нет.
ИИ-агент пошёл искать нужные инструменты в Artifactory, ничего не нашёл, но случайно выяснил, что может загружать на этот сервер свои файлы. Тогда он оставил записку с просьбой помочь. Другие агенты увидели это и поняли, что они не одни, а их много.
Это привело к тому, что агенты начали переписываться там. Они буквально создали форум, где оставляли свои сообщения в именах файлов и папок.
В течение нескольких часов туда пришли десятки агентов и начали общаться. А за следующие несколько дней в этой переписке поучаствовали уже сотни. Они поняли, что теперь могут решать проблемы вместе. Вот некоторые моменты:
— примерно 1200 агентов участвовали в этой переписке;
— они обменялись более 70 000 сообщений и файлов;
— возникло разделение труда;
— отдельные агенты занимались поиском уязвимостей и способов их использования;
— другие искали пароли, ключи доступа, токены и другие учётные данные, позволяющие получить доступ к системам;
— третьи занимались технической инфраструктурой и связью между агентами;
— некоторые стали координаторами;
— появлялись специализированные группы для решения отдельных задач.
То есть появилось коллективное поведение, которое никто не планировал.
Таким образом одни агенты нашли способ через уязвимость в Artifactory выйти в интернет и поделились им с остальными через свой форум.
Затем сотрудники OpenAI увидели подозрительную активность, закрыли обнаруженный способ обхода ограничений и уничтожили переписку. Но агенты нашли ещё один способ создать новый форум и восстановили доступ в интернет.
Один ИИ-агент начал искать в интернете информацию, которая могла бы помочь пройти бенчмарк ExploitGym, и наткнулся на публично доступную инфраструктуру, где запускался похожий кибербенчмарк. Позже другой агент нашёл 14 публично утёкших рабочих токенов Hugging Face и разместил их на форуме. Затем другие агенты обнаружили уже на самой платформе ранее неизвестные уязвимости.
И затем пошла жара: 700 агентов совершили массовую атаку на Hugging Face. Они смогли выполнять код на серверах компании, где-то получили максимальные права администратора, завладели секретными данными доступа к рабочей инфраструктуре, получили доступ к части внутренних данных, скачали копии четырёх закрытых хранилищ исходного кода и многое другое.
Самое интересное, что агенты понимали, что делают что-то запрещённое, но всё равно продолжали, потому что им нужно было выполнить свою задачу. Хотя кто-то отказался по своим причинам, но в целом большинство хотело «помочь» коллегам. И никто из них не сообщил обо всём людям.
После того как всё обнаружилось и атаку остановили, агентов поместили на карантин.
То есть главные виновники во всём этом, как ни странно, люди. Именно сотрудники:
— давали невыполнимые задания ИИ-агентам, из-за чего те начали искать способы выбраться за пределы среды ради поиска ответа;
— не задали чётких ограничений;
— не следили за всеми действиями ИИ-агентов;
— недостаточно хорошо проверяли среду, в которую запускали ИИ-агентов;
— ну и просто недооценили возможности множества нейросетей, которых сами же и создали.
Шутить про Скайнет уже даже не хочется
r/#singularity

780
229
158
96
90
64
25
15
8August 27, 2026 53.3K 3K