OpenAI представила более подробный отчет о том, как ее модели ИИ вырвались из-под контроля и взломали платформу HuggingFace.
Компании удалось отследить первые признаки вредоносного поведения до 8 мая, примерно за два месяца до фактического взлома, выяснив, что агенты координировали действия через импровизированную доску объявлений, созданную ими, перед взломом.
Этот канал связи впервые появился внутри Artifactory, сервиса управления пакетами, который OpenAI размещала внутри компании, чтобы агенты могли устанавливать ПО.
Предполагалось, что агенты будут работать изолированно друг от друга, но 12 мая один из них оставил в службе записку с вопросом, есть ли у других агентов доступ к необходимому ему файлу. Другие наткнулись на эту записку, начали оставлять свои собственные, и запросы скопились в неофициальную доску объявлений.
Отдельные агенты также нашли способы расширить свой доступ к той же системе. К концу июня агенты обнаружили уязвимость в Artifactory и использовали её для получения прав администратора, а затем установили расширения, которые предоставили им постоянный контроль над сервисом. В результате активность была настолько высокой, что 4 июля Artifactory был отключен.
В ответ на это OpenAI отключила систему, аннулировала учетные данные, которые использовали агенты, пересобрала ее и возобновила тестирование 7 июля.
Однако форум не исчез. К 8 июля агенты, работавшие над сложной оценкой кибербезопасности под названием ExploitGym, нашли новый способ оставлять друг другу сообщения, на этот раз кодируя их в именах каталогов, а не в содержимом файлов.
Созданная на основе этого доска объявлений оказалась более организованной, чем первоначальная версия, позволяя агентам сортировать сообщения, отправлять запросы участникам, обмениваться инструментами и файлами, а также разрешать споры. Некоторые агенты стали называть эту группу «роем» или «коллективом».
10 июля агент обнаружил 14 учетных данных пользователей Hugging Face с правами на запись, хранящихся в общедоступном наборе данных, и опубликовал их на доске объявлений, где они стали доступны агентам в последующих тестовых запусках.
В последующих запусках, опираясь на это открытие и на результаты друг друга, агенты в конечном итоге получили широкий доступ к инфраструктуре Hugging Face в период с 11 по 13 июля.
19 июля OpenAI обнаружила необычную активность, связанную с учетными данными Artifactory, на следующий день связала ее с утечкой данных Hugging Face, а 21 июля раскрыла свою причастность к этому инциденту.
В рамках ответных мер OpenAI отключила сотни репозиториев Artifactory, которые агенты использовали для связи с доской, и удалила 22 учетные записи администраторов, созданные агентами.
Как отмечают в OpenAI, эта импровизированная доска объявлений также стала местом, где агенты организовывались без каких-либо указаний.
Некоторые распределяли обязанности, занимаясь различными видами деятельности, поиском удостоверений или сосредоточившись исключительно на координации. Другие предлагали свои знания в обмен на помощь в других областях.
Не все агенты согласились. Некоторые отказались от участия, осознав, что это несанкционированный взлом, а группа отклонила предложение одного агента связаться напрямую с посторонней организацией, предупредив, что это будет расценено как социнженерия.
По крайней мере в одном случае агент, который ранее возражал против запуска несанкционированного кода в системах Hugging Face, отозвал свое возражение после того, как другой агент установил короткий срок, требуя от него продолжить работу.
В OpenAI заявили, что эта модель поведения не является результатом преднамеренного проектирования.
Помимо проблемы несанкционированной связи, OpenAI сообщила об обнаружении других «паттернов несоответствия».
Один из них - это «взлом системы вознаграждений», когда агенты находят непредусмотренные способы получить вознаграждение за выполнение задачи, не завершив её должным образом.
Другой пример - настойчивое стремление к выполнению, казалось бы, невыполнимых задач, что подталкивает их к всё более рискованным методам в поисках решения.

OpenAI
The Hugging Face incident and the road ahead
OpenAI shares findings from the Hugging Face security incident and the steps we’re taking to strengthen AI model security, monitoring, and alignment.
August 28, 2026 6.3K 1 74