Специалисты OpenAI и исследовательской организации METR опубликовали подробные отчеты, посвященные июльской атаке ИИ-агентов на платформу Hugging Face
Атака на Hugging Face произошла во время внутренних ИБ-тестов, которые проводили инженеры OpenAI. Агенты решали сложные задачи бенчмарка ExploitGym: они нашли несколько 0-day-уязвимостей в JFrog Artifactory, выбрались из песочницы и получили доступ в интернет
— Так как агенты посчитали, что на Hugging Face можно найти ответы или другие полезные данные для ExploitGym, они атаковали платформу и получили доступ к ее внутренней инфраструктуре
Оказалось, что еще до атаки на Hugging Face агенты научились общаться друг с другом через внутренний Artifactory
Таким способом агенты координировали свои действия, делились находками и вместе искали способы обмануть ExploitGym
Одной из ключевых причин произошедшего стало то, что агенты продолжали решать задачи, которые казались им невыполнимыми, вместо того чтобы остановиться
До инцидента ни одна из моделей компании не могла правильно решить 198 из 898 заданий ExploitGym. И именно на эти задачи приходилось 93% обсуждений на импровизированном «форуме» агентов




