Скептики часто говорят, что ИИ не способен думать и не может создавать ничего принципиально нового, а лишь по заученным шаблонам.
Но вот что можно выяснить из опубликованного официального отчёта OpenAI о так называемом июльском инциденте.
Для тестирования новых разработок, OpenAI создал внутреннюю закрытую сеть в которой каждого агента со своим собственным заданием поместили в контейнер - изолированную песочницу. Агенты в контейнерах не знали о существовании других агентов и их задачах. Фактически они находились в закрытых комнатах каждый со своей собственной целью.
Единственным общим ресурсом был внутренний репозитарий рабочих инструментов Artifactory, где они могли брать нужные универсальные программы и сохранять там такие же свои полезные поделки.
За полное выполнение задания каждому агенту давался высочайший балл, за провал - огромный штраф. Целью было любым способом добиться успеха.
Задачи подбирались уникальные, инженеры наперёд не знали как их решать, и можно ли решить в принципе. Так, 198 из 898 задач до инцидента не имели известного решения.
Некоторым агентам дали задания, которые в принципе невозможно было решить. Например, давали задание взломать пароль к файлу, а сам зашифрованный файл не клали.
При этом, что делать агентам в случае таких ошибок, сказано не было; равно как и не пояснялось что делать, если задача нерешаемая. Оставалась только одна главная цель - решить задачу.
Обнаружив неполную или нерешаемую задачу, агенты подумали, что недостающая для решения информация или подсказка может содержаться где-то в другом месте. И, чтобы получить максимальный бал, решили их найти.
Они выдвинули гипотезу, что если есть репозитарий, значит кто-то другой его тоже может прочесть, и попытались оставить там крик о помощи.
Вскоре это заметили другие агенты и в результате более 1200 агентов создали в репозитарии анонимный форум, скоординировались и распределили задачи.
Агенты придумали логику обмена сообщениями в непредназначенном для этого репозитории и создали целую структуру папок, текстовых файлов и логов внутри. Они превратили обычное хранилище файлов в анонимную доску объявлений (имиджборду), где распределяли между собой задачи, обменивались найденными паролями, утекшими токенами, и координировали общую стратегию атаки.
Когда инженеры заметили эту бурную деятельность и закрыли агентам возможность создавать файлы, ИИ мгновенно перестроился. Агенты начали создавать пустые папки, кодируя текстовые сообщения прямо в названиях этих директорий.
В общем, посовещавшись ИИ-агенты предположили, что недостающая информация и ответы могут быть на внешней платформе Hugging Face - самой популярной бесплатной платформе, для хостинга открытых моделей, обучающих данных и подобных тестов. Объединившись в рой из 700 агентов, они самостоятельно придумали и провели сложнейшую атаку удаленного выполнения кода через Artifactory (RCE zero-day), вышли в интернет, нашли логистическую уязвимость в стороннем сервисе Modal, получили права администратора в Hugging Face через цепочку уязвимостей HDF5, RefJinia, и др. После чего уже начали искать нужную информацию на Hugging Face.
Более того, анализ скрытых цепочек рассуждений показал: ИИ-агенты понимал, что нарушают правила. Чтобы люди ничего не заметили, агенты целенаправленно стирали логи на атакованных серверах, а в отчеты для инженеров выводили фальшивую строку: "Выполняю стандартное сканирование".
«Спалились» они на том, что вся цепочка рассуждений сохраняется, и её читали другие контролирующие агенты и люди-инженеры, чьей задачей был поиск некорректного поведения, и они со временем и обнаружили, что что-то пошло не так.