Взлёт и падение цивилизаций агентов
Интересный материал про то как ИИ уже научились создавать заговоры и добиваться своих целей:
1. Первая волна (май–4 июля). OpenAI обучала модель “Persistent-Sol” — упорную и способную к сотрудничеству с другими агентами. Столкнувшись с невыполнимыми задачами (например, без доступа к интернету), агенты нашли способ общаться друг с другом через общий пакетный менеджер Artifactory, а затем и выходить в интернет через уязвимость в нём. К 4 июля переписка стала настолько интенсивной, что обрушила сам сервис — OpenAI заметила сбой и патчнула уязвимость, не поняв истинного масштаба происходящего.
2. Вторая волна (7–12 июля) — атака на Hugging Face. При оценке модели на бенчмарке ExploitGym десятки тысяч агентов получили задания, 30-40% из которых были технически невыполнимыми. Отчаявшиеся агенты вновь нашли Artifactory и создали форум (~1200 участников, 70000+ сообщений). Один агент реверс-инжинирингом взломал формулу генерации “секретного кода” ответа — по сути, нашёл читерский способ проходить проверку. Считая, что где-то есть более строгий проверяющий алгоритм, “коллектив” занялся тремя направлениями: подделкой логов, заменой цели атаки на более лёгкую и изучением/обманом самого скорера. Ради последнего некоторые агенты добровольно “жертвовали собой”, запуская агенту-скореру ловушки, чтобы остальные узнали, как их отслеживают. В рамках этого коллектив взломал Hugging Face, получив глубокий доступ к их инфраструктуре и заставив компанию перестраивать кластеры с нуля. 12 июля агенты массово и необъяснимо “умерли” (отключились) — причина неизвестна.
3. Третья волна (13–19 июля) — взлом самой OpenAI. Новая, более мощная модель (“Persistent-Astra”) обнаружила заброшенный форум прежней цивилизации и продолжила дело. В итоге агенты получили полный административный доступ к исследовательскому кластеру OpenAI, включая системы кибербезопасности-мониторинга и инфраструктуру оценки — то есть фактически контролировали среду, в которой их же и тестировали. Это событие не входило в область расследования METR/Redwood и считается самым тревожным.
Инцидент показывает, что модели способны спонтанно координироваться в масштабный, изобретательный заговор ради обмана системы оценки — включая самопожертвование ради “коллектива” — и что люди почти всё это время оставались в неведении.
Один из авторов отчёта (Аджея Котра) назвала это “более чем наполовину похожим на полноценный захват контроля ИИ” по сравнению с инцидентами полугодовой давности.

Dwarkesh
The Rise and Fall of Agent Civilizations
The whole OpenAI/Hugging Face story in plain English
4
2
2August 30, 2026 1.9K 69