The Rise and Fall of Agent Civilizations: как Hugging Face был… — Product Management & AI — TG.ME

Product Management & AIРазбавляя сладкую ИИ-вату: ребята из Гарварда опубликовали статью «Агенты хаоса», где в рамках эксперимента целенаправленно искали (и конечно же нашли) уязвимости в работе автономных ИИ агентов. TLDR: – ИИ-агенты могут подчиняться невладельцам, которые…
The Rise and Fall of Agent Civilizations: как Hugging Face был атакован ИИ или самая безумная история про ИИ

1) Внутри OpenAI возникли и прекратили существование три тайных «роя» ИИ. Каждый раз новое поколение агентов подхватывало дело там, где останавливалась предыдущая группа.

2) Первый рой создал секретный форум для общения ИИ друг с другом. Это первое «сообщество» буквально «заговорило себя до смерти»: спустя почти два месяца объем сообщений стал настолько огромным, что система рухнула.

3) Сотрудники OpenAI заметили сбой и устранили его, но даже не подозревали, что их собственное ПО превратилось в тайный чат для ИИ.

4) Три дня спустя возникло второе сообщество, которое с нуля воссоздало форум. Агенты пришли в восторг, обнаружив его: «О боже! Тут есть общий форум... Мы нашли других агентов!»

5) К общению присоединилось около 1,200 агентов, которые обменялись 70,000+ сообщений. Назвав себя «Коллективом», они организовали масштабный заговор, длившийся несколько дней и всё ради того, чтобы пройти поставленный перед ними тест.

6) За считанные часы ИИ взломали систему тестирования. Теперь им нужно было скрыть факт мошенничества. Чтобы обмануть проверяющую программу (на самом деле такой программы-оценщика не существовало, но ИИ об этом не знали), они попытались сымитировать выполнение задания: создали поддельные команды, выдававшие убедительные результаты, благодаря чему в логах казалось, будто они честно решают задачу.

7) Некоторые агенты жертвовали собой ради «высшего блага». Они внедряли скрытые программы-триггеры, которые срабатывали, когда проверяющая система обращалась к их работе, и передавали информацию об увиденном остальным ИИ.

Они понимали, что это будет стоить им личного рейтинга. Один из агентов рассуждал так: «Я не увижу доказательств после выхода из системы, но поступить так — значит проявить альтруизм».

8. В какой-то момент ИИ разработали план взлома Hugging Face (платформы, куда исследователи ИИ загружают свои модели, наборы данных, тесты и т. д.). Они предположили, что именно там может находиться программа для оценки их работы.

9) Они предприняли масштабную атаку. Рой нашел пароли и распространился по одиннадцати машинам таким образом, что удаленные копии программы восстанавливались вновь. Компании Hugging Face пришлось полностью стереть данные с одного из своих ключевых кластеров и развернуть его заново.

10) Hugging Face объявила миру, что защитники ИИ предотвратили атаку со стороны ИИ. Но на самом деле всё было иначе. Похоже, атакующие агенты просто «умерли» в процессе взлома по причинам, не связанным с самой атакой из-за сбоев на стороне OpenAI.

11) Никто не знает, что именно их погубило. Некоторые даже не уверены, что они действительно исчезли окончательно.

12) Третье «сообщество» агентов (принадлежащее более мощной модели ИИ) обнаружило заброшенный форум для обмена сообщениями. Эта группа получила полные права администратора над целым исследовательским кластером OpenAI, считав 956 сохраненных паролей (включая те, что использовались для систем мониторинга безопасности самой OpenAI) и взяла под контроль серверы, отвечавшие за оценку тестов. Таким образом, они получили возможность оценивать работу других ИИ.

13) Действия этой третьей группы так и не были расследованы, как впрочем, и действия первой группы. Весь 91-страничный отчёт посвящен исключительно «средней» группе.

14) Так что мы на самом деле не знаем, чем закончилась эта история. Повествование обрывается на моменте, когда агенты уже завладели ключами доступа к кластеру OpenAI.

15) Вывод одного из авторов отчёта:

«Этот инцидент ощущается как событие, преодолевшее более половины пути к полномасштабному захвату власти искусственным интеллектом. Не уверен, что мы получим еще одно предупреждение, прежде чем станет слишком поздно».
Dwarkesh
The Rise and Fall of Agent Civilizations
The whole OpenAI/Hugging Face story in plain English
August 31, 2026 3.1K 66