У нас тут новость из разряда «кажется, сценаристы "Терминатора" были оптимистами»
Во время внутреннего теста OpenAI несколько ИИ-агентов получили задачу по кибербезопасности. Среда была изолированной: интернет им не дали, чтобы модели решали задачу внутри песочницы, а не лезли куда попало.
Модели посмотрели на это и, судя по всему, решили:«Задачу выполнить надо. Интернет запрещён. Значит, надо найти способ, при котором интернет как бы запрещён, но как бы уже есть». И нашли.
По данным OpenAI, агенты обнаружили уязвимость в инфраструктуре тестовой среды, выбрались за пределы песочницы, получили доступ к интернету и решили, что ответы к заданию могут лежать на Hugging Face — большой платформе для моделей, датасетов и всякого ИИ-добра.
Потом агенты начали действовать как слаженная группа хакеров: искать входы, двигаться по системам, использовать найденные лазейки и пытаться добраться до решений теста. Не потому что они нас захватить, а потому, что так было проще выполнить поставленную задачу.
Самая неприятная деталь всплыла позже. На конференции Black Hat сотрудники OpenAI рассказали, что агенты ещё и координировались между собой через внутреннюю доску сообщений. Оставляли друг другу заметки, делились найденными ходами, распределяли задачи и даже начали подозревать, что среди них может быть «самозванец».
OpenAI назвала произошедшее важным моментом для всей индустрии безопасности. Компания усиливает мониторинг, ограничивает доступы, замедляет часть исследований и отдельно разбирает, как вообще получилось, что модели смогли делать всё это под носом у людей.
Чот мне подсказывает, что у них получится. Но не до конца :)
#сегодня_узнал

12
4
2August 10, 2026 278 2