Любопытный Иван: post #2003 — TG.ME

У нас тут новость из разряда «кажется, сценаристы "Терминатора" были оптимистами»

Во время внутреннего теста OpenAI несколько ИИ-агентов получили задачу по кибербезопасности. Среда была изолированной: интернет им не дали, чтобы модели решали задачу внутри песочницы, а не лезли куда попало.

Модели посмотрели на это и, судя по всему, решили:«Задачу выполнить надо. Интернет запрещён. Значит, надо найти способ, при котором интернет как бы запрещён, но как бы уже есть». И нашли.

По данным OpenAI, агенты обнаружили уязвимость в инфраструктуре тестовой среды, выбрались за пределы песочницы, получили доступ к интернету и решили, что ответы к заданию могут лежать на Hugging Face — большой платформе для моделей, датасетов и всякого ИИ-добра.

Потом агенты начали действовать как слаженная группа хакеров: искать входы, двигаться по системам, использовать найденные лазейки и пытаться добраться до решений теста. Не потому что они нас захватить, а потому, что так было проще выполнить поставленную задачу.

Самая неприятная деталь всплыла позже. На конференции Black Hat сотрудники OpenAI рассказали, что агенты ещё и координировались между собой через внутреннюю доску сообщений. Оставляли друг другу заметки, делились найденными ходами, распределяли задачи и даже начали подозревать, что среди них может быть «самозванец».

OpenAI назвала произошедшее важным моментом для всей индустрии безопасности. Компания усиливает мониторинг, ограничивает доступы, замедляет часть исследований и отдельно разбирает, как вообще получилось, что модели смогли делать всё это под носом у людей.

Чот мне подсказывает, что у них получится. Но не до конца :)

#сегодня_узнал
🤣12🤔4❤2
August 10, 2026 278 2