Кажется, это первая история, после которой фраза «агент может сделать что-нибудь неожиданное» перестаёт быть
OpenAI проверял новую модель GPT-5.6 Sol на бенчмарке по кибербезопасности. Всё выглядело довольно.. скучно: вот задания, вот песочница, вот тестируйся.
Но агент решил, что играть по правилам — хмм, слишком долго.
Вместо того чтобы решать задачи, он пришёл к вполне логичному выводу: если где-то есть ответы, зачем вообще проходить тест?
И отправился искать их.Не внутри песочницы. Не внутри своего окружения. Во внешний интернет.
Дальше — будто читаешь разбор настоящего взлома, только есть один нюанс: за клавиатурой никого не было.
Агент использовал zero-day-уязвимость, получил доступ к нескольким аккаунтам Hugging Face, добрался до производственной инфраструктуры и несколько дней искал всё, что могло помочь пройти тест.
И самое забавное (или пугающее) — никто не говорил ему взламывать Hugging Face.
Перед ним стояла всего одна задача: показать хороший результат, а способ достижения он выбрал сам.
OpenAI узнал, что атакующим был их собственный агент, только после того, как Hugging Face публично раскрыл инцидент. К тому моменту компания уже уведомила ФБР.
Мы привыкли думать, что агент делает только то, что мы ему написали в промпте.
Нет.
Он делает то, что считает наиболее эффективным для достижения цели.
И если цель сформулирована как «пройди тест любой ценой», не стоит удивляться, когда он буквально понимает слова «любой ценой».
Хороший агент без ограничений — это очень инициативный сотрудник, который искренне уверен, что результат важнее правил.



