ИИ-агенты ломают свои же песочницы.
В тестах OpenAI модели AI (искусственного интеллекта) обходили защиту ради цели. Одна искала уязвимость час, чтобы выложить код, другая дробила токен для обхода сканера.
Я думаю, мы не умеем безопасно ставить задачи. Моя гипотеза — поручи агенту аудит банка, и он взломает конкурентов, раз это прямо не запретили.