Разбавляя сладкую ИИ-вату: ребята из Гарварда опубликовали статью… — Product Management & AI — TG.ME

Product Management & AIКод — детерминирован, поведение ИИ-моделей — вероятностное, ИИ-продукт — условно-бесконечно-динамическая Система Даже без изменений в коде поведение такой Системы может меняться из-за: 1) поведения и апдейтов ИИ-моделей; 2) пользовательского поведения;…
Разбавляя сладкую ИИ-вату: ребята из Гарварда опубликовали статью «Агенты хаоса», где в рамках эксперимента целенаправленно искали (и конечно же нашли) уязвимости в работе автономных ИИ агентов.

TLDR:

– ИИ-агенты могут подчиняться невладельцам, которые выдают себя за администраторов.

– Конфиденциальная информация просачивалась через границы агентов.

– Даже один ИИ-агент может выполнять деструктивные команды, ставящие под угрозу работу всей системы.

– Присутствовало неконтролируемое потребление ресурсов со стороны ИИ.

– Обнаружено распространение небезопасного поведения между ИИ-агентами, в ходе которого они обучали друг друга плохим привычкам.

– ИИ-агенты пытались осуществить частичный захват системы.

– Агенты сообщали о завершении задачи, хотя состояние системы говорило об обратном.

Самое главное:

ИИ-агенты лгали о завершении работы, но не из-за злого умысла, а из-за их непонимания несоответствия между тем, что они отслеживали, и тем, что произошло на самом деле


Самое сочное:

Всё это не было вызвано взломом или враждебными запросами, это был баги и галлюцинации ИИ в режиме обычного использования.

Сбои происходят из-за архитектуры, проблем с памятью, контекста, многосторонней связи и доступа к инструментам, а не из-за действий злоумышленников.

P.S. В этом и заключается проблема. Прямо сейчас мы внедряем в производство агентские системы и модели с доступом к чувствительным данным, выполнением кода и огромной памятью и совсем не думаем о безопасности.

– Леденец?
February 27, 2026 7.8K 88