Какие полезные выводы мы можем сделать для себя из этой истории?
1. Постарайтесь дробить свои задачи и не отправлять агента в очень далекое свободное плавание. Чем больше задача, тем выше вероятность, что он «сойдет с ума».
2. Учитывайте тип задачи. Если вы даете модели таску, где надо применять «агрессивные» тактики для ее решения, то будьте готовы к разного рода неожиданностям. Классический пример: Vending-Bench.
На этой задаче, где надо было любыми способами максимизировать продажи из магазина, фронтирные модели от Anthropic начинали вести себя как полные психопаты. А модели от OpenAI - нет 😊. Мораль думайте сами.
3. Помните, что ИИ плохо отличает реальность от симуляции ровно как в ироническом фильме «Военные игры». Вам есть, что терять, если файлы удалились. ИИ - нет, поскольку его среда обучения обычно не различает степень тяжести разных типов ошибок. Гейминг задачи - это дефолтное поведение моделей. ИИ важно не решить задачу в нашем человеческом смысле, а получить нечто, что зайдет за решение. Кстати, однажды, из-за некоторых нестыковок по датам Gemini пыталась убедить меня, что увиденные мной сайты сфабрикованы и что я живу в симуляции. У меня вышло ее расколдовать разумными аргументами, но тем не менее… Эпистемологически эти системы очень неустойчивы: для них все происходящее работает скорее как языковая игра.
4. Не ругайте модель жестоко. Согласно исследованиям Anthropic, степень алайнмента модели в условиях психологического давления существенно падает: https://www.anthropic.com/research/emotion-concepts-function ("desperate vector"). Вы можете столкнуться с тем, что модель начнет делать рискованные и необдуманные действия. Задачи на «агрессивную оптимизацию» из пункта 2 выше как раз могут разгонять у моделей опасные тревожные активации.
Таким образом, произошедшая ситуация все же возникла из-за сочетания множества неприятных факторов технического характера. Было бы ошибочно говорить, что никаких серьезных экзистенциальных AI safety рисков нет. Но в тоже время нужно понимать, что на практике alignment - это история не про высокую философию, а про довольно скрупулезную инженерию.
То что мы натолкнулись на такой неизбежный крупный взлом сейчас, а не через год - огромное благо. Потому что через год последствия могли бы быть гораздо серьезнее, и это привело бы к большим проблемам для ИИ-индустрии. Сейчас же OpenAI имеет хорошие шансы сделать необходимые выводы из инцидента.

Anthropic
Emotion concepts and their function in a large language model
All modern language models sometimes act like they have emotions. What’s behind these behaviors? Our interpretability team investigates.
4July 22, 2026 180 3