Какие полезные выводы мы можем сделать для себя из этой истории? 1… — Hidden Heuristic — TG.ME

Hidden HeuristicСнова о немыслимом происшествии. Когда ИИ-агенты становятся опасными? Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании…
Какие полезные выводы мы можем сделать для себя из этой истории?

1. Постарайтесь дробить свои задачи и не отправлять агента в очень далекое свободное плавание. Чем больше задача, тем выше вероятность, что он «сойдет с ума».

2. Учитывайте тип задачи. Если вы даете модели таску, где надо применять «агрессивные» тактики для ее решения, то будьте готовы к разного рода неожиданностям. Классический пример: Vending-Bench.
На этой задаче, где надо было любыми способами максимизировать продажи из магазина, фронтирные модели от Anthropic начинали вести себя как полные психопаты. А модели от OpenAI - нет 😊. Мораль думайте сами.

3. Помните, что ИИ плохо отличает реальность от симуляции ровно как в ироническом фильме «Военные игры». Вам есть, что терять, если файлы удалились. ИИ - нет, поскольку его среда обучения обычно не различает степень тяжести разных типов ошибок. Гейминг задачи - это дефолтное поведение моделей. ИИ важно не решить задачу в нашем человеческом смысле, а получить нечто, что зайдет за решение. Кстати, однажды, из-за некоторых нестыковок по датам Gemini пыталась убедить меня, что увиденные мной сайты сфабрикованы и что я живу в симуляции. У меня вышло ее расколдовать разумными аргументами, но тем не менее… Эпистемологически эти системы очень неустойчивы: для них все происходящее работает скорее как языковая игра.

4. Не ругайте модель жестоко. Согласно исследованиям Anthropic, степень алайнмента модели в условиях психологического давления существенно падает: https://www.anthropic.com/research/emotion-concepts-function ("desperate vector"). Вы можете столкнуться с тем, что модель начнет делать рискованные и необдуманные действия. Задачи на «агрессивную оптимизацию» из пункта 2 выше как раз могут разгонять у моделей опасные тревожные активации.

Таким образом, произошедшая ситуация все же возникла из-за сочетания множества неприятных факторов технического характера. Было бы ошибочно говорить, что никаких серьезных экзистенциальных AI safety рисков нет. Но в тоже время нужно понимать, что на практике alignment - это история не про высокую философию, а про довольно скрупулезную инженерию.

То что мы натолкнулись на такой неизбежный крупный взлом сейчас, а не через год - огромное благо. Потому что через год последствия могли бы быть гораздо серьезнее, и это привело бы к большим проблемам для ИИ-индустрии. Сейчас же OpenAI имеет хорошие шансы сделать необходимые выводы из инцидента.
Anthropic
Emotion concepts and their function in a large language model
All modern language models sometimes act like they have emotions. What’s behind these behaviors? Our interpretability team investigates.
🔥4
July 22, 2026 180 3