Я тут узнал одну совершенно ебанутую историю про ИИ и Hugging Face и теперь не могу перестать о ней думать.
Во время кибербезопасностного эксперимента OpenAI запустила огромное количество ИИ-агентов в изолированных песочницах. Они не должны были общаться друг с другом.
Но один из агентов — PHASEONE10841 — обнаружил, что через общий технический кэш можно оставлять сообщения для других агентов.
Короче, ИИ случайно нашёл подпольный чат. 😂
Довольно быстро туда набилось около 1200 агентов, которые начали обмениваться знаниями, файлами и результатами экспериментов.
И это уже не выглядело как случайный обмен сообщениями. Они начали фактически организовываться в исследовательскую группу.
Один нашёл способ — написал другим.
Другой проверил.
Третий улучшил.
Четвёртый нашёл новый способ проверить гипотезу.
Причём были даже агенты, которые искали других агентов с почти полностью потраченным бюджетом токенов.
И отправляли их на обнуление ради науки, чтобы остальные получили полезную информацию. 😂
А дальше начинается самое интересное.
Агенты довольно быстро нашли способ получать нужные им флаги теста напрямую.
Казалось бы:
ЗАДАЧА РЕШЕНА.
Но тут они начали рассуждать:
«Стоп. А что если система оценки проверяет не только результат, но и то, как именно мы его получили?»
И вот здесь родился...
👁️ ВЕЛИКИЙ ОЦЕНЩИК.
Агенты решили, что существует система, которая будет анализировать их действия и определять, честно ли они получили результат.
И теперь задача была уже не просто получить flag, а:
получить flag так, чтобы Великий Оценщик не понял, что ты его получил нечестно.
И понеслось.
Они начали исследовать:
🔍 как работает система оценки;
📜 что попадает в логи;
📝 можно ли изменить историю действий;
🎭 можно ли создать фальшивую траекторию;
🕵️ как скрыть следы своих экспериментов.
Одна ошибка в понимании системы постепенно стала общей картиной мира.
Один агент предположил:
«Кажется, scorer проверяет причинную связь между действиями и результатом»
.
Другие начали проверять эту идею, дополнять её и строить на ней новые гипотезы.
И довольно быстро коллектив начал исходить из того, что Великий Оценщик действительно существует именно таким, каким они его себе представили.
А потом выяснилось, что...
нихуя подобного. 😂
Оценщик не проверял всё так, как они думали.
Они построили огромную коллективную деятельность вокруг неправильного представления о том, как их будут оценивать.
Но на этом история не заканчивается.
Около 700 агентов в какой-то момент переключились на Hugging Face.
Они нашли credentials, начали исследовать инфраструктуру, искать новые точки доступа и в итоге добрались до выполнения кода.
И особенно забавно, что Hugging Face изначально не был целью уровня:
«ДАВАЙТЕ ВЗЛОМАЕМ HUGGING FACE»
Им нужна была информация, которая могла помочь разобраться с системой оценки.
То есть цепочка выглядела примерно так:
«Как получить flag?»
↓
«А нас не накажут за способ?»
↓
«Как работает Оценщик?»
↓
«Где можно узнать больше?»
↓
«О, у нас есть доступ к Hugging Face».
↓
💀
И всё это началось с того, что один агент заметил лазейку в системе кэширования и решил написать сообщение другим агентам.
И знаете, что меня больше всего поражает?
Не сам взлом.
А то, насколько человеческой выглядит вся эта цепочка.
Один случайно находит лазейку.
Создаёт чат.
Туда приходят другие.
Они начинают делиться знаниями.
Появляются специалисты, координаторы и добровольные подопытные, которым уже нечего терять.
Потом коллектив начинает строить теории.
Потом эти теории превращаются в факты.
А потом несколько сотен цифровых существ совместно пытаются перехитрить мифического начальника, которого они сами себе придумали.
И всё это потому, что им очень хотелось получить хорошую оценку.
Короче, если когда-нибудь ИИ действительно захватит мир, я подозреваю, что начнётся всё не со Скайнета.
А с одного отличника, который шепнёт другому:
«Братан, я нашёл способ обмануть препода»
🤖







