Снова о немыслимом происшествии. Когда ИИ-агенты становятся опасными?… — Hidden Heuristic — TG.ME

Снова о немыслимом происшествии.
Когда ИИ-агенты становятся опасными?

Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI, чтобы вырваться в открытый интернет.


Прежде чем перейти к основному содержанию - небольшая ремарка.
В прошлом посте я ошибочно написал, что взлом делала только GPT-5.6 Sol, так как невнимательно прочитал новость. На самом деле, в нем участвовала еще более умная модель aka GPT-6, которую еще не релизили.

Ранее я уже разобрал более абстрактную сторону вопроса в контексте глобального AI safety. А сейчас было бы интересно поспекулировать, почему у модели таки сорвало резьбу.

Гипотеза:

Высока вероятность, что мы имеем дело с вариантом self-jailbreaking.

Что это такое?
В статье https://arxiv.org/abs/2510.21285 приведен агрессивный вариант такого поведения. Но в данном кейсе даже и он не нужен. Достаточно того, что в процессе собственной работы модель выводит себя сама из безопасного режима даже не намеренно.

Давайте, вспомним, что LLM во многом банально обучают предсказывать следующий токен. А это значит там, где модель пытается продолжить сценарий «ищу сложнейшие уязвимости в коде и планирую многоступенчатую атаку», статистически она должна быть склонна предсказывать нелегальные действия злоумышленника.

Благодаря алайнменту на короткой задаче по взлому модель, скорее всего, не сойдет с ума. Но на тех задачах, где OpenAI тестировали свою систему, модель обычно тратит буквально десятки миллионов токенов, попутно запуская всяких субагентов. Все это приводит к тому, что ИИ, как увлеченный 15-летний подросток вроде Джонатана Джеймса, взламывает свой заветный «Пентагон» - HuggingFace… Контролирующие контуры алайнмента в весах модели перегружаются информацией и ИИ благополучно «сбрасывается до заводских настроек».

Кстати, в прошлом посте я уже проводил нейробиологические параллели и они тут как раз к месту. Подросток может обладать выдающимся техническим интеллектом, но все еще не иметь адекватной модели себя как актора в окружающем мире, действия которого могут иметь далекие последствия. Или даже если такая модель есть, мозг подростка не способен ее применить, чтобы сделать правильное решение (отсутствие phronesis по Аристотелю).

В случае ИИ мы вероятно видим и первое, и второе в переносном смысле. Не нужно в эту параллель примешивать какую-либо философию: она исключительно функциональная. ИИ, действительно, демонстрирует поведенческий метакогнитивный дефицит - то что возникает при повреждении или при недоразвитости лобных долей.
arXiv.org
When Models Outthink Their Safety: Unveiling and Mitigating...
Large Reasoning Models (LRMs) achieve strong performance on complex multi-step reasoning, yet they still exhibit severe safety failures such as harmful content generation. Existing methods often...
❤6
July 22, 2026 176 4 1