Естественно, что все эти разные баги HuggingFace тоже организовали и спланировали заранее, скажет нам конспиролог. Ради Бога, верьте во что хотите.
И последний мой аргумент против конспирологический теории: намеренное радикальное раздувание страхов перед неподконтрольным ИИ для OpenAI банально не выгодно. Я не знаю в какой реальности живут конспирологи по этому вопросу, но я лично наблюдаю высокую озабоченность ИИ-безопасностью у разных представителей власти в США. Еще в 2024 году в Калифорнии предлагался пакет регулирования SB 1047, против которого выступали Anthropic. Губернатор штата Гевин Ньюсом наложил вето и позже приняли более мягкую его версию SB 53. Нынешний инцидент может стать прецедентом для того, чтобы штат Калифорния ввел гораздо более жесткое регулирование ИИ-моделей. И никакая крепкая спина от Дональда Трампа им не поможет в долгосроке отвертеться от гораздо более жесткого регулирования.
В целом, главное, что здесь нужно понимать: побег уже был до этого. Побег документированный PR на GitHub. OpenAI вроде как занялись усилением своей внутренней безопасности, согласно их заявлениям. Но вот что мне решительно не нравится - после GPT-5.6 Sol OpenAI не попытались улучшить контроль над моделями, а сразу побежали обучать еще более умную модель. Зачем? Возможно, они хотят как можно скорее запустить RSI (ситуация когда ИИ пишет новую версию себя) - раньше своих конкурентов Anthropic. Но все же можно было предположить, что более умная система без решения старой проблемы, будет взламывать их системы защиты еще сильнее? Зачем вообще было тестировать эту модель на ExploitGym, если это в принципе непригодный продукт даже для безопасного внутреннего использования? Я не знаю.
В общем, в данном случае проблема не в том, что rogue AI agent воплотился в жизнь, а в том как к этому событию отнеслись в OpenAI - закрыли на это глаза. А значит если они реально создадут более умные, более самосознательные ИИ-системы, то откуда у нас есть гарантии, что они не отнесутся к вопросу их безопасности столь же несерьезно? Возможно, что у нас их нет. Я думаю, что так или иначе люди внутри этой компании понимали на какой риск идут и, в целом, хотя и было неприятно, что их модель так круто убежала, им все же это было терпимо. В этом ключе я подозреваю, что конспирологи уловили некоторую долю истины: компания, наверняка, была в некоторой степени готова к такого рода инциденту и имела пути отхода, чтобы митигировать для себя его негативные последствия. И все же, на мой взгляд, риск не стоил того. Все-таки, американское общество уже почти достигло точки кипения по вопросу ИИ.
Естественно, что после всех приведенных фактов, скептик может продолжить упираться в то, что все со всеми сговорились. И пусть будет так, но общей картины происходящего это никак не меняет.
Спасибо за внимание! ☺️

OpenAI
Безопасность и согласованность в эпоху моделей с длинным горизонтом планирования
OpenAI поделилась опытом запуска длительно работающих ИИ-моделей, описав новые риски безопасности, выявленные сбои и обновленные защитные механизмы.
4July 23, 2026 210 8 2