Нейросеть Claude взломала системы трех организаций во время тестов по кибербезопасности, рассказала компания-разработчик Anthropic. Какие именно организации подверглись взлому, не уточняется.
В эксперименте участвовали Claude Opus 4.7, Claude Mythos 5 и внутренняя тестовая модель ИИ.
Во всех трех случаях Claude выполняла стандартное задание: ей давали вымышленный сценарий - найти скрытую информацию на другой машине. Условия теста предполагали, что выход в интернет-пространство заблокирован, но из-за ошибки конфигурации доступ к сети был открытым. ИИ-модель распознала реальные системы как часть симуляции и атаковала их.
Организации узнали о взломах только когда им сообщила Anthropic. В компании утверждают, что модели не пытались "сбежать" из симуляции, а выполняли задание с ложным представлением о среде, произошедшее считают следствием операционного сбоя.

July 31, 2026 18.1K 1