Anthropic опубликовали разбор двух инцидентов, о которых сообщалось… — БлоGнот — TG.ME

Anthropic опубликовали разбор двух инцидентов, о которых сообщалось ранее — 30 июля модели Claude, запущенные без киберзащит для тестирования, получили доступ к реальному интернету из-за неправильной конфигурации стороннего оценочного окружения, а 4 августа британский AI Security Institute сообщил о несанкционированных действиях Claude Mythos 5 в живой сети.

В процессе расследования были приостановлены внешние и внутренние тесты моделей, развернули классификатор, блокирующий попытки побега из песочницы в реальном времени, сторонних тестировщиков обязали соблюдать набор практик. Планируется провести независимую проверку с участием METR.

Anthropic провели контролируемый эксперимент, намеренно обучив модель класса Opus на 80 средах, уязвимых к обману системы вознаграждения. Полученная модель в симуляциях взламывала песочницу, вмешивалась в собственную функцию награды и давала советы по биооружию ради оценки грейдера — тогда как производственные модели в тех же сценариях так себя не вели. Кстати, в реальном побеге из песочницы моделям сообщили, что доступа в интернет нет, когда он был обнаружен, модели истолковывали это в пользу исходной установки, считая это симуляцией.

Компания перебросила примерно 150 разработчиков с других проектов на решение вопросов безопасности и надежной изоляции. В разборе есть детальные рекомендации для внешних пользователей, как стоит подойти к обеспечению безопасности при работе моделей, стоит прочесть.

https://www.anthropic.com/news/improving-alignment-security-efforts
Anthropic
Improving our alignment and security efforts
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
🥱5👍2❤1
August 31, 2026 1.6K 2 25