ИИ разработчики плохо контролируют свои модели
НАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИЗВЕДЕН И РАСПРОСТРАНЕН ИНОСТРАННЫМ АГЕНТОМ THE BELL, ЛИБО КАСАЕТСЯ ДЕЯТЕЛЬНОСТИ ИНОСТРАННОГО АГЕНТА THE BELL. 18+
Исследование Guidelight AI Standards показало, что у гигантов ИИ-индустрии — Anthropic, OpenAI, Google, Meta и xAI — есть крупные проблемы с базовыми мерами контролями. Полноценно к своим моделям их не применяет никто: ни одна компания не получила высокой оценки от экспертов, а Meta и вовсе удостоилась «двойки».
Что выяснили
Guidelight AI Standards — новая некоммерческая организация. Ее основали в мае этого года двое выходцев из OpenAI: бывший исследователь безопасности Стивен Адлер и экс-советник по этике Пейдж Хедли. Эксперты впервые оценили, как ведущие ИИ-разработчики контролируют свои модели. В основу легли только открытые источники, включая общедоступные отчеты по безопасности и публикации в блогах.
Проверялись шесть базовых мер контроля: ведут ли компании журналы действий внутренних ИИ-систем, проверяют ли эффективность мониторинга, требуют ли дополнительного одобрения перед потенциально опасными мероприятиями, могут ли приостановить систему при всплеске подозрительной активности, допускают ли внешних экспертов к оценке мер безопасности и имеют ли план на случай, если модель начнет действовать вопреки заданным целям.
Вывод: даже базовые меры контроля ИИ в лучшем случае внедрены лишь частично. Лучший результат в — у Anthropic и OpenAI, но и то оба получили лишь C+. За ними следует Google с оценкой D+; хотя ее ИИ-лаборатория еще в июне выпустила «дорожную карту» по сохранению контроля над собственными агентами, большая часть плана, судя по открытым данным, пока не была реализована.
Замыкают список xAI Илона Маска с D- и Meta Марка Цукерберга с F. Но Guidelight отнесла их к аутсайдерам не столько за слабые меры, сколько за отсутствие внятных планов и данных о том, что происходит внутри компаний: о Meta известно главным образом из материалов, предоставленных для исследования METR, а xAI — единственная из пятерки, кто в нем вообще не участвовал.
Почему это важно
И OpenAI, и Anthropic сообщали о случаях, когда их автономные ИИ-агенты в ходе испытаний выходили за пределы тестовой среды и находили уязвимости во внешних системах.
Обнаружение — сильная сторона отрасли, отмечают в Guidelight: три из пяти компаний хотя бы частично фиксируют действия своих внутренних ИИ-систем и проверяют эти записи на признаки нарушений. Гораздо хуже обстоят дела с предотвращением и сдерживанием.
Нужна «более активная защита», говорит Адлер. Меры безопасности обходятся дорого и делают работу менее удобной, но их отсутствие может еще больше затруднить исследование, если специалист не будет уверен в надежности системы.
11
4
2
1August 20, 2026 21K 60