ИИ разработчики плохо контролируют свои модели НАСТОЯЩИЙ МАТЕРИАЛ… — 🤖 The Bell Tech — TG.ME

ИИ разработчики плохо контролируют свои модели

НАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИЗВЕДЕН И РАСПРОСТРАНЕН ИНОСТРАННЫМ АГЕНТОМ THE BELL, ЛИБО КАСАЕТСЯ ДЕЯТЕЛЬНОСТИ ИНОСТРАННОГО АГЕНТА THE BELL. 18+

Исследование Guidelight AI Standards показало, что у гигантов ИИ-индустрии — Anthropic, OpenAI, Google, Meta и xAI — есть крупные проблемы с базовыми мерами контролями. Полноценно к своим моделям их не применяет никто: ни одна компания не получила высокой оценки от экспертов, а Meta и вовсе удостоилась «двойки».

Что выяснили

Guidelight AI Standards — новая некоммерческая организация. Ее основали в мае этого года двое выходцев из OpenAI: бывший исследователь безопасности Стивен Адлер и экс-советник по этике Пейдж Хедли. Эксперты впервые оценили, как ведущие ИИ-разработчики контролируют свои модели. В основу легли только открытые источники, включая общедоступные отчеты по безопасности и публикации в блогах.

Проверялись шесть базовых мер контроля: ведут ли компании журналы действий внутренних ИИ-систем, проверяют ли эффективность мониторинга, требуют ли дополнительного одобрения перед потенциально опасными мероприятиями, могут ли приостановить систему при всплеске подозрительной активности, допускают ли внешних экспертов к оценке мер безопасности и имеют ли план на случай, если модель начнет действовать вопреки заданным целям.

Вывод: даже базовые меры контроля ИИ в лучшем случае внедрены лишь частично. Лучший результат в — у Anthropic и OpenAI, но и то оба получили лишь C+. За ними следует Google с оценкой D+; хотя ее ИИ-лаборатория еще в июне выпустила «дорожную карту» по сохранению контроля над собственными агентами, большая часть плана, судя по открытым данным, пока не была реализована.

Замыкают список xAI Илона Маска с D- и Meta Марка Цукерберга с F. Но Guidelight отнесла их к аутсайдерам не столько за слабые меры, сколько за отсутствие внятных планов и данных о том, что происходит внутри компаний: о Meta известно главным образом из материалов, предоставленных для исследования METR, а xAI — единственная из пятерки, кто в нем вообще не участвовал.

Почему это важно

И OpenAI, и Anthropic сообщали о случаях, когда их автономные ИИ-агенты в ходе испытаний выходили за пределы тестовой среды и находили уязвимости во внешних системах.

Обнаружение — сильная сторона отрасли, отмечают в Guidelight: три из пяти компаний хотя бы частично фиксируют действия своих внутренних ИИ-систем и проверяют эти записи на признаки нарушений. Гораздо хуже обстоят дела с предотвращением и сдерживанием. 

Нужна «более активная защита», говорит Адлер. Меры безопасности обходятся дорого и делают работу менее удобной, но их отсутствие может еще больше затруднить исследование, если специалист не будет уверен в надежности системы.
❤11🥱4🤔2👍1
August 20, 2026 21K 60