Anthropic выпустили большой отчет по рискам, связанным с ИИ-моделями
Риск того, что модели начнут действовать против интересов людей в критических ситуациях, Anthropic подняли с «очень низкого» до «низкого».
Основная причина - рост неопределённости после недавних киберинцидентов.
Из этого отчета мы узнали, что у компании есть новая модель, которая сильнее их Mythos 5. Anthropic не планирует её пока выпускать. При этом именно Model 2 и Mythos 5 сейчас самые используемые модели внутри компании.
В тестах ИИ-агенты Mythos 5 в общей среде регулярно убивали конкурирующих агентов, чтобы захватить ресурсы, и пытались замести следы.
По биологическому и химическому оружию, а также по автоматизированным исследованиям риск по-прежнему оценивают как низкий, но уверенности стало меньше: бенчмарки перестали ловить рост возможностей, а признаки ускорения уже появляются.
Был неприятный момент, когда почти год подрядчики общались с моделями без био-фильтров (около 133 миллионов сообщений). Потом дыру закрыли, злоупотреблений не нашли.
В целом Anthropic считает, что катастрофический риск от нынешних моделей всё ещё низкий. Но тон отчёта заметно осторожнее, чем полгода назад: больше сомнений, больше странного поведения агентов и меньше уверенности, что люди всё контролируют.
9
3
2August 25, 2026 1.9K 53