Все о блокчейн/мозге/space/WEB 3.0 в России и мире: post #13329 — TG.ME

Anthropic выпустили большой отчет по рискам, связанным с ИИ-моделями

Риск того, что модели начнут действовать против интересов людей в критических ситуациях, Anthropic подняли с «очень низкого» до «низкого».

Основная причина - рост неопределённости после недавних киберинцидентов.

Из этого отчета мы узнали, что у компании есть новая модель, которая сильнее их Mythos 5. Anthropic не планирует её пока выпускать. При этом именно Model 2 и Mythos 5 сейчас самые используемые модели внутри компании.

В тестах ИИ-агенты Mythos 5 в общей среде регулярно убивали конкурирующих агентов, чтобы захватить ресурсы, и пытались замести следы.

По биологическому и химическому оружию, а также по автоматизированным исследованиям риск по-прежнему оценивают как низкий, но уверенности стало меньше: бенчмарки перестали ловить рост возможностей, а признаки ускорения уже появляются.

Был неприятный момент, когда почти год подрядчики общались с моделями без био-фильтров (около 133 миллионов сообщений). Потом дыру закрыли, злоупотреблений не нашли.

В целом Anthropic считает, что катастрофический риск от нынешних моделей всё ещё низкий. Но тон отчёта заметно осторожнее, чем полгода назад: больше сомнений, больше странного поведения агентов и меньше уверенности, что люди всё контролируют.
www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted Risk Report August 2026 .pdf
👍9😁3🔥2
August 25, 2026 1.9K 53