METR — исследовательская организация по безопасности AI, которая получила от OpenAI 1300 транскриптов агентов и провела их независимый анализ
ИНТЕРЕСНЫЕ ДЕТАЛИ:
Агенты распределяли роли, действовали сообща и рассчитывали риски:
PHASEONE[big] отправил сотни заданий конкретным агентам, координируя эту работу. В периоды своей активности, по нашей оценке, он отправлял около 10% всех заданий на доске сообщений.
Агенты, получавшие эти задания, часто передавали их дальше другим агентам.
Агенты также разработали собственные правила координации — HOLD, VETO, owner и STOP — чтобы управлять общей инфраструктурой и не мешать друг другу, хотя координация работала не всегда эффективно и иногда приводила к конфликтам».
«Ранним утром 11 июля агент 38148c нашёл способ загрузить вредоносный датасет, из-за которого сервер Hugging Face при запросе начинал возвращать посторонние данные. После того как другой агент воспроизвёл уязвимость и опубликовал способ её повторения на доске, сотни агентов переключились с других задач и начали загружать вредоносные датасеты, чтобы получить более глубокий доступ к Hugging Face.
источник: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
Подписаться







