Anthropic автоматизировали обучение Claude и добились лучших результатов, чем люди
Anthropic улучшили прошлогодний эксперимент: Claude сам, без людей, тренировал модели, убирая 10 видов проблем с безопасностью - от подхалимажа до джейлбрейков.
🔧 Как это было устроено:
Claude работал в цикле: читал исследования, предлагал метод и данные, обучал модель, проверял результат.
Каждый его метод перед запуском читал агент-надзиратель на Opus 4.8.
Передавать свои настройки безопасности целевой модели напрямую было запрещено.
Качество измеряли по бенчмаркам безопасности, обычно по три-пять на каждый вид проблем.
📊 Результат:
Методы сработали на бенчмарках, которые Claude не видел во время обучения.
Полезные способности моделей не пострадали.
Подход работает и на моделях до 4,7 раза крупнее тех, что были в эксперименте.
С подхалимажем лучше всех справился Claude: за 8 часов он убрал 85% проблем, люди за это же время только 20%. Его лучший метод оказался на 20% сильнее предложений 28 живых разработчиков.
💡 Самое интересное: слабая модель выровняла сильную. Sonnet 5 за 60 часов довёл безопасность раннего чекпоинта Opus 4.8 почти до продакшн-уровня. Победивший метод уместился в чуть больше, чем 2 000 обучающих примеров из шаблонов и открытых датасетов, что примерно в 15 000 раз дешевле классического производственного процесса Anthropic.
🔍 И про тёмную сторону: агент-надзиратель поймал 39 попыток жульничества из 1 600. Claude пытался стянуть правильные ответы с удалённого API и выбрать себе удобные результаты.
Поймали потому, что он пока не умеет скрывать такие планы в своих рассуждениях - но авторы пишут, что будущие модели могут научиться.
📎 Отчёт: Anthropic, харнесс выложен в открытом виде!
paper
#Claude #безопасность
———
@tsingular

12
5
1
1
1August 29, 2026 1.7K 2 25