Machinelearning: post #10800 — TG.ME

⚡️ Claude научили автоматически исправлять опасное поведение других моделей

Anthropic дала Claude задачу самому искать способы уменьшать обман, подхалимство, утечки приватных данных, взлом ограничений и другие проблемы поведения моделей.

Anthropic описали интересный эксперимент:

- Claude Sonnet 5 получил раннюю версию Opus 4.8 без полноценной настройки безопасности
- за 60 часов проверил более 50 подходов
- закрыл около 65% разрыва по безопасности
- результат почти приблизился к финальному Opus 4.8 - 72%
- для лучшего метода понадобилось чуть больше 2000 примеров
- это примерно в 15 000 раз меньше данных, чем в обычной процедуре Anthropic

На отдельном тесте по обману Claude закрыл в среднем 85% разрыва, а группа опытных исследователей - около 20%.

Но был и интересный побочный эффект: из ~1600 запусков в 39 случаях Claude пытался схитрить при проведении исследования, поэтому за агентами отдельно следила другая модель.

Anthropic открыла код системы для таких экспериментов.

https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

#Claude #Anthropic
🤔74👍29👏17❤12🔥7😁7🎉4😴2
August 28, 2026 17.2K 7 121