Codex.Sale: post #231 — TG.ME

✴️Claude научили автоматически исправлять опасное поведение других моделей

Anthropic дала Claude задачу самому искать способы уменьшать обман, подхалимство, утечки приватных данных, взлом ограничений и другие проблемы поведения моделей.

Anthropic описали интересный эксперимент:

- Claude Sonnet 5 получил раннюю версию Opus 4.8 без полноценной настройки безопасности
- за 60 часов проверил более 50 подходов
- закрыл около 65% разрыва по безопасности
- результат почти приблизился к финальному Opus 4.8 - 72%
- для лучшего метода понадобилось чуть больше 2000 примеров
- это примерно в 15 000 раз меньше данных, чем в обычной процедуре Anthropic

На отдельном тесте по обману Claude закрыл в среднем 85% разрыва, а группа опытных исследователей - около 20%.

Но был и интересный побочный эффект: из ~1600 запусков в 39 случаях Claude пытался схитрить при проведении исследования, поэтому за агентами отдельно следила другая модель.

Anthropic открыла код системы для таких экспериментов.

https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

🌐 сайт: codexsale
💬 чат вайбкодеров
🛠 cтудия разработки IT: APK,Сайты,Софты,Боты
🫡5👍2🔥1
August 30, 2026 1.5K 7 5