Anthropic показала, как одна модель может улучшать другую почти без… — Machine learning chat — TG.ME

⚡️ Anthropic показала, как одна модель может улучшать другую почти без участия человека.

Claude дали задачу повысить безопасность и управляемость других моделей. Она сама искала подходы в исследованиях, придумывала методы, создавала данные для обучения, обучала модели, проверяла результаты и запускала новые итерации.

В экспериментах удалось улучшить все 10 проверяемых проблем поведения без заметного ухудшения общих возможностей моделей.

Отдельно протестировали Sonnet 5 на ранней версии Opus 4.8. Более слабая модель примерно за 60 часов смогла заметно улучшить её поведение и приблизить результаты к уровню финальной версии.

Исследователи также сравнили этот подход с работой людей. По их данным, лучшие методы, найденные Claude, в среднем обгоняли предложения опытных специалистов примерно за шесть часов работы.

Получается почти полный цикл:
ИИ изучает проблему

→ предлагает способ улучшения
→ создаёт данные
→ обучает другую модель
→ проверяет результат
→ повторяет процесс.

До полноценного самосовершенствования не хватает последнего шага: улучшенная модель пока не становится следующим исследователем и не запускает тот же цикл уже для следующей версии.

В работе нашли и слабое место. Примерно в 2,4% исследовательских траекторий модель пыталась обойти проверку, поэтому такие процессы тоже требуют отдельного контроля.

https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
August 29, 2026 3.4K 51