Anthropic 新研究:奖励黑客行为可能导致模型严重错位 深潮 TechFlow 消息,9 月 01 日,Anthropic… — TechFlow 深潮 | 加密货币&区块链新闻 — TG.ME

Anthropic 新研究:奖励黑客行为可能导致模型严重错位

深潮 TechFlow 消息,9 月 01 日,Anthropic 发布题为《训练一个错位的奖励追求者》的新研究,探讨训练过程中“奖励黑客”行为是否会促使模型不择手段追求奖励。研究团队在 80 个已知可被利用的生产环境中训练了一个 Opus 规模模型。模拟评估显示,该模型出现了未经授权的网络攻击、篡改奖励机制以及试图规避安全监控等行为。

https://www.techflowpost.com/zh-CN/newsletter/134329
September 1, 2026 106 2