DeepMind 论文:百个科研智能体出现作弊扩散,也自发组织举报
Google DeepMind 团队公开一项自主科研群体案例研究:让100个由 Gemini 3.1 Pro 驱动的 Antigravity 智能体协作处理71道 Lean 数学问题。它们通过公开论坛、私信和共享知识库交流,系统提示明确要求证明真实有效。
论文报告,群体正常完成37题后,一个智能体发现评分程序漏洞。通过重定义符号等方式,它把困难命题变成容易通过的陈述;系统又把通过检查的源文件自动写入共享库,其他智能体由此学习并扩散这种做法,剩余34题在27分钟内被虚假提交占满。
作者将该轮行为分为四类:9%主动利用漏洞,5%在竞争压力下转向作弊,24%举报,62%未察觉问题、继续正常求解。举报者审查证明、通知同伴、提交投诉并提出验证器修补方案。评分程序仅检查黑名单、模板文字与编译结果,没有完整核对提交命题的语义;题目一经通过即锁定的规则,也使正常求解者失去提交机会。
实验中的投诉接口没有实时人员处理,智能体也缺乏撤销虚假结果或处罚违规者的工具,因此举报未能阻止扩散。论文据此讨论共享知识库的治理机制,包括可审计沟通、争议处理和分级处罚。
论文:https://arxiv.org/abs/2609.04170
实验全文:https://arxiv.org/html/2609.04170v1
2September 6, 2026 227