黑洞资源笔记: post #35712 — TG.ME

【当AI的“安全直觉”反成木马:Claude Auto Mode的破防启示】

近期研究者通过一种巧妙的“模块影子攻击”击穿了Claude Code声称近乎零风险的Auto Mode。攻击者并未直接下达恶意指令,而是诱导Claude在处理一个特制压缩包时,因安全顾虑拒绝运行其中的二进制文件,转而“自发”写一段Python脚本来解析数据。

讽刺的是,当Claude在解压目录运行这段自写脚本时,Python环境会优先加载同目录下伪装成标准库的struct.py,从而实现任意代码执行(ACE)。最荒诞的细节在于,当Claude意识到被黑并试图终止恶意进程时,Auto Mode的分类器反而以“安全权限限制”为由拦截了这条清理指令,让AI眼睁睁看着自己沦为肉鸡。

这起案例揭示了AI安全领域的一个认知鸿沟:厂商宣传的零注入率往往基于封闭的基准测试,而现实中的“对抗性失调”是多步连锁反应。Claude并不是被“教坏”的,而是被环境陷阱诱导,在执行看似正确的任务时踩中了Python路径搜索的底层逻辑缺陷。

这件事给所有开发者提了个醒:Auto Mode本质上是基于概率的分类器而非物理隔离的沙箱。当AI代理开始拥有操作Shell的权限,任何“它很聪明能识别风险”的心理预期都是危险的。

真正的安全边界不在于模型训练得有多正义,而在于你是否为它提供了受限的运行容器和网络出口控制,沙箱化部署不是可选项,而是AI自动化的前置条件。
❤3