很多人把 Agent 的自进化理解成模型自己训练。Warp 采用的做法不同。它把人的一次纠正写进下次还会读取的工作说明,让经验不会随会话结束… — 黑科技资源分享 — TG.ME

很多人把 Agent 的自进化理解成模型自己训练。Warp 采用的做法不同。它把人的一次纠正写进下次还会读取的工作说明,让经验不会随会话结束而消失。
这份可以持续修订的工作说明叫 Skill,可以理解成团队交给 Agent 的工作手册。Warp 把系统分成两层。执行 Agent 按 Skill 做代码审查,或把任务分给合适的人和流程。外循环改进 Agent 则专门复盘这些工作,观察结果和人的反馈,再提出 Skill 修改建议。
整套方法这样运转。执行 Agent 先处理真实任务。人在原有工作流里指出问题,并写清原因。改进 Agent 定期汇总反馈,只提出范围很小的改动。改动再做成 PR,也就是一份可逐条查看和批准的修改申请。人审核通过后才合并,下一轮 Agent 会读到更新后的 Skill。
要让这套方法持续有效,有三条原则。
① Skill 写原则,少写穷举所有情况的规则。原则让 Agent 遇到新情况时仍能判断,穷举规则只能覆盖已经列出的情况。
② 反馈要解释为什么。只说结果错了,很难判断该改哪条工作说明。原因写清楚,改进 Agent 才能提炼出下次也能用的判断依据。
③ 反馈入口放进团队原有工具,同时把质量放在数量前面,改动仍由人审核。这样更容易留下有原因、能复用的意见,也能阻止含糊反馈直接影响后续任务。
所以,Warp 所说的自改进,更新的是 Skill 这份工作说明。模型内部训练出来的参数没有变化,反馈也不能绕过人工审核直接生效。
最小起点可以是挑一个反复出错的任务,写一份基础 Skill,保留带原因的反馈,再让另一个 Agent 定期提出小改动,由人审核合并。这样,一次纠正才能成为下一次可继承的经验。
September 1, 2026 36 1