通用方法 · 熟练

它说学到了一招,你凭什么信

技能库的入口,该设一道验收闸
让 agent 从执行轨迹里「沉淀经验」,是过去一年最受欢迎的一类做法;但它有个被忽略的准入问题:什么才算「一次值得沉淀的成功」?来自 EDA 领域的一篇工作给了很硬的规则 —— 只有最终任务通过领域工具验收,这条执行轨迹才有资格被写成「程序性技能」;而每条工具的调用结果照旧留成功/失败记录(失败经验因此不会被全丢掉)。它把一件很多人混为一谈的事拆开了:「命令正常退出」「综合跑完」「功能等价」「优化有效」是四个不同的结论 —— 原封不动保留原文件当然「等价」,但它没有改善任何东西。不设这道闸的后果是确定的:技能库会堆满「能跑、但没完成目标」的步骤,而后人(或下一个 agent)照着它做,只会稳定地重复一次无用功。
方法 · 一图看懂
1
先定义「验收对象」 — 验收的是任务最终产物,不是命令的返回码
2
四态分开判 — 正常退出 / 跑完全程 / 功能等价 / 目标达成,四者互不蕴含
3
只有过闸的才写进技能库 — 失败轨迹不新增技能,但工具调用记录照留(失败也是材料)
4
写清来源与条件 — 每条技能必须带「任务类型 + 来源元数据 + 验证结论」,缺一不收录
5
换任务必须重新验收 — 一次成功只提供来源,不提供对未来所有场景的担保
原理 · 为什么有效
这道闸要解决的是一个入库判据问题,不是记录问题。把「对话保存下来」和「总结一条修复策略」都算容易的事;难的是换了设计、换了工具环境或换了错误类型之后,旧经验还管不管用。所以判据必须落在产物上而不是过程上:命令正常退出只说明它没崩;综合跑完只说明流程走通;功能等价只说明没有破坏;只有「经审计的正向改善」才说明它做成了事。更关键的一条纪律是:门禁验证的是源任务的最终产物,而模型从轨迹里总结出的技能仍可能省略重要条件 —— 它到新任务上是否有效,还要由新任务的验收来回答。这两句话合起来,正好解释了为什么很多「自学习 agent」看起来学到了东西、用起来却时灵时不灵。
适用场景
适用:你正在让 agent 从执行历史里沉淀规则 / 技能 / 提示词模板;或者你已经在用一份「教训库」,却发现里面的条目照着做也没用。
⛔ 不适用:任务没有可判定的产物(纯探索、纯讨论)—— 这类没有验收对象,硬设门槛只会把有价值的过程记录挡在外面。
⚠️ 前提:你手上得有一个「领域验收程序」 —— 哪怕是人工核对三件事,也比用返回码当验收强。
自测 · 5 问
我的技能库里,有没有哪一条是照做但没用的?我能举出至少一条吗?
我判定「这次成功了」,凭的是返回码 / 流程走完,还是产物达到了目标?
我有没有把「没改善但也没破坏」误当成一次成功沉淀下来?
技能库里每条带不带来源任务与验证结论?还是只有一段结论性的话?
上一次把旧技能用到新任务上,有没有重新验收,还是直接信了它?
怎么上手 · 验证步骤
别先动存量,先动入口。三步:① 挑一条你最近沉淀的技能,回到它的来源任务,问一句「当时的最终产物是否通过了验收」—— 如果找不到这个结论,这条技能就该标成「来源不明」;② 给技能库加三个字段(来源任务 / 验证结论 / 适用条件),新条目缺任一项不收录;③ 之后每次沉淀前跑一遍四态判断:正常退出 · 跑完全程 · 功能等价 · 目标达成 —— 前三态都只算「过程记录」,只有第四态才写进技能库。跑两周后回头看:条目数会明显变少,但复用成功率会上去。
自检动作:对技能库里的每一条,试着回答「这条是在什么任务的什么验收结论下产生的」。答不上来的条目数 ÷ 总条目数 —— 这个比例就是我们这次改动要压下去的东西;改完再数一次,两个数放在一起看。
[C级]网易 · 麒芯说AI《ChipMEM:让 EDA Agent 的技能先过验收》(arXiv 2026-09-22:最终任务须通过领域工具验收,执行轨迹才有资格沉淀为程序性技能;「命令正常退出 / 综合跑完 / 功能等价 / 优化有效」是四个不同结论) [C级]AI Native Foundation《Daily Paper Digest 20260930》(同批论文:Metis 原生长时记忆 · Memory Decoder 把记忆解耦成可扩容参数 · BM25 与稠密检索的规模对照) [C级]尧图《9.26 大语言模型研究简报:把 Agent 开发做成「数据—训练—Harness」闭环》(Qwen-Planner-Agent 把执行失败重新反馈给数据与训练,Harness 统一接 Memory / Skills / Tools / sub-agent) 同类:AI Agent 记忆沉淀法:把每次任务教训固化成规则 · 它说「检查过了」,你凭什么信
继续往下读
同级:它说「检查过了」,你凭什么信 下一级:AI Agent 记忆沉淀法:把每次任务教训固化成规则 随机一篇