技术 · 熟练

装了一堆技能,先量哪把尺?

装之前就该有一把尺
技能装上之后你是知道的 —— 占了多少上下文、有没有被用到,事后都能算。真正难的是装之前:眼前有十几个候选,凭什么留下这三个、扔掉那九个?现在有一把可用的尺子:把每个技能沿两条轴量一遍 —— 一是信息增益(它带进来的是模型本来就说不出的东西,还是它自己能编出来的常识),二是行为约束(它把动作限定在某个范围、还是只是换了个说法)。两条都高的才值得长期驻留;信息增益高而约束低的多半是知识包(该进文档不该进技能);约束高而增益低的多半是形式主义。判据一句话:一个技能值得留下,是因为它同时让你「知道得更多」和「做得更少犯错」,而不是因为它热门。
方法 · 一图看懂
1
把候选技能排成一列,先不评价,只写它打算改变什么 —
2
沿信息增益量一遍:它带来的是模型编不出的东西吗 —
3
沿行为约束量一遍:它把动作限定住了,还是只换了说法 —
4
两轴都高的才留,其余的按类型改走文档或直接扔掉 —
原理 · 为什么有效
为什么这件事值得单独做一把尺:技能生态的膨胀速度远快于选择能力。一个可参考的规模量级是:某技能中心取下来做评估的公开技能有六万多个,而真正做过「技能条件下的执行」验证的样本是五万多次 —— 也就是说,绝大多数技能从来没被真正测过它对下游有没有用。更关键的一条经验数据:技能库超过约一百五十个之后,语义相似度上升会让「选对技能」的准确率骤降四成到六成 —— 你装得越多,选错的概率越高,而且这个下降不是线性的。这就是为什么「先有一把尺,再往里装」比「先装满,再回头清理」便宜得多:清理的成本是装的时候的几倍,因为那时你已经分不清哪些在起作用。
适用场景
适用:手上候选超过五个、准备一次装进去的人 · 已经装了几十个、想回头清理的人 · 要给团队定「哪些技能进基线」的人。不适用:只有一个明确候选、而且你已经知道它解决什么的人 —— 直接装,不必过尺。
自测 · 5 问
我给每个候选写清的是「它打算改变什么」,而不是「它是什么」
我能指出每个留下技能带来的一条具体信息,是模型自己编不出来的
我区分了「知识包」与「约束」两类技能,并让知识包走文档而不是常驻加载
我知道自己现在装了多少个,并且知道超过一定数量后挑错的概率会上升
我至少扔掉了几个看起来很热门、但两轴都量不出来的技能
怎么上手 · 验证步骤
拿一张纸,把候选技能列成表,只留三列:技能名 / 它带来的具体信息(写不出来就空着)/ 它限定了什么动作(写不出来也空着)。空着的那一列就是它的短板。先只装「两列都写得出来」的那几个,其余的先放着 —— 放一个月,如果你一次都没想起它们,就不用装了。
装完之后过两周,回看这张表:那些当时你写不出「它带来什么具体信息」却还是装了的技能,现在用到了吗?如果一次都没用到,说明当时的判断是对的、执行是错的 —— 下次直接照表执行,别心软。
[C级]bytenote.net 挑技能该有尺子了:两篇 agent 论文的新解法(2026-10-0x · 解读 arXiv:2610.01506 的 MCRI 四维框架与实证规模) [C级]arXiv:2610.01506 MCRI(Zongrui Yang 等 · cs.AI + cs.SE 双栏 · 2026-10-01 · 从信息增益与行为约束两概念构建四维框架,落地为 MCRI-Eval) [C级]编程知识 hqwc.cn AI Agent 自我进化:从工具使用到技能创造(2026-10-09 · 技能库超过约 150 个后语义相似度上升、选择准确率骤降 40~60% 的相变点;技能缓存可减少 80% token 消耗) [C级]startupcorners.com GitHub Trending Recap:AI Agents and Dev Tools(2026-10-07 · 技能类与记忆类仓库的当日热度可作外部信号之一,但不等于对你有用) 同类:装了几十个技能,有几个真在干活? · 技能塞满提示词,它反而找不着该用哪个
继续往下读
同级:装了几十个技能,有几个真在干活? 下一级:技能塞满提示词,它反而找不着该用哪个 随机一篇