技术 · 深入

让它想清楚的那部分,别拿去做决定

706k 参数打赢了 83.6% 的托管基线
大多数 agent 慢和贵,不是因为想得不够,是因为让同一个大模型把「想」和「判」都干了。2026 年 9 月出现的两条实测数据指向同一个做法:把定义清晰的窄决策切出去,交给一个专门的小模型打分,而不是让通用模型逐 token 生成一个答案。这篇讲的不是「换个小模型省钱」,而是「按决策的清晰度给模型分档」——哪一类判断可以切出去、切出去之后补偿什么、以及切错了会在哪里暴露。
方法 · 一图看懂
1
先给 agent 的每一步决策贴标签 —
2
把「选项有限 + 判据明确」的切出去 —
3
给切出去的那一步单独定验收线 —
4
用小模型做拦截,大模型做兜底 —
一 · 什么算「窄决策」
三个条件同时成立才切:选项有限、判据能写出来、结果不需要解释。① 选项有限 —— 输出落在一个小集合里(填值 / 勾选 / 点击 / 跳过;通过 / 拒绝 / 转人工)② 判据能写出来 —— 你能用一句话说清「凭什么这么判」,而不是「感觉应该这样」③ 结果不需要解释 —— 使用者不需要一段说明文字,只需要那个决定。
反例(⛔ 不要切):「这段代码写得好不好」「这封邮件该怎么回」「这个 bug 在哪」—— 这些都需要先想清再输出,属于大模型的活。
二 · 两条实测数据说明了什么
① 表单填值:一个 706k 参数 / 2.8MB 的专用模型,只判断表单里每个字段该填值、勾选、点击还是跳过 —— 表单整体决策准确率 99.7%,托管基线 83.6%;本地推理 7~9ms,含网络的托管 API 是 260~280ms。同一批决策上,窄模型既准又快了一个量级。
② 工具调用 / 抽取 / 嵌入:一个 8~29MB、2bit 量化的模型跑在手机 / 穿戴 / 车机 / 单片机上,做法是「先决定模型只干三件事,用对话能力换这三件事上的精度」—— 而不是把通用模型压小。
⇒ 两条数据合起来的结论不是「小模型更好」,而是「窄决策上,专用比通用划算」。
三 · 切出去之后,补偿什么
切出去一步,就要补一层。三样缺一不可:
① 兜底 —— 窄模型拿不准(打分接近 / 输出越界)时回退给大模型,⛔ 不要让它硬判;
② 留痕 —— 每个决策记下「输入特征 → 输出 → 是否回退」,否则出了错你只知道结果不对,不知道是哪一层错;
③ 单点验收线 —— 给这一步单独定一条可量化的线(准确率 / 延迟 / 回退率),⛔ 不要用整条流水线的成功率来评价它(那会把上游的错误算到它头上)。
⚠️ 「相关」不等于「为真」这条同样适用:窄模型判的是「这个字段像什么」,不是「这个值对不对」。真正拥有事实的是你的业务系统 —— 关键字段的最终值仍要从那里取。
原理 · 为什么有效
为什么按「决策清晰度」分档比按「模型大小」分档更有效:让通用大模型处理窄决策,它必须先把任务理解成一个生成问题,再逐 token 输出 —— 这个过程里它带着对话能力、常识、风格偏好,而这些在一个「四选一」的判断上全是噪声。窄模型反过来做:它不生成,它给候选打分。省掉的不是参数量,是「把判断翻译成生成」这一步。⇒ 所以收益不只在成本与延迟,还在稳定性:选项有限 ⇒ 输出不可能跑偏成一段散文。
适用场景
适合:已经在跑多步 agent、且能观察到自己流水线里存在大量「四选一 / 通过与否」类判断的场景(表单填写 · 工单分派 · 结果路由 · 报文抽取 · 检索重排)。
不适合:① 还只有一步问答、没有多步流水线的(切无可切)② 判据本身还说不清的(先把判据写出来,再谈切)③ 决策后果很重、需要解释给用户看的(合规审批类请留在大模型 + 人工)。
成本上要诚实:切出去会多一层运维(多一个模型要部署、要监控、要定期对账),单次决策省下的时间要足够大到抵得过这一层,否则不划算。
自测 · 6 问
我能列出 agent 里至少三步「选项有限 + 判据明确」的决策吗?
这步决策的判据,我能用一句话写出来吗?
我给它定了单独的验收线,还是混在整条流水线里看?
它拿不准的时候,回退路径是什么?
关键字段的最终值,我是从窄模型取,还是从业务系统取?
我算过这层多出来的运维成本,抵得过省下的延迟吗?
怎么上手 · 验证步骤
不要一上来就全切,按这个顺序试。① 先记账不做改造:让现在的 agent 完整跑一周,把每一步的耗时与失败原因记下来 —— 你会先发现「哪一步最慢」和「哪一步最容易错」往往不是同一步 ② 从最慢且判据最清楚的那一步切 ③ 切的时候保留原来的大模型路径(作为兜底与对照),并行跑一段 ④ 对照期结束时同时看三个数:准确率有没有掉、延迟降了多少、回退率是多少 —— 回退率如果长期高于三成,说明这一步的判据还没写清,回去改判据而不是换模型。
三条都答得上才算做完:① 我能说出这一步的选项集合一共几个 ② 我能说出回退率,以及回退触发时的具体条件 ③ 我能在不看日志的情况下说清「这一步错了会先在哪里表现出来」。
⚠️ 另外一条容易被忽略:如果切完之后「整条流水线的成功率」没变但账单降了,这是成功;如果成功率略降而账单大降,这不叫成功 —— 先回去看是哪一类决策被切错了。
[C级]quidproquo.cc · AI Agent GitHub Digest 2026-09-21(引 trycua/cua 团队的 CUA-S1-FORMS 自测数据) [C级]GitHub · cactus-compute/needle(8-29MB 二比特量化模型 · 只做工具调用 / 抽取 / 嵌入三件事) [C级]pydantic-ai v2.46.0 Release Notes(TypeSafeModel 允许小模型直接填工具参数 · 跳过整次 LLM 调用) [C级]HackerNoon · AI Agents Don't Need More Memory. They Need Better State Management.(「相关」不等于「为真」) 同类:让 AI 操作电脑,别让它找图 · 多 Agent 不是升级:先看这七个编排模式该不该用
继续往下读
同级:多 Agent 不是升级:先看这七个编排模式该不该用 随机一篇