通用方法 · 深入

这件活值得让 agent 一直替你盯着吗?

对话结束之后它还在干,才是 agent
最省事的判据只有一句:如果你能用一句提示词加一个回答搞定这件事,你大概不需要 agent。「帮我找张便宜机票」是对话;「盯着这条航线,掉到 300 以下就告诉我」才是 agent 的活 —— 区别不在难度,在这件事要不要在对话结束之后继续发生。按这条线筛,值得交出去的通常是一份「持续维护的清单」:你交给它的任务 · 预约 · 采购 · 跑腿,按紧急度排好,每天告诉你今天该做什么 · 本周该做什么 · 之后该做什么。反面同样要划清:密码与两步验证码 · 不受限制地动钱 · 医疗的最终决定 · 独立签合同 · 以你的名义公开发布 —— 这五样不交;采购 · 发消息 · 有后果的账户变更,必须先有一个人的审批步。这一页把「agent 活」拆成四道门,并给一张可抄的交接边界表。
方法 · 一图看懂
1
先问它要不要「继续」 — 一句提示词一个回答能搞定 ⇒ 那是对话,不是 agent 活
2
把活写成一份持续维护的清单 — 能长期维护的清单,才是 agent 最稳的落点
3
给每一步配「怎么检查它做完了」 — 缺了这一条,任务分解只是愿望清单
4
划出不可交的五样 — 凭证 · 资金 · 医疗决定 · 签约 · 以你名义公开发布
5
在高后果动作前插一个人的审批步 — 采购 · 发消息 · 账户变更,都要在动作前停一下
四道门:从「想做」到「能交」
第一道门 —— 它要不要继续。把这件事说成一句提示词加一个回答就能结束的,就是对话活;需要它在你不看着的时候继续推进的,才是 agent 活。这一道挡掉的是最多的一类误判:很多人把「一次做完」的任务交给了 agent,结果只是在给一个更慢的对话框。
第二道门 —— 触发条件说不说得清。「盯着这条航线,低于 300 就告诉我」比「帮我留意便宜机票」好,差别在于前者的触发条件是可判断的。「便宜」不可判断,「低于 300」可以。说不清触发条件 ⇒ 它只能不停地打扰你,或者干脆不动。
第三道门 —— 它有没有可检查的产出。让它在每一步都给出「需要的输入 · 期望的输出 · 怎么检查它真做完了」。缺第三样,任务分解就退化成愿望清单,你只能靠它自己说「做完了」 —— 而这一句恰恰是最不可信的。
第四道门 —— 失败要花多少钱。同一个动作,失败可逆和失败不可逆是两类活:发一条草稿可逆,发一条公开帖不可逆;把报价整理成表可逆,按报价下单不可逆。第四道门直接决定要不要加审批步。
值得交出去的活,长什么样
最稳的一类是「持续维护的清单」:你不断往里扔事(任务 · 预约 · 采购 · 跑腿),它按紧急度排好,每天只给你三个时间尺度的输出 —— 今天要做什么 · 本周要做什么 · 之后再说。它的价值不在聪明,在「不用你每天在脑子里重建那张表」。
第二类是盯变化:价格 · 余量 · 状态 · 公告,只要「变化本身」是可判断的,这件事就适合交出去。
第三类是归档与整理:把散落的材料按你给的规则归位,产出是一份清单而不是一个结论 —— 清单可检查,结论要你判断。
共同点:这三类都是「替你保持一件事的状态」,而不是「替你做一次决定」。凡是需要判断「该不该」的事,交给它的只能是准备材料,不是结论。
不可交的五样,与一条通用补丁
不交的五样:① 密码与两步验证码 ② 不受限制地动钱 ③ 医疗的最终决定 ④ 独立签合同或提交法律文件 ⑤ 以你的名义公开发布。
一条通用补丁:对采购 · 发消息 · 有后果的账户变更,在动作发生之前插一个人的审批步 —— 不是事后通知,是事前点头。顺序反了就等于没有这道闸。
这条补丁之所以通用,是因为它不依赖你对模型能力的判断:只要动作不可逆、且有对外影响,就先停一下。它同时也保护了 agent 生态里最容易被忽略的那件事 —— 当一件事被自动化之后,责任并没有一起被自动化,它还是在你身上。
原理 · 为什么有效
把活交给 agent 真正的边界不在能力,而在「可回滚性」。可回滚的动作可以放宽,不可回滚的动作必须先停一下 —— 这条线比「难不难」「准不准」都更稳,因为它不随模型升级而移动:模型变强只会让同一件事做得更好,不会让一次公开发布变得可撤销。第二条原理是「状态优于结论」:agent 最擅长的是持续保持一件事的状态(清单 · 监控 · 归档),最不擅长的是替你做一次判断;前者错了可以改,后者错了要你承担。第三条是「触发条件要能被判断」:说不清触发条件的任务,交出去只会变成两种结果 —— 要么它频繁打扰你,要么它什么都不做,而这两种都会让你迅速不再看它。最后一条是「审计成本也算成本」:如果为了用上它,你每天要花十分钟核对它的输出,那这件事并没有真的交出去,只是换了个地方占用你。
适用场景
适用:已经在用 AI 助手、想把它推到「自己会跑」这一步的人 · 手上有一堆反复出现但要盯着的小事的人 · 在团队里要给 agent 划权限边界的人 · 反复装了一堆自动化但用不满一周的人。
⛔ 不适用:只想让它把一次性的活干完 —— 那属于提示词工程,把简单事写成 agent 只会更慢。
⚠️ 前提:愿意先把「不可回滚的动作」列出来。不愿意列,第四道门就形同虚设。
自测 · 6 问
这件事我用一句提示词加一个回答能不能搞定?能,就不用 agent。
它的触发条件是可判断的吗(低于某个数 / 超过某个时间),还是我自己的感觉?
它每一步的产出,我怎么检查「真做完了」?
这件事失败一次,我要花多少钱或多少时间收拾?
有没有哪一步是不可回滚的?那一步前面有人点头吗?
我每天花在核对它输出上的时间,比我自己做这件事省了多少?
怎么上手 · 验证步骤
先只做一件事:把你手上反复出现的小事列成一张清单,然后只挑一件交出去 —— 挑的标准 = 它需要继续(不是一次做完)· 触发条件可判断 · 产出可检查 · 失败可回滚。一次只交一件,跑满一周,再回头看两件事:它有没有在该动的时候动、你花在核对上的时间是不是真的变少了。两个答案都是「是」,再交第二件;否则先把这一件收回来,别加量。
自检动作:给交出去的那一件写一句「我这一周在它身上花了几分钟,在做它之前我花了几分钟」。两个数都写得出,才说明这件事真的被交出去了;只有「感觉省了一些」,说明你还没在对的尺度上记账。
[C级]Tom's Guide《7 boring jobs you can hand to an AI agent tonight》(最简判据:一句提示词加一个回答能搞定就不需要 agent · 一件活要在对话结束后继续才叫 agent 活 · 不该交出去的五样 · 采购与消息类必须留人的审批步) [C级]编程知识《2026 年最实用的 10 个 AI Prompt 模板:覆盖工作、学习、创作》(模板库化写法与「先测后学」的参照) [C级]Chat Smith《50 AI Trending Prompts You Should Try Right Now》(任务分解要为每一步给出输入 / 输出 / 怎么检查) 同类:这个活该不该自动化,四个问题过一遍 · 哪些活该交给AI?五步委派审计,把时间还给自己 · 让 agent 去挣钱,先看这份账
继续往下读
同级:这个活该不该自动化,四个问题过一遍 随机一篇