通用方法 · 熟练
每一步都批了,为什么结果还是错的?
批的是动作,不是方向
现在给 AI 加的护栏几乎都长在同一层:这一步允不允许。隔离的执行环境、分开的凭据、敏感动作要你点头 —— 它们只回答「能不能做」,不回答「为什么选了这一步」。最典型的场景是一个完全在预算内、每一笔都被授权的行程,被排成高密度转场加多次换酒店:每一步都合规,结果和「深度放松」这个原始目标正好相反。这一页加的是另一层:在授权之外做一次意图校验 —— 开工前把目标写成可判的条件,长任务每完成一段回头对一次,记忆里存下来的偏好标注「只对哪类任务成立」。动作审批不等于决策审批 —— 这一句就是整页的入口。
方法 · 一图看懂
1
先写「完成长什么样」 — 把目标写成能判真假的条件,而不是「高效」「舒服」这类形容词
2
把授权分两层 — 单个动作的许可与整条路线的许可分开给,⛔ 别用前者代替后者
3
设中段校验点 — 长任务每完成一段,拿原始意图回头对一次,而不是等收尾
4
记忆带适用窗口 — 每条偏好标注「这条对哪类任务成立、什么时候失效」
5
先留退路再动手 — 破坏性动作之前先有回退点,动作才真正可逆
原理 · 为什么有效
把活交出去之后,失败有两种,而护栏只防住了其中一种。第一种是「做了不该做的」 —— 它会被审批闸、白名单、凭据隔离挡住,也是现在几乎所有治理工具在解决的问题。第二种是「每步都没错,合起来跑偏了」 —— 它没有任何一个动作可以被拦下来,因为你不批它它就不动;你一放行,它就把整条规划走完了。第二种失败之所以抓不住,是因为被检查的对象错了:审批检查的是「动作」,而失败发生在「轨迹」上。轨迹是动作的序列,它的正确性只能在两个地方判:开工时(目标写没写清)与收尾后(结果对不对得上)。中间每一段单独看都合理,累积起来却可能偏离 —— 就像一串各自成立的加法可以得出一个错的总数。解法不是加更多审批点,而是在审批之外补两次「对意图」:一次在开工前把意图落成条件,一次在中段与收尾拿结果回头比。前者让 agent 有可优化对象,后者让偏航在还能回头的时候被发现。
适用场景
适用:把多步任务整包交给 AI 的人 —— 让它做一份多日行程、一次批量数据处理、一轮跨文件的改造、一趟自动化的采购。尤其是那些「每一步都能看懂、合起来才发现不对」的场景。
⛔ 不适用:只让 AI 做一步就收手的用法(那种情形下动作本身就等于决策,审批闸已经够用)。
⚠️ 前提:你愿意在开工前花五分钟把目标写清 —— 这一步不做,后面两次校验都没有对照物。
自测 · 6 问
我能把这次的目标写成一句能判真假的话吗(而不是「做得高效一点」)?
这条任务里,哪些动作是「做了也回不来」的?我为它留了退路吗?
如果 AI 每一步都做对、但整体跑偏,我会在第几步发现?我现在有这个检查点吗?
我有没有把某次任务里的偏好(效率优先 / 简洁优先),写成了好像对谁都成立的通用规则?
收尾时我是只看「它做完了吗」,还是会拿原始目标回头对一次?
我批的是「这一步可以做」,还是「这条路可以走」—— 这两件事我分开了吗?
怎么上手 · 验证步骤
第一次别上复杂流程。只做两件事:① 在开工前写一句可判的完成条件(例:不是「行程放松」,而是「每天移动不超过两次、不换酒店、有一整个下午在户外」)② 在收尾后,拿这句条件逐条打勾,把没对上的地方写下来。只做一轮就能看出差别:多数跑偏在第一步就已经埋下了 —— 你会发现自己当时写的是形容词。
自检动作:把这次交给 AI 的任务,用一句话说清「做完的样子」。如果这句话里出现了「高效」「舒服」「专业」「有感」这类词,说明它不可判 —— 把它换成能打勾的条件,再重跑一次同样的任务,比较两次输出的差距。