通用方法 · 熟练

它说「检查过了」,你凭什么信

让做的人不做复核,让复核的人不知道是谁做的
让 AI 自己检查自己的产出,等于让同一个人在同一个思路里再看一遍 —— 它看到的仍然是「我本来打算做什么」,而不是「我实际做成了什么」。这一页给的是一条结构上的改法:把产出者与复核者拆成两个互不知情的角色,复核者只拿原始材料、任务是试着推翻而不是「看看对不对」,并且每条结论都必须带上能追回来源的痕迹(哪一行 · 哪个文件 · 哪次调用)。判据也随之换掉:不再是「复核者说好」,而是「复核者试图推翻但没成功」。
方法 · 一图看懂
1
先拆角色 — 做的人不复核,复核的人不知道是谁做的,也不看产出过程
2
划出信任边界 — 标清哪些输入来自外部、哪些动作会改变外部事实
3
派隔离的执行者 — 每个区域交给一个只看见该区域、且互不通信的实例
4
逐条交给陌生复核者 — 给它原始材料,任务是证伪,不是复述
5
只收能追回来源的 — 追不回来源的发现一律退回,不进报告
6
把被拒当结构化失败 — 无人值守时,被拦下的动作要进日志,不能算成功
原理 · 为什么有效
AI 的自评与人的自评有同一个毛病:它评的是「我打算做什么」,不是「我实际做成了什么」。同一个上下文里,模型刚走完自己的推理,复核时就会沿用那套假设 —— 于是「检查」退化成「复述」。换成没见过产出过程的实例、并且只给它原始材料,它就必须重新从证据走到结论;而把任务说成「试着推翻」,比说成「看看对不对」更能逼出真实结论 —— 因为「对不对」可以被含糊地肯定,「推翻」只能靠具体证据。
适用场景
适用于:产出物要对外负责的场合 —— 代码改动 · 安全审计 · 对外发布的内容 · 会被别人拿去当依据的报告。也适用于无人值守的自动化:没人盯着的时候,唯一可靠的复核是结构本身。
不适用于:一次性的、自己看看就好的随手问(加一层复核只会让成本翻倍)· 创意与风格类判断(这类没有可证伪的客观结论,硬套会得到「两边都对」的空话)。
自测 · 5 问
这批产出里,「谁做的」和「谁复核的」分别是哪个实例,我说得出来吗?
复核者拿到的是结论,还是能自己走的原始材料?
有没有一条发现是「找不到确切出处」却仍然留在报告里的?
无人值守跑的时候,被拒绝或被拦下的动作去了哪里?
我的通过判据是「复核者也说好」,还是「复核者试图推翻但没成功」?
怎么上手 · 验证步骤
先只挑一件要紧的事试 —— 比如这周要交出去的那份报告或那次改动。第一步不是写提示词,而是把两段工作分开:让一个实例只负责产出,把它的产出连同原始材料一起,交给另一个从没见过这段过程的实例。第二步才是给它任务:不是「检查有没有问题」(它会说「没有」),而是逐条列出你在哪里试图推翻它,以及你引用的原文在哪。
做完之后自己核三样:① 报告里每条结论后面是不是都有一个能点回去的位置 ② 复核者有没有真的提出过至少一条「我认为这条站不住」(一条都提不出,多半是复核得太客气)③ 把同一份产出喂给第二个复核者,结论是否一致 —— 两个都说「没问题」而拿不出证据链,看作未复核。
[C级]cloudflare/security-audit-skill(GitHub 开源 · 先画信任边界 → 派互相隔离的 hunter agent → 每条候选发现交给一个全新的 verifier 去证伪 → 只有带完整来源追溯的才进报告) [C级]alibaba/open-code-review(GitHub 开源 · 文件选择与评论定位交给普通程序逻辑,而不是交给模型) [C级]Anthropic Claude Code 官方变更说明(新增无人值守权限模式:会要求权限提示的动作自动被拒;官方提醒「任务可能跑完但没做成本来要做的事」⇒ 编排层应把被拒的提示当成结构化失败) [C级]quidproquo.cc AI Agent GitHub Digest 2026-09-18(当日趋势项目综述) 同类:Agent 谎报成功了,问题多半不在提示词 · AI 说得头头是道,但你得先问一句:依据呢
继续往下读
同级:Agent 谎报成功了,问题多半不在提示词 下一级:压缩完那一段摘要,你得回头查三样东西 随机一篇