通用方法 · 熟练

每一步都对,为什么合起来还是错?

单看每一步都合法、每个 agent 的局部判断都成立,可拼起来整体就是错的 —— 这一类失效不是「模型不够聪明」,而是「状态没被谁看全」。本页把它拆成两条可查的线索:一是信息缺失(两种世界在你眼里长得一模一样,却要求完全不同的动作 —— 这时候再怎么拆分角色、再怎么加推理都不保证对,除非往上下文里补进能区分它们的那几个比特);二是信息完整时也会错(两两之间合法的转换闭成环后自相矛盾 · 各方都在合法消耗、总账却超了预算)。对应的动作只有两处:给每一格写明「必须包含哪些区分信息」(上下文工程),再给外围写明「谁来维护与校验什么」(管控器)。
方法 · 一图看懂
1
先分清两种错 — 是「某一步做错了」,还是「每一步都对、合起来不对」;后者换更强的模型也救不回来
2
给窗口补区分信息 — 若两种可能世界在你观测里完全一样、却要执行不同动作,就必须往上下文里补能区分它们的信息
3
查闭环自不自洽 — 两两之间合法且互逆的转换,闭成环后可能矛盾;各角色都在合法消耗,总账可能超预算
4
两套规范分开写 — 上下文工程管「每格的上下文里必须有什么」;管控器管「外围要维护、校验什么」
原理 · 为什么有效
这条方法的有效性来自一个可证的边界,而不是经验之谈:策略只有在「所有可能世界下都存在同一个合法动作」时,才能仅凭观测保证有效。也就是说,两种世界如果在你看到的观测里表象完全一致、却要求完全不同的动作,那么无论怎么推理、怎么拆角色、怎么通信、怎么随机采样,都不能保证做对。落差是可量化的:k 个无法区分的世界下,最优随机化策略的成功率上界是 1/k;而每补进 1 比特区分信息,上界抬到 1/⌈k/2^b⌉。这给了上下文一个明确的职责 —— 它必须携带「能把世界分开」的那几个比特。反面同样成立:把全部信息塞进窗口并不划算(求最小充分上下文本身是 NP‑Hard),所以要的是有界检索(每次只取相关子图,让检索量不随历史增长),而不是把历史全带上。第二类失效更值得留意:它发生在信息其实完整的时候 —— 各方都在执行合法动作,但「合法」是对各自的视角而言,闭环之后不再自洽。
适用场景
适用范围比「多 agent」宽得多:① 任何把一个任务拆给多个角色 / 多个会话 / 多个子代理的场景(各自都完成了自己那格,合起来结果不对);② 人在环里的审批链(每一步都批了,结果仍是错的 —— 因为没人看全状态);③ 上下文会被压缩、会被改写、会被别的工具改掉来源的长任务(观察还在窗口里,来源已经变了);④ 有共享预算 / 共享配额的多方协作(各自都在合法消耗,总账超支)。⛔ 不适用于单步问答、也不适用于「一步错了就改那一步」这种能定位到具体步骤的错 —— 那些是执行错,不是状态错。
自测 · 5 问
这个错,我能不能指到某一步上?指不出,就按「状态不一致」查,别再调提示词
两种可能的解释,在我的观测里是不是长得一样?若是,我有没有把区分它们的信息明确写进上下文
每个角色的上下文里,有没有写明「它必须知道、且只有它能提供」的那几件事
把各方的合法动作连起来看,有没有一处总量对不上(预算 / 配额 / 库存 / 时间)
我观测到的事实,来源在哪里?来源这段时间有没有被谁改过
怎么上手 · 验证步骤
先做一次「合起来看」的复盘:把最近一次结果不对的过程摊开,逐行标出每一步是谁做的、依据什么信息。然后过两问:① 这一步的依据,是它只能看到的局部,还是全局?② 有没有两步之间「两两都对、连起来不对」?接着按两种错分流:缺区分信息 ⇒ 往对应角色的上下文里补「能分开两种世界」的那几项(通常就是几条明确的事实、ID 或状态值);闭环不自洽 ⇒ 给共享资源做一本总账,让每一方的消耗都先记进去再执行。最后把结论落到两处:上下文里写「这一格必须包含什么」、外围写「谁来校验总量与状态」。
改完之后用同一条链路重跑一遍,且这次故意制造一次来源变化(改掉某个文件 / 撤回某条状态),看它会不会拿旧观察当现状。判据:① 结论里不再出现「我以为是 X」(X 是已被改掉的值)② 共享资源的总量在任何一步之后都不超③ 你把两方的话拼起来,环是自洽的。三条里只要有一条不过,就说明这轮只补了提示词、没补状态。
[C级]arXiv 2610.02036 多智能体协作的局部到全局语义基础(观测混淆不可行性定理 · 两套规范:上下文工程 + agent 管控器) [C级]arXiv 2610.05281 When Agent Context Goes Stale(Concord 上下文一致性框架 · 观察绑源与过期处置 · 少用 46.4% token) [C级]arXiv 2610.02687 Decoupling Memory from Context(GraphMemory · 记忆构建 token 少约 81~85%) [C级]尧图资讯 · arXiv:2610.02036v1 摘译(2026-10-01 · 全局一致性作为独立失效模式的首次归纳) 同类:每一步都批了,为什么结果还是错的? · 它说「检查过了」,你凭什么信
继续往下读
同级:每一步都批了,为什么结果还是错的? 下一级:两个 agent 各自都对,合起来却撞车 随机一篇