方法论
上下文有限,
AI为什么越长越"赶"
不是模型不行——是上下文长了会退化。研究实测:标称200K的窗口,50K就开始退化;越接近上限,AI越倾向"差不多就行"。难点不是解决,是第一次遇到时不知道它叫"上下文腐烂",只能干等它崩。
1
认识退化:长度是收益递减的资源 — Chroma评估18个模型:性能随输入增长持续下降,远没到上限就退化。U型注意力:开头结尾记得好,中间被忽略,从开头移到中间准确率掉30+个百分点
2
40-60%窗口线:别等满了才管 — Claude Code实践:40-60%窗口使用时就出现质量下降。主动管理触发线在这里,不是100%。每轮任务分配预算,满之前主动淘汰低价值内容
3
四策略调度:写/选/缩/隔 — 写出去(存外部)、选进来(只拉需要的,检索优于全读)、缩掉(压缩优先于摘要)、隔开(子任务独立窗口)。预算管理就是四策略的调度
4
Select的量化收益:别全量加载 — RAG-MCP实测:语义检索工具描述,工具选择准确率14%→43%,token减半。全量加载看似稳妥,其实是最贵的选择
# token预算:在塞满前主动管理
## 一、认识退化
- 上下文越长,质量越降(不是到上限才降)
- 40-60%窗口时就该主动管理,别等100%
## 二、四策略调度
1. 写(Write):中间结果存外部,不占窗口
2. 选(Select):只拉当前需要的,检索优于全读
3. 缩(Compress):历史超阈值压缩成摘要(压缩优先,摘要兜底)
4. 隔(Isolate):子任务独立窗口,只传摘要
## 三、主动压缩时机
- 64%:记忆同步(把重要状态写到外部)
- 80%:优雅交接(开新会话)
## 四、阶段化大任务
- 研究阶段 → 产出一份研究文档
- 规划阶段 → 开新窗口,只放研究文档+问题定义
- 实现阶段 → 再开新窗口,只放计划
## 验证
① 你现在这个会话用了多少?有没有到40-60%?② 有没有一次性塞了大量资料其实只需要一小部分?③ 长任务有没有分阶段开新窗口?