← 首页
方法论 · 进阶档
token预算
工作流 →
方法论

上下文有限,
AI为什么越长越"赶"

不是模型不行——是上下文长了会退化。研究实测:标称200K的窗口,50K就开始退化;越接近上限,AI越倾向"差不多就行"。难点不是解决,是第一次遇到时不知道它叫"上下文腐烂",只能干等它崩。
1
认识退化:长度是收益递减的资源 — Chroma评估18个模型:性能随输入增长持续下降,远没到上限就退化。U型注意力:开头结尾记得好,中间被忽略,从开头移到中间准确率掉30+个百分点
2
40-60%窗口线:别等满了才管 — Claude Code实践:40-60%窗口使用时就出现质量下降。主动管理触发线在这里,不是100%。每轮任务分配预算,满之前主动淘汰低价值内容
3
四策略调度:写/选/缩/隔 — 写出去(存外部)、选进来(只拉需要的,检索优于全读)、缩掉(压缩优先于摘要)、隔开(子任务独立窗口)。预算管理就是四策略的调度
4
Select的量化收益:别全量加载 — RAG-MCP实测:语义检索工具描述,工具选择准确率14%→43%,token减半。全量加载看似稳妥,其实是最贵的选择
ai-token-budget.md
# token预算:在塞满前主动管理 ## 一、认识退化 - 上下文越长,质量越降(不是到上限才降) - 40-60%窗口时就该主动管理,别等100% ## 二、四策略调度 1. 写(Write):中间结果存外部,不占窗口 2. 选(Select):只拉当前需要的,检索优于全读 3. 缩(Compress):历史超阈值压缩成摘要(压缩优先,摘要兜底) 4. 隔(Isolate):子任务独立窗口,只传摘要 ## 三、主动压缩时机 - 64%:记忆同步(把重要状态写到外部) - 80%:优雅交接(开新会话) ## 四、阶段化大任务 - 研究阶段 → 产出一份研究文档 - 规划阶段 → 开新窗口,只放研究文档+问题定义 - 实现阶段 → 再开新窗口,只放计划 ## 验证 ① 你现在这个会话用了多少?有没有到40-60%?② 有没有一次性塞了大量资料其实只需要一小部分?③ 长任务有没有分阶段开新窗口?
下载 .md

工具与参考

思路来源:Chroma 18模型研究(Lost in the Middle)· Claude Code 上下文管理(/usage /compact)· LangChain Context Engineering 四策略 · RAG-MCP 论文(工具选择14%→43%)

同类问题:上下文压缩术 · 突破LLM记忆限制 · 上下文组装清单