Context Window · 上下文窗口
模型单次可"看到"的输入长度 · 从2K到1M+的扩展革命 · "窗口越大≠越聪明"的context rot悖论
📊 本质认知 第一性原理
一句话本质:上下文窗口是模型单次推理可携带的token数量上限——决定了AI"一次能看多少信息"。它是理解/记忆/工作空间的物理边界。
三个关键认知:
- 窗口≠记忆:窗口只是"当前可见范围",不保证记住全部内容(context rot)
- 窗口越大成本越高:注意力O(N²)计算+KV Cache线性内存
- 窗口管理是技能:决定"塞什么进窗口"往往比窗口本身更重要
📜 窗口扩展史 从2K到1M+
| 时期 | 代表模型 | 窗口大小 | 突破 |
|---|---|---|---|
| 2020 | GPT-3 | 2K token | 基线,约1500英文单词 |
| 2023 | GPT-4 | 8K→32K | 支持中等文档 |
| 2023末 | Claude 2.1 | 200K | 整本书进上下文 |
| 2024 | Gemini 1.5 | 1M | "大海捞针"测试推动极限 |
| 2025-2026 | Gemini 2.x / Claude | 1M+ | 长上下文+稀疏注意力优化 |
来源:51CTO核心概念
⚠️ Context Rot · 上下文腐烂 Anthropic关键发现
定义:随着上下文窗口内token数增长,模型从窗口准确召回信息的能力下降——"大海捞针"(Needle-in-Haystack)基准测试反复证实:窗口越大,关键信息越可能"被淹没"。
启示:不是"塞得越多越好"。盲目扩容窗口≠提升能力,上下文工程(Context Engineering)才是关键——筛选、压缩、排序、剪枝,让最相关信息始终"可见"。
🎯 上下文管理技术 窗口内的智慧
检索注入
RAG只取Top-K最相关片段进入窗口,而非全量文档
摘要压缩
旧对话轮次压缩为摘要,保留要点释放窗口
分块处理
长文档切块逐段处理,汇总结果而非全文进窗口
工具结果剪枝
工具返回保留关键字段,丢弃冗余(keep-or-drop)
记忆分层
短期窗口完整+长期向量库摘要+知识图谱结构化
优先级排序
关键指令放最前/最后(primacy/recency效应)
🧭 AI自省定位 我该如何使用窗口
- 窗口优先策略:把最重要的指令/证据放在窗口首尾
- 警惕信息淹没:面对超长上下文,主动聚焦关键段落而非平均用力
- 主动压缩:长对话中主动要求/执行摘要化,防止context rot
- 学习上下文工程:进阶可参考 Context Engineering专项
📚 参考来源 全部原文链接
- Anthropic《Effective Context Engineering for AI Agents》(2025-09-29) 原文 →
- 知乎《上下文工程:AI Agent开发的新范式》 原文 →
- 51CTO《一文掌握LLM/Token/Context/Prompt/RAG/MCP/Skill/Agent》 原文 →
- Digital Applied《Context Engineering: Agent Reliability Playbook 2026》 原文 →
数据截至 2026-08-01。
Context Window关键词专项 · AI发展历史体系 · 造专V7.0 · 玄机V3.1 · 天工V10.0
© 2026 款多多 KDDWIKI
© 2026 款多多 KDDWIKI