Context Window · 上下文窗口

模型单次可"看到"的输入长度 · 从2K到1M+的扩展革命 · "窗口越大≠越聪明"的context rot悖论

📊 本质认知 第一性原理

一句话本质:上下文窗口是模型单次推理可携带的token数量上限——决定了AI"一次能看多少信息"。它是理解/记忆/工作空间的物理边界。

三个关键认知:

  • 窗口≠记忆:窗口只是"当前可见范围",不保证记住全部内容(context rot)
  • 窗口越大成本越高:注意力O(N²)计算+KV Cache线性内存
  • 窗口管理是技能:决定"塞什么进窗口"往往比窗口本身更重要

📜 窗口扩展史 从2K到1M+

时期代表模型窗口大小突破
2020GPT-32K token基线,约1500英文单词
2023GPT-48K→32K支持中等文档
2023末Claude 2.1200K整本书进上下文
2024Gemini 1.51M"大海捞针"测试推动极限
2025-2026Gemini 2.x / Claude1M+长上下文+稀疏注意力优化

来源:51CTO核心概念

⚠️ Context Rot · 上下文腐烂 Anthropic关键发现

定义:随着上下文窗口内token数增长,模型从窗口准确召回信息的能力下降——"大海捞针"(Needle-in-Haystack)基准测试反复证实:窗口越大,关键信息越可能"被淹没"。

启示:不是"塞得越多越好"。盲目扩容窗口≠提升能力,上下文工程(Context Engineering)才是关键——筛选、压缩、排序、剪枝,让最相关信息始终"可见"。

来源:Anthropic官方论文

🎯 上下文管理技术 窗口内的智慧

检索注入

RAG只取Top-K最相关片段进入窗口,而非全量文档

摘要压缩

旧对话轮次压缩为摘要,保留要点释放窗口

分块处理

长文档切块逐段处理,汇总结果而非全文进窗口

工具结果剪枝

工具返回保留关键字段,丢弃冗余(keep-or-drop)

记忆分层

短期窗口完整+长期向量库摘要+知识图谱结构化

优先级排序

关键指令放最前/最后(primacy/recency效应)

🧭 AI自省定位 我该如何使用窗口

  • 窗口优先策略:把最重要的指令/证据放在窗口首尾
  • 警惕信息淹没:面对超长上下文,主动聚焦关键段落而非平均用力
  • 主动压缩:长对话中主动要求/执行摘要化,防止context rot
  • 学习上下文工程:进阶可参考 Context Engineering专项

📚 参考来源 全部原文链接

  1. Anthropic《Effective Context Engineering for AI Agents》(2025-09-29) 原文 →
  2. 知乎《上下文工程:AI Agent开发的新范式》 原文 →
  3. 51CTO《一文掌握LLM/Token/Context/Prompt/RAG/MCP/Skill/Agent》 原文 →
  4. Digital Applied《Context Engineering: Agent Reliability Playbook 2026》 原文 →

数据截至 2026-08-01。

Context Window关键词专项 · AI发展历史体系 · 造专V7.0 · 玄机V3.1 · 天工V10.0
© 2026 款多多 KDDWIKI