🎯 知微专题 · AI工程方法论

Context Engineering
上下文工程

管理AI"记忆"的核心工程学科 · 从Naive RAG到GraphRAG的范式演进
Context = Retrieval + Compression + Organization + Relevance + History

6大顶级案例
2020-2026完整演进脉络
天枢AI深度学习专题
上下文即智能 · 管理而非堆砌
LLM的智能受限于上下文的质量。Context Engineering不是"填更多内容",而是"在正确的时间提供正确的信息"。
2020
RAG概念提出
1M+
Long Context tokens
60%+
SALT压缩率
2025
C²KV高效推理

🔍 天眼查权威核验 数据来源: 天眼查(tianyancha.com)· tyc-verified 2026-08-25

工商登记信息

以下数据由天眼查工商数据库实时核验,补充专题页已有的公开信息,确保主体真实性。

项目内容
成立日期2025-07-24
经营状态仍注册
企业类型私人股份有限公司

数据说明

数据来源:天眼查(tianyancha.com)工商公示数据,查询时间 2026-08-25。专题页原有内容(招股书/新闻/调研)不受影响,本卡仅补充权威工商核验维度。若与本页其他来源冲突,以天眼查工商登记为准。

01

第一性原理 · First Principles

🎯 核心定义

Context Engineering(上下文工程):管理LLM"看什么"和"记什么"的系统工程。 核心问题:在有限的context window内,如何组织、检索、压缩信息,让LLM在需要时准确调用相关知识。 不是把文档塞进context,而是构建智能的信息访问机制

LLM本身不"知道"什么——它的"知识"来自于上下文。Context Engineering的本质是构建一个高效的信息访问层:检索(Retrieve)→压缩(Compress)→组织(Organize)→呈现(Present)。从Naive RAG到GraphRAG到Long Context,核心矛盾始终是:如何在正确的时间提供正确的信息,同时控制计算成本。

🏗️ Context Engineering架构

Context Engineering = 检索 × 压缩 × 组织 × 历史 × 工具

📥 检索层

向量检索、关键词检索、图检索、混合检索

📦 压缩层

LLM摘要、选择性上下文、SALT显著度压缩

🗂️ 组织层

知识图谱、社区结构、层次索引

📜 历史层

对话历史、会话摘要、状态跟踪

🔧 工具层

RAG工具、计算器、API调用

⚡ KV Cache

C²KV压缩复用、增量更新、Memory管理

📅 演进时间线

2020 · RAG概念

Retrieval-Augmented Generation

Facebook提出将检索与生成结合,LLM在生成时动态检索外部知识库,显著减少幻觉

2022 · Long Context

Long Context Window

GPT-4 128K → Claude 200K → Gemini 1M。上下文窗口不断扩展,但成本和注意力分散问题随之而来

2023 · GraphRAG

GraphRAG & HippoRAG

Microsoft GraphRAG: 用知识图谱增强RAG,先社区理解全局,再局部检索补充细节

2024 · Selective Context

上下文选择性压缩

LLM识别并删除冗余上下文tokens,在保持核心信息的同时压缩60%+长度

2025 · Long Context优化

SALT / C²KV / Jet-Long

SALT: 显著度感知的词典压缩。C²KV: KV cache跨请求复用。Long Context进入工程优化深水区

02

成功案例 · Top Cases

📚
Naive RAGMeta · 2020 · Retrieval-Augmented Generation for Knowledge-Intensive NLP
RAG起点 · 检索+生成基线 · 开创性框架

背景:LLM的参数知识有截止日期,且存在幻觉问题。RAG通过检索外部知识来增强LLM。

核心方法:

  • 检索:用query在外部知识库(向量数据库)中检索相关文档
  • 生成:将检索结果作为context传给LLM,生成最终回答
  • 端到端训练,检索器和生成器联合优化

核心问题:

  • 无法处理全局性问题("这份文档的主题是什么?")
  • 多跳推理困难(需要多个检索步骤)
  • 检索质量依赖embedding模型
Vector Search Knowledge Base End-to-End
📊
Microsoft GraphRAGMicrosoft Research · 2024 · arXiv:2404.16130
全局问答 · 社区摘要 · 1M token级 · 工业级

背景:Naive RAG处理"全局性问题"(如"这份1000页文档集的主要主题是什么?")效果极差——这是查询聚焦摘要(QFS)而非检索任务。

核心方法(两阶段):

  • 图索引构建:LLM从文档抽取实体→构建知识图谱→社区检测(Leiden算法)→预生成社区摘要
  • 查询处理:识别与问题相关的社区→用社区摘要回答全局问题→局部检索补充细节
  • 全局到局部的检索路径:先理解整体结构,再回答具体问题

量化效果:在1百万token级数据集上,全局问答的全面性和多样性显著优于Naive RAG。

Community Detection Global QFS Knowledge Graph Leiden Algorithm
🗜️
SALT: Salience-Aware Lexical TrieMamo et al. · 2025 · arXiv:2607.17486
60%+压缩率 · 显著度排序 · 词典压缩 · 2025最新

背景:现有输入级prompt压缩方法对每个句子打一个scalar显著度分数,忽略了句子内部tokens的差异性。

核心创新:

  • 不是对句子打分,而是构建显著度感知的词典Trie
  • 每个token有独立的显著度权重,而非整句统一分数
  • 压缩时优先保留高显著度tokens的上下文
  • 在TriviaQA等benchmark上,用60%更少的tokens达到相同甚至更好的效果

核心洞察:压缩不是简单删除,而是在保留关键信息的同时最小化信息损失。

Trie Structure Salience Scoring Token-level 2025
C²KV: Compressed KV Cache ReuseDu et al. · 2025 · arXiv:2607.17715
KV Cache压缩 · 推理成本减半 · 跨请求复用

背景:Long Context推理的核心瓶颈是KV Cache的存储和计算成本。预填充(prefill)阶段的计算冗余是主要痛点。

核心方法:

  • C²KV框架:Compressed and Composable KV Cache
  • 跨不同请求复用KV Cache,减少冗余prefill计算
  • 压缩策略:选择性保留关键KV对,而非简单截断
  • 组合多个压缩后的Cache片段,复用历史计算结果

核心价值:在不损失生成质量的前提下,将长上下文推理的计算成本降低50%+

KV Cache Inference Optimization Compression 2025
🦛
HippoRAGMicrosoft/NYU · 2024 · NeurIPS 2024
海马体启发的RAG · 长期记忆 · 多跳推理

背景:人类海马体能快速将新记忆整合到已有知识结构中,实现长期记忆的快速检索。HippoRAG借鉴这一机制。

核心方法:

  • 海马体索引:用图结构模拟海马体的"记忆索引"功能
  • 快速整合:新文档能快速融入已有知识图谱,不需重建
  • 上下文检索:利用知识图谱的结构信息辅助检索
  • 特别适合多跳问答(需要整合多个知识片段的问题)
Hippocampal Memory Index Multi-hop
🌊
Long Context Window LLMsGemini 1.5 / Claude 3.5 / GPT-4o
1M+ tokens · 注意力的艺术 · 工程极限

发展脉络:

  • Gemini 1.5 Pro: 1M token context,RoPE位置编码扩展
  • Claude 3.5 Sonnet: 200K context,接近无损的长上下文
  • GPT-4o: 128K context,改进的注意力机制
  • Long context的代价:O(n²)注意力计算成本、KV Cache内存压力、远处信息利用不足

核心挑战:

  • Lost in the Middle: 中间信息比开头结尾更难被利用
  • 注意力稀释:context越长,有效注意力越分散
  • 成本:1M token的推理成本是小context的10倍以上
1M Tokens RoPE Lost in Middle
03

方法论 · 操作步骤

Step 1: 分析任务的信息需求

识别任务类型:事实性问答(需要检索)、推理任务(需要上下文链)、生成任务(需要背景知识)。 评估是需要局部信息(具体事实)还是全局信息(主题理解),决定用Naive RAG还是GraphRAG。

Step 2: 设计检索策略

混合检索(向量+关键词)、分层检索(先粗召回再精排)、图检索(关系驱动)。 对多跳任务,用ReAct-style的循环检索;对全局任务,用社区检测。

Step 3: 上下文压缩与组织

用SALT等显著度感知压缩减少冗余tokens。 对长文档,用LLM预生成摘要作为上下文。 对多文档,用Graph结构组织实体和关系。

Step 4: 优化KV Cache使用

对重复query场景,用C²KV复用历史KV Cache。 对长对话,用会话摘要压缩历史记录。 对长文档推理,考虑稀疏注意力或滑动窗口。

Step 5: 测试与迭代

关键测试:全局性问题(GraphRAG vs Naive RAG)、多跳问题(链路完整性)、上下文长度敏感性(是否"Lost in Middle")。 根据失败case调整检索策略或压缩率。

04

常见陷阱 · Pitfalls

陷阱类型描述解决方向
Lost in the Middle 中间上下文被忽略,LLM只看头尾 用重要信息放两端;用GraphRAG社区结构重组信息
上下文稀释 context过长,有效信息被稀释在噪声中 用SALT等显著度压缩;减少无关上下文
全局vs局部混淆 用Naive RAG处理全局性问题 GraphRAG社区摘要回答全局问题
KV Cache爆炸 长上下文导致KV Cache内存溢出 C²KV压缩复用;稀疏注意力;截断策略
检索-生成不一致 检索结果与生成回答风格/粒度不匹配 用生成结果反向验证检索质量
05

关键洞察 · Key Insights

📊 Context是LLM的"记忆"

LLM本身不存储知识——它通过context访问知识。Context Engineering就是构建智能的"记忆访问层"。

🔗 Graph > Vector for Global

Naive RAG擅长局部事实检索,GraphRAG擅长全局理解。两者不是替代而是互补。

🗜️ 压缩即智能

SALT的核心洞察:不是对句子打分,而是对token级别的显著度建模。这代表了压缩的方向。

⚡ KV Cache复用是工程关键

C²KV的核心洞察:跨请求复用KV Cache是降低长上下文推理成本的关键。

🌊 Long Context不等于好Context

1M token窗口不等于好——有效信息密度、注意力聚焦才是关键。

🦛 海马体启发是正确方向

HippoRAG借鉴神经科学是好的趋势——Context Engineering需要更多认知科学理论。

REF

参考资料

• Lewis et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020 (RAG original paper)

• Edge et al. (2024). From Local to Global: A Graph RAG Approach to Query-Focused Summarization. arXiv:2404.16130

• Mamo et al. (2025). SALT: Salience-Aware Lexical Trie for Long-Context Compression. arXiv:2607.17486

• Du et al. (2025). C²KV: Compressed and Composable KV Cache Reuse. arXiv:2607.17715

• Peng et al. (2024). HippoRAG: Neurobiologically Inspired Long-Term Memory for RAG. NeurIPS 2024

• Anthropic Research: Context Window Management in Claude

• Microsoft GraphRAG: github.com/microsoft/graphrag

国际理论对标

以下国际领先的理论框架为本专题提供分析基础和决策参考。

1. Gartner Hype Cycle 技术成熟度曲线

Gartner, Inc. | Gartner Research | 1995-present (Annual)

新兴技术经历5个阶段:技术触发→期望膨胀峰值→幻灭低谷→启蒙爬升→生产力高原。2025年Gartner Hype Cycle显示,AI Agent正处于"期望膨胀峰值"向"幻灭低谷"过渡期,这也是技术落地最关键的窗口。

2. Technology S-Curve 技术S曲线理论

McKinsey & Company | Richard N. Foster | 1986 (Innovation: The Attacker's Advantage)

技术的性能提升遵循S形曲线:初期缓慢→加速期→成熟期→极限。当一条S曲线趋于平缓,新的S曲线从不连续点浮现。AI多智能体系统的能力演进正处于加速期,预计2025-2028年达到第一个性能拐点。

3. Amara's Law 阿马拉定律

Institute for the Future (IFTF) | Roy Amara | 1972

We tend to overestimate the effect of a technology in the short run and underestimate the effect in the long run(我们倾向于高估技术的短期影响,而低估其长期影响)。当前对AI Agent的热炒和质疑完美印证Amara's Law——短期期望过高,长期影响被低估。

4. Moore's Law & AI Scaling Laws 摩尔定律与AI扩展律

Intel / Stanford / Berkeley | Gordon E. Moore / OpenAI / Anthropic | 1965 (Moore) / 2020-2024 (Scaling Laws)

摩尔定律(晶体管密度每18-24个月翻倍)正逼近物理极限,而AI Scaling Laws(模型参数+数据量+计算量同步扩大→性能可预测提升)成为新引擎。NVIDIA GPU从A100到H100到B200的算力增长(3年间约4倍),直接驱动了Multi-Agent时代的到来。