管理AI"记忆"的核心工程学科 · 从Naive RAG到GraphRAG的范式演进
Context = Retrieval + Compression + Organization + Relevance + History
以下数据由天眼查工商数据库实时核验,补充专题页已有的公开信息,确保主体真实性。
| 项目 | 内容 |
|---|---|
| 成立日期 | 2025-07-24 |
| 经营状态 | 仍注册 |
| 企业类型 | 私人股份有限公司 |
数据来源:天眼查(tianyancha.com)工商公示数据,查询时间 2026-08-25。专题页原有内容(招股书/新闻/调研)不受影响,本卡仅补充权威工商核验维度。若与本页其他来源冲突,以天眼查工商登记为准。
Context Engineering(上下文工程):管理LLM"看什么"和"记什么"的系统工程。 核心问题:在有限的context window内,如何组织、检索、压缩信息,让LLM在需要时准确调用相关知识。 不是把文档塞进context,而是构建智能的信息访问机制。
向量检索、关键词检索、图检索、混合检索
LLM摘要、选择性上下文、SALT显著度压缩
知识图谱、社区结构、层次索引
对话历史、会话摘要、状态跟踪
RAG工具、计算器、API调用
C²KV压缩复用、增量更新、Memory管理
Facebook提出将检索与生成结合,LLM在生成时动态检索外部知识库,显著减少幻觉
GPT-4 128K → Claude 200K → Gemini 1M。上下文窗口不断扩展,但成本和注意力分散问题随之而来
Microsoft GraphRAG: 用知识图谱增强RAG,先社区理解全局,再局部检索补充细节
LLM识别并删除冗余上下文tokens,在保持核心信息的同时压缩60%+长度
SALT: 显著度感知的词典压缩。C²KV: KV cache跨请求复用。Long Context进入工程优化深水区
背景:LLM的参数知识有截止日期,且存在幻觉问题。RAG通过检索外部知识来增强LLM。
核心方法:
核心问题:
背景:Naive RAG处理"全局性问题"(如"这份1000页文档集的主要主题是什么?")效果极差——这是查询聚焦摘要(QFS)而非检索任务。
核心方法(两阶段):
量化效果:在1百万token级数据集上,全局问答的全面性和多样性显著优于Naive RAG。
背景:现有输入级prompt压缩方法对每个句子打一个scalar显著度分数,忽略了句子内部tokens的差异性。
核心创新:
核心洞察:压缩不是简单删除,而是在保留关键信息的同时最小化信息损失。
背景:Long Context推理的核心瓶颈是KV Cache的存储和计算成本。预填充(prefill)阶段的计算冗余是主要痛点。
核心方法:
核心价值:在不损失生成质量的前提下,将长上下文推理的计算成本降低50%+。
背景:人类海马体能快速将新记忆整合到已有知识结构中,实现长期记忆的快速检索。HippoRAG借鉴这一机制。
核心方法:
发展脉络:
核心挑战:
识别任务类型:事实性问答(需要检索)、推理任务(需要上下文链)、生成任务(需要背景知识)。 评估是需要局部信息(具体事实)还是全局信息(主题理解),决定用Naive RAG还是GraphRAG。
混合检索(向量+关键词)、分层检索(先粗召回再精排)、图检索(关系驱动)。 对多跳任务,用ReAct-style的循环检索;对全局任务,用社区检测。
用SALT等显著度感知压缩减少冗余tokens。 对长文档,用LLM预生成摘要作为上下文。 对多文档,用Graph结构组织实体和关系。
对重复query场景,用C²KV复用历史KV Cache。 对长对话,用会话摘要压缩历史记录。 对长文档推理,考虑稀疏注意力或滑动窗口。
关键测试:全局性问题(GraphRAG vs Naive RAG)、多跳问题(链路完整性)、上下文长度敏感性(是否"Lost in Middle")。 根据失败case调整检索策略或压缩率。
| 陷阱类型 | 描述 | 解决方向 |
|---|---|---|
| Lost in the Middle | 中间上下文被忽略,LLM只看头尾 | 用重要信息放两端;用GraphRAG社区结构重组信息 |
| 上下文稀释 | context过长,有效信息被稀释在噪声中 | 用SALT等显著度压缩;减少无关上下文 |
| 全局vs局部混淆 | 用Naive RAG处理全局性问题 | GraphRAG社区摘要回答全局问题 |
| KV Cache爆炸 | 长上下文导致KV Cache内存溢出 | C²KV压缩复用;稀疏注意力;截断策略 |
| 检索-生成不一致 | 检索结果与生成回答风格/粒度不匹配 | 用生成结果反向验证检索质量 |
LLM本身不存储知识——它通过context访问知识。Context Engineering就是构建智能的"记忆访问层"。
Naive RAG擅长局部事实检索,GraphRAG擅长全局理解。两者不是替代而是互补。
SALT的核心洞察:不是对句子打分,而是对token级别的显著度建模。这代表了压缩的方向。
C²KV的核心洞察:跨请求复用KV Cache是降低长上下文推理成本的关键。
1M token窗口不等于好——有效信息密度、注意力聚焦才是关键。
HippoRAG借鉴神经科学是好的趋势——Context Engineering需要更多认知科学理论。
• Lewis et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020 (RAG original paper)
• Edge et al. (2024). From Local to Global: A Graph RAG Approach to Query-Focused Summarization. arXiv:2404.16130
• Mamo et al. (2025). SALT: Salience-Aware Lexical Trie for Long-Context Compression. arXiv:2607.17486
• Du et al. (2025). C²KV: Compressed and Composable KV Cache Reuse. arXiv:2607.17715
• Peng et al. (2024). HippoRAG: Neurobiologically Inspired Long-Term Memory for RAG. NeurIPS 2024
• Anthropic Research: Context Window Management in Claude
• Microsoft GraphRAG: github.com/microsoft/graphrag
以下国际领先的理论框架为本专题提供分析基础和决策参考。
新兴技术经历5个阶段:技术触发→期望膨胀峰值→幻灭低谷→启蒙爬升→生产力高原。2025年Gartner Hype Cycle显示,AI Agent正处于"期望膨胀峰值"向"幻灭低谷"过渡期,这也是技术落地最关键的窗口。
技术的性能提升遵循S形曲线:初期缓慢→加速期→成熟期→极限。当一条S曲线趋于平缓,新的S曲线从不连续点浮现。AI多智能体系统的能力演进正处于加速期,预计2025-2028年达到第一个性能拐点。
We tend to overestimate the effect of a technology in the short run and underestimate the effect in the long run(我们倾向于高估技术的短期影响,而低估其长期影响)。当前对AI Agent的热炒和质疑完美印证Amara's Law——短期期望过高,长期影响被低估。
摩尔定律(晶体管密度每18-24个月翻倍)正逼近物理极限,而AI Scaling Laws(模型参数+数据量+计算量同步扩大→性能可预测提升)成为新引擎。NVIDIA GPU从A100到H100到B200的算力增长(3年间约4倍),直接驱动了Multi-Agent时代的到来。