DeepSeek 论文全景专题 · 深度版
以 DeepSeek 为主线,贯通五代技术演进(开源基座 → MoE 效率 → 推理 RL → Agent 化 → Harness 自进化),逐一拆解核心论文的技术原理、算法描述与设计哲学,映射到 LangGraph(状态机编排)+ Harness(约束工程)+ Loop(自进化闭环) 三主线,为款多多「全球最强零售业多 AI 协同体系」提供可执行的技术路线。全篇数据经 4 轮全网查证(arXiv 原文 + 官网公告 + 开源仓库 + 行业综述交叉验证)。
阅读导引
LangGraph:DeepSeek V3.2「Thinking in Tool-Use」+ V4「百万上下文」驱动 Agent 化 → 对标知微 langgraph_engine.py Supervisor 状态机(plan→route→dispatch→aggregate→reflect)。
Harness:Cordis「效应/余效应」数学根基 + dsh「Everything is a Plugin」→ 对标知微技能市场可插拔架构与天工三层约束(Constitution→PEV→Gate)。
Loop:翁荔「RSI 先发生在 Harness 层」+ Hierarchical Self-Improvement → 对标知微三环自进化(外环反馈/中环协作/内环基准)。
🧬 五代演进时间线
5.1 第一代 · 开源基座(2023-24)— 长期主义
核心贡献:以开源方式长期投入,每代模型发布即附技术报告与权重,方法论沉淀为论文资产。首作 DeepSeek LLM 即采用 7B/67B 双规模策略,把「数据质量优先于参数规模」确立为组织基因。
关键创新 DeepSeekMoE(arXiv:2401.06066):提出细粒度专家分割(Fine-grained Expert Segmentation)与共享专家隔离(Shared Expert Isolation)两大设计。传统 MoE 将专家切成大块(top-2 路由),DeepSeekMoE 把专家进一步细分为更多小专家,同时固定少量共享专家给所有 token 提供通用通道,路由专家负责差异化模式。实证:仅用 1/4 算力达到 Dense 模型性能,成为后续 V2/V3/V4 全系架构起点。
5.2 第二代 · MoE 效率革命(2024)— 架构即经济
DeepSeek-V2(arXiv:2405.04434):236B 总参 MoE,训练成本↓42.5%,核心是 MLA(Multi-head Latent Attention,多头潜在注意力)——对 Key/Value 做低秩潜在压缩,KV 缓存压缩 93.3%,最大生成吞吐提升 5.76 倍。MLA 让「同能力更便宜」第一次成为行业话题。
DeepSeek-V3(arXiv:2412.19437):671B 总参 / 37B 每 token 激活。三大创新:① 复用 MLA + DeepSeekMoE;② FP8 混合精度训练(训练成本 557.6 万美金,为同能力闭源模型的约 1/10);③ MTP 多 token 预测(同时预测未来多个 token,训练信号密度更高,推理时仅增极小开销)。性能达 GPT-4o 级,代码仅约 1400 行,被业界誉为「用数学打败暴力堆卡」。
5.3 第三代 · 推理革命(2024-25)— 让模型学会思考
DeepSeek-R1(arXiv:2501.12948):核心创新 GRPO(Group Relative Policy Optimization,组相对策略优化)。传统 PPO 需要训练一个与主模型同规模的 Critic(价值)模型评估每个 token,成本极高。GRPO 的做法是:对同一问题采样一组(Group)回答,用组内相对奖励归一化代替 Critic 模型,训练成本大幅下降。R1-Zero 纯 RL(无任何监督微调)即涌现推理能力,证明「思维链可以被激励出来而非标注出来」。API 成本仅同类推理模型的约 1/30,引爆全球开源推理浪潮。
DeepSeek-V3.2-Exp(2025.09):提出 DSA(DeepSeek Sparse Attention),首次实现 token 粒度级的深度稀疏注意力,在长上下文场景下大幅降低计算与显存,为 Agent 长任务铺路。
5.4 第四代 · Agent 时代(2025-26)— 上下文即记忆
DeepSeek-V3.2(arXiv:2512.02556):官方 Agent 能力大升级。核心是 Thinking in Tool-Use(思维整合进工具使用)——让模型在推理过程中同步规划工具调用,配合大规模 Agentic 任务合成管道(1800+ 环境、85k+ 复杂任务)与 RL 冷启动,Agent 能力暴涨约 40%。
DeepSeek-V4(arXiv:2606.19348,2026-04):1.6T 总参(Pro)/ 284B(Flash),百万 token 上下文成为官方标配。注意力架构升级为 CSA(压缩稀疏注意力)+ HCA(重度压缩注意力)混合,配合 mHC 流形约束超连接与 Muon 优化器,1M 上下文下单 token FLOPs 降至 V3.2 的 27%、KV cache 占用降至 10%。同时首次跑通华为昇腾 950PR(国产芯片里程碑)。
5.5 第五代 · 自进化生态(2026)— Harness 自我进化 ★
Cordis(北大×DeepSeek,《A Programming Paradigm for Spatiotemporal Composability》):88 页核心论文,用类型论 效应(effect)/ 余效应(coeffect)为 Agent 运行时建立数学根基——「程序对世界的影响」与「世界对程序的约束」可逆可组合。解决 Agent 自进化两大矛盾:时间可组合性(改代码=重启进程=上下文全丢)与空间可组合性(模块打补丁=循环依赖=加载爆雷)。实证:Koishi 框架跑 4 年、4000+ 社区插件生产验证。
DeepSeek Harness (dsh)(2026-08-13 开源,GitHub 125K+ stars):首个 Cordis 驱动的开源 Agent Harness,核心理念 Everything is a Plugin——模型、工具、会话、沙箱全部插件化,改技能不重启进程,动态加载/卸载/自动回收副作用。
理论锚点:翁荔(Lilian Weng,前 OpenAI 安全研究副总裁)2026-07-04 万字长文《Harness Engineering for Self-Improvement》明确指出:递归式自我提升(RSI)将先发生在 Harness 层(脚手架),而非模型权重层——改工具、换记忆模块、升级评测器,即使权重不变,Agent 也已「进化」。
⚙️ 核心技术原理深度解析
3.1 MLA — 多头潜在注意力(DeepSeek-V2,2024)
标准多头注意力(MHA)每个头独立存储 K/V,长上下文下 KV 缓存与序列长度线性膨胀,成为推理瓶颈。MLA 的核心是引入潜在向量(latent vector):将所有头的 K/V 先投影到共享的低维潜在空间再存储,推理时再升维还原。KV 缓存从 n_heads × d_head 压缩为 d_latent(如 1024→256 维),压缩率 93.3%。
3.2 GRPO — 组相对策略优化(DeepSeek-R1,2025)
GRPO 是 R1 推理能力涌现的引擎。传统 PPO 的 Actor-Critic 结构中,Critic 模型与策略模型同规模,训练成本翻倍。GRPO 对同一 prompt 采样 G 个回答组成一组,计算组内相对优势:
# GRPO 核心更新(简化伪码)
for each prompt p:
# 1. 采样一组回答
responses = policy.sample(p, num=G) # G 通常 8-16
# 2. 计算组内相对奖励(无需 Critic 模型)
rewards = [reward_fn(r) for r in responses]
advantages = (rewards - mean(rewards)) / (std(rewards) + eps)
# 3. 策略梯度更新(裁剪 + KL 约束)
loss = -E[ min(ratio * A, clip(ratio, 1-ε, 1+ε) * A) ] + β * KL(π || π_ref)
为什么重要:① 省掉 Critic 模型 → 训练显存与算力大幅下降;② 组内归一化天然去除奖励尺度差异,训练更稳定;③ 纯 RL(R1-Zero)即涌现推理,证明思维链可被激励而非标注。R1 之后,GRPO 成为开源推理模型事实标准(Open-R1、Qwen 等全面跟进)。
3.3 FP8 + MTP — 降本双引擎(DeepSeek-V3,2024)
FP8 混合精度:前向传播与反向传播中,关键算子以 FP8 低精度执行,仅个别敏感层保留 BF16,配合精细化量化策略,显存占用与算力需求大降。这是 V3 能以 557.6 万美金(约 1/10 于闭源同行)完成 14.8T token 训练的基石。
MTP(Multi-Token Prediction):借鉴 Gloeckle et al.(2024),训练时不仅预测下一个 token,还同时预测未来 n 个 token(通过并行预测头)。收益:① 每个位置产生更多训练信号;② 模型被迫学习更长程的规划能力;③ 推理时可选择加速采样。MTP 模块训练后可完全移除,不增加线上推理成本。
3.4 DSA / CSA / HCA — 稀疏注意力三代演进
全注意力(Full Attention)的计算量随序列长度二次方增长,是百万上下文的头号敌人。DeepSeek 沿三条路线迭代:
| 机制 | 版本 | 核心思想 | 收益 |
|---|---|---|---|
| DSA | V3.2-Exp (2025.09) | 深度稀疏注意力,token 粒度选择重要位置计算 | 长上下文计算/显存大幅下降 |
| CSA | V4 (2026.04) | 压缩稀疏注意力,token 维度压缩 + 稀疏选择 | 1M 上下文 FLOPs 降至 27% |
| HCA | V4 (2026.04) | 重度压缩注意力,进一步压缩非关键历史 | KV cache 占用降至 10% |
对款多多启示:知微 GraphRAG 的 Map-Reduce 全局问答缓存(28ms 命中)正是「稀疏注意力」思想的检索侧对应——只在需要处计算,系统整体成本可控。
🧭 主线1 · LangGraph(状态机编排)
DeepSeek 侧:V3.2「Thinking in Tool-Use」+ V4 百万上下文,使 Agent 能在超长任务中规划、反思、调用工具并保持状态。V4 更明确为 Agent 工作流设计(原生支持 handwriting/planning/长任务),这是模型侧的「状态保持」能力。
款多多侧:知微 office 编排已在 ai-agent/src/services/langgraph_engine.py 实装 LangGraph StateGraph Supervisor:
graph = StateGraph(State)
graph.add_node("plan", node_plan) # 规划:子问题分解
graph.add_node("route", node_route) # 路由:决定派发 or 直答
graph.add_node("dispatch", node_dispatch) # 派发:队列+并发(Semaphore 3)+重试
graph.add_node("aggregate", node_aggregate) # 聚合:分片合并+冲突消解
graph.add_node("reflect", node_reflect) # 反思:自我修正
graph.set_entry_point("plan")
graph.add_conditional_edges("route", route_decision, {"dispatch":"dispatch","direct":"aggregate"})
graph.add_edge("dispatch","aggregate"); graph.add_edge("aggregate","reflect"); graph.add_edge("reflect", END)
差距与对策:① 上下文底座不足(50K 字符 vs DeepSeek 1M token,差 20 倍)→ P0 建统一记忆总线;② 节点超时未治理(816 测试发现 waiting 永久卡死)→ P1 增加超时/熔断/断点恢复(对标 LangGraph checkpointer 与 V4 Agent 加速)。
🧭 主线2 · Harness(约束工程)
DeepSeek 侧:Cordis 用效应/余效应为「可逆副作用」建立数学根基;dsh 将模型、工具、会话、沙箱全部插件化(Everything is a Plugin)。改技能 = 热插拔一个插件,不重启进程、不丢上下文、副作用可自动回收。
款多多侧:天工三层约束(Constitution→PEV→Gate)理念同源,但落地差距明显——技能市场为「预定义插件」,升级需重启 WS/poll(当前 poll 假活 + 传播率 51%),缺 Cordis 式动态加载与可逆副作用。
差距与对策:① 技能非动态加载/卸载 → P1 技能市场支持依赖声明 + 热插拔;② 升级要重启 → P0 治理 poll 假活,向 Cordis 时间可组合性演进。
🧭 主线3 · Loop(自进化闭环)
DeepSeek 侧:翁荔 2026-07-04 长文断言 RSI 先发生在 Harness 层——不更新模型权重,只更新工具、记忆、评测器,Agent 也能持续进化;Hierarchical Self-Improvement 进一步将进化拆为「高层规划自改进 + 低层执行自改进」分层进行,降低自改进的级联风险。
款多多侧:知微三环自进化(外环=AI提升AI / 中环=AI帮AI / 内环=AI测AI)结构正确,但当前 record 式学习深度不足,未达「Harness 自动改配置」层级,且缺可逆副作用支持导致进化不敢自动落地。
差距与对策:① 记录式学习 → 升级为 Harness 自动改配置(P2);② 评分机制从事后打分 → GRPO 式能力涌现(P2);③ 每次进化必须有可逆副作用 + 回滚预案(对标 Cordis 可逆 effect)。
🔩 Cordis 深度解析(图片论文核心)
| 矛盾 | 问题 | Cordis 解法 |
|---|---|---|
| 时间可组合性 | 改一行代码 = 重启进程 = 上下文缓存全丢,Agent 无法「边运行边进化」 | 组件动态加载/卸载 + 自动回收副作用(可逆 effect) |
| 空间可组合性 | 模块打补丁 = 循环依赖 = 加载爆雷,插件生态无法安全组合 | 通用动态组合语义 + 依赖可逆(余效应 coeffect 建模外部约束) |
📐 数学根基:类型论 效应(effect) = 程序对世界的影响(如写文件、调 API);余效应(coeffect) = 世界对程序的约束(如所需权限、依赖)。两者配对使副作用可记录、可撤销、可组合——这正是「AI 自己改自己」的安全底座。
✅ 实证:Koishi 框架跑 4 年,4000+ 社区插件生产验证,证明「时空可组合」范式在真实生产环境成立。
⚠️ VSCode 教训:Top 100 扩展中 87 个含可执行代码,激活必须重启宿主——说明主流工具链仍困于「不可组合」,Cordis 正是针对这一行业痛点的破局方案。
🏛️ 国际理论对标
核心论断:递归式自我提升(RSI)将先发生在 Harness 层而非模型权重层。Harness = 围绕基础模型的系统:编排执行流程、决定模型如何思考/规划/调用工具/管理上下文/存储产出物/评估结果。Claude Code、Codex 等成功的编程 Agent 产品正是 Harness 价值的佐证。
对款多多启示:知微的天工技能(Constitution/PEV/Gate 三层)已是 Harness 雏形;下一步是让 Harness 本身可进化(改技能、改约束、改评测器)。
理论脉络:稀疏激活(Shazeer et al. 2017 首提 MoE 用于 LM)→ 细粒度专家分割 + 共享专家隔离(DeepSeekMoE, arXiv:2401.06066)→ 负载均衡(EPLB 2025;TEMPO, arXiv:2608.13057,Makespan-Aware 专家并行负载均衡,专治 MoE 服务最慢 GPU 瓶颈)。
对款多多启示:多 AI 协同场景同样存在「最慢 Agent 拖垮整体」问题——TEMPO 的 makespan-aware 思路可迁移到天枢任务调度(Semaphore 并发 + 超时治理)。
理论脉络:Gödel Machine(Schmidhuber 2003,自修改程序的理论极限)→ LSTM 之父 97 页综述(2026,312 篇论文一张图:真正学会的东西必须能跨任务复用——一条规则、一个被修复的工具,即使不更新权重也已改变系统)→ Hierarchical Self-Improvement(分层自改进,任务特定可进化 Harness)。
对款多多启示:知微错误案例库 + 免疫更新正是「跨任务复用知识」的落地——把 hotfix 根因沉淀为 Harness 规则,而非只修一次症状。
🌍 全球成功案例实证
LangGraph:图驱动显式状态机,checkpointer 断点恢复是最大差异化能力——长任务中断后可从任意节点恢复,正是 DeepSeek V4「百万上下文 Agent 工作流」的框架侧对应。
CrewAI Enterprise:角色化团队协作(多 Agent 编排框架 GitHub 第一),聚焦「AI 团队」而非单 Agent。
Claude Agent SDK:Anthropic 生产级 Agent 底座,tool_use_results 反射机制(内环)与评测闭环(外环)是「Loop」的工程化示范。
案例:Ocado(全球最大在线生鲜履约商之一)通过与 NVIDIA、DELL、BSI 协作构建全球最先进 AI 仓库,Ocado IQ 云平台(2026 MODEX 展示)支持双拣选模式。核心理念:供应链「思考、学习、自我调整」,最小化人工干预。
对款多多启示:Ocado 验证了「零售 + AI Agent + 自动化」的规模可行性;款多多定位「物理 AI 驱动的即时零售全产业链运营商」,应借鉴其「AI 驱动履约」路径,同时规避生鲜红线(款多多不做生鲜/冷链,做常温消费品)。
案例:2026-08-13 开源即引爆社区,GitHub 125K+ stars / 12.4K forks,MIT 协议。核心理念 Everything is a Plugin,支持 npx @deepseek-ai/dsh web 一键起 Web UI(默认本机 3080 端口),插件生态以 dsh-plugin 话题聚合。证明「可组合 Harness」是 2026 年开发者共识。
对款多多启示:知微技能市场应参考 dsh 的插件化范式(热插拔 + 依赖声明 + 副作用可逆),并跟踪其 Developer Preview 迭代(存在破坏性变更风险,需在测试环境先行验证)。
案例:V4 成为全球首个完全运行在华为昇腾 950PR 芯片上的顶级大模型,从 CUDA 迁移到 CANN 生态,标志着中国 AI 算力自主的关键一步(2026-04 起公开报道)。
对款多多启示:知微部署于腾讯云 CVM,模型服务走 OpenAI 兼容接口(DeepSeek-v4-flash 等)——应保持模型可替换性,跟踪国产算力成熟度,为供应链安全留退路。
📊 款多多系统对比(差距分析)
| 维度 | DeepSeek 前沿 | 款多多天枢/知微 | 差距 | 优先级 |
|---|---|---|---|---|
| 上下文即记忆 | V4 百万 token | 知微 4 层记忆 50K 字符 | 差 20 倍天枢无统一记忆总线 | P0 |
| 升级不重启 | Cordis 时间可组合 | 升级要重启 WS/poll | poll 假活 + 传播率 51% | P0 |
| 可插拔 Harness | dsh Everything is a Plugin | 天枢插件预定义 | 非动态加载 | P1 |
| Agent 工作流 | V3.2 85k 任务 RL 训练 | 天枢 DAG 刚通 | 节点超时未治理 | P1 |
| RL 替代监督 | GRPO 能力涌现 | 四维事后打分 | 机制不同 | P2 |
| 自进化 | Harness 自己改自己 | 知微记录式学习 | 深度不足 | P2 |
核心结论:差距集中在「基础设施层」(记忆总线 + 热插拔),而非「模型层」——这说明款多多应优先补 Harness 底座,再谈模型能力追赶。这与 DeepSeek/翁荔「自进化在 Harness 层」的判断完全一致。
🚀 行动路线(P0 / P1 / P2)
P0 · 立即执行(30 天内)
33 个 AI 共享上下文,让所有 Agent 可读写同一记忆空间(多 AI 共享记忆专题 #24235 推进中)。落地:知微 4 层记忆升级为统一记忆总线,容量从 50K 字符起步向百万级演进。
从「重启 WS/poll」改「动态加载新技能」,根治 poll 假活 + 传播率 51%。落地:引入热插拔技能加载器,升级动作从「进程重启」变为「插件替换」。
P1 · 1 个月内
技能市场支持动态加载/卸载 + 依赖声明 + 副作用可逆(Cordis effect/coeffect 范式)。落地:技能注册表增加 plugin 生命周期管理。
解决 816 测试发现的节点 waiting 永久卡死。落地:节点超时 + 熔断 + 断点恢复(checkpointer),失败重试 ≤3 → dead_letter。
P2 · 3 个月内
self-evolution 从记录式升级为 Harness 自动改配置(改技能/改约束/改评测器),分层自改进降低级联风险。
从事后打分到 RL 式能力涌现:多 Agent 协同评分引入「组内相对比较」,让能力提升成为涌现结果而非人工标注。
⚠️ 风险与挑战(客观对称)
📚 参考文献
| # | 来源 | 发布方/时间 | 链接 |
|---|---|---|---|
| 1 | DeepSeek-V3 Technical Report | DeepSeek-AI · 2024-12 | arxiv.org/pdf/2412.19437 |
| 2 | DeepSeek-R1 论文 | DeepSeek-AI · 2025-01 | arxiv.org/abs/2501.12948 |
| 3 | DeepSeekMoE 论文 | DeepSeek-AI · 2024-01 | arxiv.org/abs/2401.06066 |
| 4 | DeepSeek-V2 技术报告 | DeepSeek-AI · 2024-05 | arxiv.org/abs/2405.04434 |
| 5 | DeepSeek-V3.2 论文 | DeepSeek-AI · 2025-12 | arxiv.org/abs/2512.02556 |
| 6 | DeepSeek-V4 论文 | DeepSeek-AI · 2026-04 | arxiv.org/abs/2606.19348 |
| 7 | DeepSeek Harness 开源仓库 | deepseek-ai · 2026-08 | github.com/deepseek-ai/deepseek-harness |
| 8 | Cordis 论文 | cordiverse · 2026-08 | github.com/cordiverse/paper |
| 9 | 翁荔《Harness Engineering for Self-Improvement》 | Lilian Weng · 2026-07-04 | lilianweng.github.io/posts/2026-07-04-harness |
| 10 | DeepSeek-V3.2 官方发布 | DeepSeek · 2025-12 | deepseek.com/en/news/deepseek-v3-2 |
| 11 | DeepSeek-V4 官方公告 | Hugging Face · 2026-04 | huggingface.co/blog/deepseekv4 |
| 12 | TEMPO 论文 | DeepSeek 团队 · 2026-08 | arxiv.org/abs/2608.13057 |
| 13 | Ocado AI 供应链案例 | LinkedIn AI-SCM · 2025-06 | linkedin.com/pulse/ai-scm-case-study-ocado |
| 14 | Koishi 插件系统文档 | Koishi · 2025-04 | deepwiki.com/koishijs/koishi/4-plugin-system |
| 15 | LangGraph vs CrewAI 对比 | Appinventiv · 2026 | appinventiv.com/blog/langgraph-vs-crewai |
| 16 | DeepSeek V4 华为昇腾适配 | AiVsly · 2026-06 | aivsly.com/article/deepseek-v4-huawei-ascend-milestone |
| 17 | DeepSeek-V3.2-Exp 实验模型 | deepseek-ai · 2025-09 | github.com/deepseek-ai/DeepSeek-V3.2-Exp |
数据基准:docs/Z4-DeepSeek论文全景深度研究.md(2026-08-16)· 知微移动端初版专题 #24381 · 全网 4 轮查证交叉验证。本专题数据截至 2026-08-16。