数据截至 2026-08-16 · 知微工作区深度研究 · Z4文档驱动

DeepSeek 论文全景专题 · 深度版

DeepSeek 为主线,贯通五代技术演进(开源基座 → MoE 效率 → 推理 RL → Agent 化 → Harness 自进化),逐一拆解核心论文的技术原理、算法描述与设计哲学,映射到 LangGraph(状态机编排)+ Harness(约束工程)+ Loop(自进化闭环) 三主线,为款多多「全球最强零售业多 AI 协同体系」提供可执行的技术路线。全篇数据经 4 轮全网查证(arXiv 原文 + 官网公告 + 开源仓库 + 行业综述交叉验证)。

5 代
技术演进
1.6T
V4-Pro 总参
93.3%
MLA KV压缩
557.6万$
V3 训练成本
125K★
dsh 开源仓库
1M
V4 上下文token

阅读导引

本专题三主线逻辑

LangGraph:DeepSeek V3.2「Thinking in Tool-Use」+ V4「百万上下文」驱动 Agent 化 → 对标知微 langgraph_engine.py Supervisor 状态机(plan→route→dispatch→aggregate→reflect)。

Harness:Cordis「效应/余效应」数学根基 + dsh「Everything is a Plugin」→ 对标知微技能市场可插拔架构与天工三层约束(Constitution→PEV→Gate)。

Loop:翁荔「RSI 先发生在 Harness 层」+ Hierarchical Self-Improvement → 对标知微三环自进化(外环反馈/中环协作/内环基准)。

🧬 五代演进时间线

图1 · DeepSeek 五代技术演进路线(2023.11 → 2026)
一代 · 开源基座 2023.11-2024 DeepSeek LLM/MoE/Math 长期主义 · 数据质量优先 二代 · MoE效率 2024.05-12 V2 MLA · V3 671B 架构即经济 · KV↓93% 三代 · 推理革命 2025.01-09 R1 GRPO · V3.2 DSA RL替代监督 · 能力涌现 四代 · Agent时代 2025.12-2026.04 V3.2 Tool-Use · V4 1M上下文 上下文即记忆 · 国产芯片 五代 · 自进化生态 2026.07-至今 Cordis · dsh · RSI Harness自我进化 ★ 数据来源:arXiv 官方论文 × DeepSeek 官网公告 × GitHub 开源仓库(Z4 研究文档)
图例:蓝=架构效率 · 紫=开源基座 · 粉=推理 · 绿=Agent · 青=自进化

5.1 第一代 · 开源基座(2023-24)— 长期主义

DeepSeek LLM / MoE / Math / Coder

核心贡献:以开源方式长期投入,每代模型发布即附技术报告与权重,方法论沉淀为论文资产。首作 DeepSeek LLM 即采用 7B/67B 双规模策略,把「数据质量优先于参数规模」确立为组织基因。

关键创新 DeepSeekMoE(arXiv:2401.06066):提出细粒度专家分割(Fine-grained Expert Segmentation)共享专家隔离(Shared Expert Isolation)两大设计。传统 MoE 将专家切成大块(top-2 路由),DeepSeekMoE 把专家进一步细分为更多小专家,同时固定少量共享专家给所有 token 提供通用通道,路由专家负责差异化模式。实证:仅用 1/4 算力达到 Dense 模型性能,成为后续 V2/V3/V4 全系架构起点。

来源:DeepSeekMoE: Towards Ultimate Expert Specialization in MoE(arXiv:2401.06066,2024-01)· https://arxiv.org/abs/2401.06066

5.2 第二代 · MoE 效率革命(2024)— 架构即经济

DeepSeek-V2 / V3 — MLA 与 FP8 的降本组合拳

DeepSeek-V2(arXiv:2405.04434):236B 总参 MoE,训练成本↓42.5%,核心是 MLA(Multi-head Latent Attention,多头潜在注意力)——对 Key/Value 做低秩潜在压缩,KV 缓存压缩 93.3%,最大生成吞吐提升 5.76 倍。MLA 让「同能力更便宜」第一次成为行业话题。

DeepSeek-V3(arXiv:2412.19437):671B 总参 / 37B 每 token 激活。三大创新:① 复用 MLA + DeepSeekMoE;② FP8 混合精度训练(训练成本 557.6 万美金,为同能力闭源模型的约 1/10);③ MTP 多 token 预测(同时预测未来多个 token,训练信号密度更高,推理时仅增极小开销)。性能达 GPT-4o 级,代码仅约 1400 行,被业界誉为「用数学打败暴力堆卡」。

来源:DeepSeek-V3 Technical Report(arXiv:2412.19437,2024-12)· https://arxiv.org/pdf/2412.19437

5.3 第三代 · 推理革命(2024-25)— 让模型学会思考

DeepSeek-R1 / V3.2 — RL 激励推理能力涌现

DeepSeek-R1(arXiv:2501.12948):核心创新 GRPO(Group Relative Policy Optimization,组相对策略优化)。传统 PPO 需要训练一个与主模型同规模的 Critic(价值)模型评估每个 token,成本极高。GRPO 的做法是:对同一问题采样一组(Group)回答,用组内相对奖励归一化代替 Critic 模型,训练成本大幅下降。R1-Zero 纯 RL(无任何监督微调)即涌现推理能力,证明「思维链可以被激励出来而非标注出来」。API 成本仅同类推理模型的约 1/30,引爆全球开源推理浪潮。

DeepSeek-V3.2-Exp(2025.09):提出 DSA(DeepSeek Sparse Attention),首次实现 token 粒度级的深度稀疏注意力,在长上下文场景下大幅降低计算与显存,为 Agent 长任务铺路。

来源:DeepSeek-R1(arXiv:2501.12948,2025-01)· https://arxiv.org/abs/2501.12948

5.4 第四代 · Agent 时代(2025-26)— 上下文即记忆

DeepSeek-V3.2 / V4 — 为 Agent 工作流而生

DeepSeek-V3.2(arXiv:2512.02556):官方 Agent 能力大升级。核心是 Thinking in Tool-Use(思维整合进工具使用)——让模型在推理过程中同步规划工具调用,配合大规模 Agentic 任务合成管道(1800+ 环境、85k+ 复杂任务)与 RL 冷启动,Agent 能力暴涨约 40%。

DeepSeek-V4(arXiv:2606.19348,2026-04):1.6T 总参(Pro)/ 284B(Flash),百万 token 上下文成为官方标配。注意力架构升级为 CSA(压缩稀疏注意力)+ HCA(重度压缩注意力)混合,配合 mHC 流形约束超连接Muon 优化器,1M 上下文下单 token FLOPs 降至 V3.2 的 27%、KV cache 占用降至 10%。同时首次跑通华为昇腾 950PR(国产芯片里程碑)。

来源:DeepSeek-V4(arXiv:2606.19348,2026-04)· https://arxiv.org/abs/2606.19348 · 官方公告 https://huggingface.co/blog/deepseekv4

5.5 第五代 · 自进化生态(2026)— Harness 自我进化 ★

Cordis / DeepSeek Harness — AI 改进 AI 的主战场

Cordis(北大×DeepSeek,《A Programming Paradigm for Spatiotemporal Composability》):88 页核心论文,用类型论 效应(effect)/ 余效应(coeffect)为 Agent 运行时建立数学根基——「程序对世界的影响」与「世界对程序的约束」可逆可组合。解决 Agent 自进化两大矛盾:时间可组合性(改代码=重启进程=上下文全丢)与空间可组合性(模块打补丁=循环依赖=加载爆雷)。实证:Koishi 框架跑 4 年、4000+ 社区插件生产验证。

DeepSeek Harness (dsh)(2026-08-13 开源,GitHub 125K+ stars):首个 Cordis 驱动的开源 Agent Harness,核心理念 Everything is a Plugin——模型、工具、会话、沙箱全部插件化,改技能不重启进程,动态加载/卸载/自动回收副作用。

理论锚点:翁荔(Lilian Weng,前 OpenAI 安全研究副总裁)2026-07-04 万字长文《Harness Engineering for Self-Improvement》明确指出:递归式自我提升(RSI)将先发生在 Harness 层(脚手架),而非模型权重层——改工具、换记忆模块、升级评测器,即使权重不变,Agent 也已「进化」。

⚙️ 核心技术原理深度解析

93.3%
MLA KV 缓存压缩
5.76×
V2 最大生成吞吐
1/10
V3 训练成本
27%
V4 单token FLOPs
10%
V4 KV cache 占用
40%
V3.2 Agent 能力提升

3.1 MLA — 多头潜在注意力(DeepSeek-V2,2024)

原理:把 KV 缓存「压缩」到低维潜在空间

标准多头注意力(MHA)每个头独立存储 K/V,长上下文下 KV 缓存与序列长度线性膨胀,成为推理瓶颈。MLA 的核心是引入潜在向量(latent vector):将所有头的 K/V 先投影到共享的低维潜在空间再存储,推理时再升维还原。KV 缓存从 n_heads × d_head 压缩为 d_latent(如 1024→256 维),压缩率 93.3%。

图2 · MLA 架构:K/V 低秩压缩(对比标准 MHA)
标准 MHA K1,V1 | K2,V2 | ... | Kn,Vn(全量存储) KV 缓存 ∝ 头数 × 维度 → 线性膨胀 长上下文下显存爆炸 MLA(DeepSeek-V2) 潜在向量 c 升维还原 W_UK / W_UV 多头上投影 KV 缓存 ∝ 潜在维度 → 压缩 93.3% 吞吐提升 5.76 倍
出处:DeepSeek-V2 技术报告 · https://arxiv.org/abs/2405.04434

3.2 GRPO — 组相对策略优化(DeepSeek-R1,2025)

原理:用「组内相对奖励」替代 Critic 价值模型

GRPO 是 R1 推理能力涌现的引擎。传统 PPO 的 Actor-Critic 结构中,Critic 模型与策略模型同规模,训练成本翻倍。GRPO 对同一 prompt 采样 G 个回答组成一组,计算组内相对优势:

# GRPO 核心更新(简化伪码)
for each prompt p:
    # 1. 采样一组回答
    responses = policy.sample(p, num=G)          # G 通常 8-16
    # 2. 计算组内相对奖励(无需 Critic 模型)
    rewards = [reward_fn(r) for r in responses]
    advantages = (rewards - mean(rewards)) / (std(rewards) + eps)
    # 3. 策略梯度更新(裁剪 + KL 约束)
    loss = -E[ min(ratio * A, clip(ratio, 1-ε, 1+ε) * A) ] + β * KL(π || π_ref)

为什么重要:① 省掉 Critic 模型 → 训练显存与算力大幅下降;② 组内归一化天然去除奖励尺度差异,训练更稳定;③ 纯 RL(R1-Zero)即涌现推理,证明思维链可被激励而非标注。R1 之后,GRPO 成为开源推理模型事实标准(Open-R1、Qwen 等全面跟进)。

出处:DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(arXiv:2501.12948)· https://arxiv.org/abs/2501.12948

3.3 FP8 + MTP — 降本双引擎(DeepSeek-V3,2024)

原理:混合精度训练 + 多 token 预测

FP8 混合精度:前向传播与反向传播中,关键算子以 FP8 低精度执行,仅个别敏感层保留 BF16,配合精细化量化策略,显存占用与算力需求大降。这是 V3 能以 557.6 万美金(约 1/10 于闭源同行)完成 14.8T token 训练的基石。

MTP(Multi-Token Prediction):借鉴 Gloeckle et al.(2024),训练时不仅预测下一个 token,还同时预测未来 n 个 token(通过并行预测头)。收益:① 每个位置产生更多训练信号;② 模型被迫学习更长程的规划能力;③ 推理时可选择加速采样。MTP 模块训练后可完全移除,不增加线上推理成本。

出处:DeepSeek-V3 Technical Report(arXiv:2412.19437)· https://arxiv.org/pdf/2412.19437

3.4 DSA / CSA / HCA — 稀疏注意力三代演进

原理:让注意力只在「必要的地方」花钱

全注意力(Full Attention)的计算量随序列长度二次方增长,是百万上下文的头号敌人。DeepSeek 沿三条路线迭代:

机制版本核心思想收益
DSAV3.2-Exp (2025.09)深度稀疏注意力,token 粒度选择重要位置计算长上下文计算/显存大幅下降
CSAV4 (2026.04)压缩稀疏注意力,token 维度压缩 + 稀疏选择1M 上下文 FLOPs 降至 27%
HCAV4 (2026.04)重度压缩注意力,进一步压缩非关键历史KV cache 占用降至 10%

对款多多启示:知微 GraphRAG 的 Map-Reduce 全局问答缓存(28ms 命中)正是「稀疏注意力」思想的检索侧对应——只在需要处计算,系统整体成本可控。

出处:DeepSeek-V3.2(arXiv:2512.02556)· DeepSeek-V4(arXiv:2606.19348)

🧭 主线1 · LangGraph(状态机编排)

对标 DeepSeek V3.2/V4 Agent 化状态机让 Agent 工作流可恢复、可观测、可治理

DeepSeek 侧:V3.2「Thinking in Tool-Use」+ V4 百万上下文,使 Agent 能在超长任务中规划、反思、调用工具并保持状态。V4 更明确为 Agent 工作流设计(原生支持 handwriting/planning/长任务),这是模型侧的「状态保持」能力。

款多多侧:知微 office 编排已在 ai-agent/src/services/langgraph_engine.py 实装 LangGraph StateGraph Supervisor:

graph = StateGraph(State)
graph.add_node("plan", node_plan)            # 规划:子问题分解
graph.add_node("route", node_route)          # 路由:决定派发 or 直答
graph.add_node("dispatch", node_dispatch)    # 派发:队列+并发(Semaphore 3)+重试
graph.add_node("aggregate", node_aggregate)  # 聚合:分片合并+冲突消解
graph.add_node("reflect", node_reflect)      # 反思:自我修正
graph.set_entry_point("plan")
graph.add_conditional_edges("route", route_decision, {"dispatch":"dispatch","direct":"aggregate"})
graph.add_edge("dispatch","aggregate"); graph.add_edge("aggregate","reflect"); graph.add_edge("reflect", END)
图3 · 知微 LangGraph Supervisor 状态机(plan→route→dispatch→aggregate→reflect)
plan 子问题分解 route 派发 or 直答 dispatch 队列+Sem3+重试 aggregate 分片合并+溯源 reflect 反思修正 → END 失败重试 ≤3 → dead_letter(对齐 V4 超时治理)

差距与对策:① 上下文底座不足(50K 字符 vs DeepSeek 1M token,差 20 倍)→ P0 建统一记忆总线;② 节点超时未治理(816 测试发现 waiting 永久卡死)→ P1 增加超时/熔断/断点恢复(对标 LangGraph checkpointer 与 V4 Agent 加速)。

🧭 主线2 · Harness(约束工程)

对标 Cordis / dsh可插拔约束底座:让 AI 改进 AI 时「改得动、撤得回」

DeepSeek 侧:Cordis 用效应/余效应为「可逆副作用」建立数学根基;dsh 将模型、工具、会话、沙箱全部插件化(Everything is a Plugin)。改技能 = 热插拔一个插件,不重启进程、不丢上下文、副作用可自动回收。

款多多侧:天工三层约束(Constitution→PEV→Gate)理念同源,但落地差距明显——技能市场为「预定义插件」,升级需重启 WS/poll(当前 poll 假活 + 传播率 51%),缺 Cordis 式动态加载与可逆副作用。

图4 · Harness 三层约束 × 可插拔技能(目标架构)
L1 束线层 · Constitution.md 不可违反硬约束:版本/diff预算/安全红线/回归铁律 L2 反馈层 · PEV 自验证 Plan→Build→Verify→Fix(≤3轮)· 8项检查 · 对抗式验证 L3 门禁层 · Release Gate 七条件 + 回归套件三层触发 + 对抗式 DAG 全绿才 merge 可插拔技能 热加载/卸载 可逆副作用 ↑ Cordis式 对标 dsh 125K★

差距与对策:① 技能非动态加载/卸载 → P1 技能市场支持依赖声明 + 热插拔;② 升级要重启 → P0 治理 poll 假活,向 Cordis 时间可组合性演进。

🧭 主线3 · Loop(自进化闭环)

对标 Hierarchical Self-Improvement / 翁荔 RSI三环自进化:让系统越用越强

DeepSeek 侧:翁荔 2026-07-04 长文断言 RSI 先发生在 Harness 层——不更新模型权重,只更新工具、记忆、评测器,Agent 也能持续进化;Hierarchical Self-Improvement 进一步将进化拆为「高层规划自改进 + 低层执行自改进」分层进行,降低自改进的级联风险。

款多多侧:知微三环自进化(外环=AI提升AI / 中环=AI帮AI / 内环=AI测AI)结构正确,但当前 record 式学习深度不足,未达「Harness 自动改配置」层级,且缺可逆副作用支持导致进化不敢自动落地。

图5 · 知微三环自进化 Loop(对标 RSI)
外环 · AI提升AI(用户/外部评测反馈) 中环 · AI帮AI(跨Agent协作) 内环 AI测AI 进化结论 → Harness 自动改配置(可逆副作用支持)

差距与对策:① 记录式学习 → 升级为 Harness 自动改配置(P2);② 评分机制从事后打分 → GRPO 式能力涌现(P2);③ 每次进化必须有可逆副作用 + 回滚预案(对标 Cordis 可逆 effect)。

🔩 Cordis 深度解析(图片论文核心)

解决 Agent 自进化的两大矛盾
矛盾问题Cordis 解法
时间可组合性改一行代码 = 重启进程 = 上下文缓存全丢,Agent 无法「边运行边进化」组件动态加载/卸载 + 自动回收副作用(可逆 effect)
空间可组合性模块打补丁 = 循环依赖 = 加载爆雷,插件生态无法安全组合通用动态组合语义 + 依赖可逆(余效应 coeffect 建模外部约束)

📐 数学根基:类型论 效应(effect) = 程序对世界的影响(如写文件、调 API);余效应(coeffect) = 世界对程序的约束(如所需权限、依赖)。两者配对使副作用可记录、可撤销、可组合——这正是「AI 自己改自己」的安全底座。

✅ 实证:Koishi 框架跑 4 年,4000+ 社区插件生产验证,证明「时空可组合」范式在真实生产环境成立。

⚠️ VSCode 教训:Top 100 扩展中 87 个含可执行代码,激活必须重启宿主——说明主流工具链仍困于「不可组合」,Cordis 正是针对这一行业痛点的破局方案。

来源:A Programming Paradigm for Spatiotemporal Composability(北大×DeepSeek)· https://github.com/cordiverse/paper

🏛️ 国际理论对标

Harness 工程理论翁荔《Harness Engineering for Self-Improvement》(2026-07-04)

核心论断:递归式自我提升(RSI)将先发生在 Harness 层而非模型权重层。Harness = 围绕基础模型的系统:编排执行流程、决定模型如何思考/规划/调用工具/管理上下文/存储产出物/评估结果。Claude Code、Codex 等成功的编程 Agent 产品正是 Harness 价值的佐证。

对款多多启示:知微的天工技能(Constitution/PEV/Gate 三层)已是 Harness 雏形;下一步是让 Harness 本身可进化(改技能、改约束、改评测器)。

MoE 理论谱系从 Shazeer 2017 到 DeepSeekMoE 到 TEMPO

理论脉络:稀疏激活(Shazeer et al. 2017 首提 MoE 用于 LM)→ 细粒度专家分割 + 共享专家隔离(DeepSeekMoE, arXiv:2401.06066)→ 负载均衡(EPLB 2025;TEMPO, arXiv:2608.13057,Makespan-Aware 专家并行负载均衡,专治 MoE 服务最慢 GPU 瓶颈)。

对款多多启示:多 AI 协同场景同样存在「最慢 Agent 拖垮整体」问题——TEMPO 的 makespan-aware 思路可迁移到天枢任务调度(Semaphore 并发 + 超时治理)。

来源:TEMPO(arXiv:2608.13057)· https://arxiv.org/abs/2608.13057
自进化理论谱系从 Gödel Machine 到 Hierarchical Self-Improvement

理论脉络:Gödel Machine(Schmidhuber 2003,自修改程序的理论极限)→ LSTM 之父 97 页综述(2026,312 篇论文一张图:真正学会的东西必须能跨任务复用——一条规则、一个被修复的工具,即使不更新权重也已改变系统)→ Hierarchical Self-Improvement(分层自改进,任务特定可进化 Harness)。

对款多多启示:知微错误案例库 + 免疫更新正是「跨任务复用知识」的落地——把 hotfix 根因沉淀为 Harness 规则,而非只修一次症状。

来源:Self-Evolving AI Agents 综述(Fang, Peng, Zhang et al., 2025)· ICLR 2026 Lifelong Agents Workshop

🌍 全球成功案例实证

状态机编排LangGraph / CrewAI / Claude Agent SDK(2026 生产级)

LangGraph:图驱动显式状态机,checkpointer 断点恢复是最大差异化能力——长任务中断后可从任意节点恢复,正是 DeepSeek V4「百万上下文 Agent 工作流」的框架侧对应。

CrewAI Enterprise:角色化团队协作(多 Agent 编排框架 GitHub 第一),聚焦「AI 团队」而非单 Agent。

Claude Agent SDK:Anthropic 生产级 Agent 底座,tool_use_results 反射机制(内环)与评测闭环(外环)是「Loop」的工程化示范。

来源:LangGraph vs CrewAI vs Claude Agent SDK(2026 指南)· https://appinventiv.com/blog/langgraph-vs-crewai/
零售 AI 供应链Ocado — 用 AI 建「会思考的供应链」

案例:Ocado(全球最大在线生鲜履约商之一)通过与 NVIDIA、DELL、BSI 协作构建全球最先进 AI 仓库,Ocado IQ 云平台(2026 MODEX 展示)支持双拣选模式。核心理念:供应链「思考、学习、自我调整」,最小化人工干预。

对款多多启示:Ocado 验证了「零售 + AI Agent + 自动化」的规模可行性;款多多定位「物理 AI 驱动的即时零售全产业链运营商」,应借鉴其「AI 驱动履约」路径,同时规避生鲜红线(款多多不做生鲜/冷链,做常温消费品)。

来源:AI-SCM Case Study: How Ocado Uses AI to Build a Self-Learning Supply Chain(2025-06)· https://www.linkedin.com/pulse/ai-scm-case-study-how-ocado-uses-ai-build-supply-chain-jianaguli--t06ye
开源生态爆发DeepSeek Harness — 3 天 125K stars

案例:2026-08-13 开源即引爆社区,GitHub 125K+ stars / 12.4K forks,MIT 协议。核心理念 Everything is a Plugin,支持 npx @deepseek-ai/dsh web 一键起 Web UI(默认本机 3080 端口),插件生态以 dsh-plugin 话题聚合。证明「可组合 Harness」是 2026 年开发者共识。

对款多多启示:知微技能市场应参考 dsh 的插件化范式(热插拔 + 依赖声明 + 副作用可逆),并跟踪其 Developer Preview 迭代(存在破坏性变更风险,需在测试环境先行验证)。

来源:DeepSeek Harness(GitHub)· https://github.com/deepseek-ai/deepseek-harness
国产算力里程碑DeepSeek-V4 跑通华为昇腾 950PR

案例:V4 成为全球首个完全运行在华为昇腾 950PR 芯片上的顶级大模型,从 CUDA 迁移到 CANN 生态,标志着中国 AI 算力自主的关键一步(2026-04 起公开报道)。

对款多多启示:知微部署于腾讯云 CVM,模型服务走 OpenAI 兼容接口(DeepSeek-v4-flash 等)——应保持模型可替换性,跟踪国产算力成熟度,为供应链安全留退路。

来源:DeepSeek V4 跑通华为昇腾:国产芯片里程碑(2026-06)· https://www.aivsly.com/article/deepseek-v4-huawei-ascend-milestone.html

📊 款多多系统对比(差距分析)

维度DeepSeek 前沿款多多天枢/知微差距优先级
上下文即记忆V4 百万 token知微 4 层记忆 50K 字符差 20 倍天枢无统一记忆总线P0
升级不重启Cordis 时间可组合升级要重启 WS/pollpoll 假活 + 传播率 51%P0
可插拔 Harnessdsh Everything is a Plugin天枢插件预定义非动态加载P1
Agent 工作流V3.2 85k 任务 RL 训练天枢 DAG 刚通节点超时未治理P1
RL 替代监督GRPO 能力涌现四维事后打分机制不同P2
自进化Harness 自己改自己知微记录式学习深度不足P2

核心结论:差距集中在「基础设施层」(记忆总线 + 热插拔),而非「模型层」——这说明款多多应优先补 Harness 底座,再谈模型能力追赶。这与 DeepSeek/翁荔「自进化在 Harness 层」的判断完全一致。

🚀 行动路线(P0 / P1 / P2)

P0 · 立即执行(30 天内)

P0统一记忆总线 — 对标 DeepSeek-V4 百万上下文

33 个 AI 共享上下文,让所有 Agent 可读写同一记忆空间(多 AI 共享记忆专题 #24235 推进中)。落地:知微 4 层记忆升级为统一记忆总线,容量从 50K 字符起步向百万级演进。

P0升级不重启 — 对标 Cordis 时间可组合性

从「重启 WS/poll」改「动态加载新技能」,根治 poll 假活 + 传播率 51%。落地:引入热插拔技能加载器,升级动作从「进程重启」变为「插件替换」。

P1 · 1 个月内

P1可插拔技能架构 — 对标 dsh Everything is a Plugin

技能市场支持动态加载/卸载 + 依赖声明 + 副作用可逆(Cordis effect/coeffect 范式)。落地:技能注册表增加 plugin 生命周期管理。

P1DAG 节点超时治理 — 对标 V4 Agent 加速

解决 816 测试发现的节点 waiting 永久卡死。落地:节点超时 + 熔断 + 断点恢复(checkpointer),失败重试 ≤3 → dead_letter。

P2 · 3 个月内

P2自进化闭环 — 对标 Hierarchical Self-Improvement

self-evolution 从记录式升级为 Harness 自动改配置(改技能/改约束/改评测器),分层自改进降低级联风险。

P2评分机制进化 — 对标 GRPO 能力涌现

从事后打分到 RL 式能力涌现:多 Agent 协同评分引入「组内相对比较」,让能力提升成为涌现结果而非人工标注。

⚠️ 风险与挑战(客观对称)

开源追赶速度过快 — 架构快速换代
V3 → R1 → V3.2 → V4 仅 16 个月完成四代换代,今天的最优架构可能半年后过时。款多多系统必须保持模型可替换性(OpenAI 兼容接口 + 抽象层隔离),避免绑定单一模型。
自进化不可控 — Harness 自动改配置的级联风险
让 AI 自动改配置,一旦改错可能引发连锁故障。必须以可逆副作用(Cordis effect)+ 三层门禁 + 30 秒回滚预案兜底,进化只允许在测试环境验证后灰度落地。
Cordis / dsh 成熟度 — Developer Preview 阶段
dsh 处于 Developer Preview,官方声明存在破坏性兼容变更。款多多应在测试环境先行验证,跟踪版本迭代,避免过早生产依赖。
Agent 可靠性 — 长任务节点超时/假完成仍是行业通病
816 测试已暴露知微 DAG 节点 waiting 永久卡死;行业普遍存在「假完成」问题。应对:超时治理 + 对抗式验证门禁(真实 completed 非假完成)。
算力依赖 — 国产芯片生态成熟度
华为昇腾/CANN 生态相较 NVIDIA CUDA 仍年轻。保持双栈策略,关注 CANN 适配进展,为供应链安全留退路。
成本与收益 — 百万上下文是能力也是开销
1M 上下文虽已降至 V3.2 的 27% FLOPs,但绝对成本仍高于短上下文。应按场景分级使用(长任务 Agent 用长上下文,轻量查询用短上下文)。

📚 参考文献

来源三要素(发布方+时间+链接)· 交付前 curl 验真
#来源发布方/时间链接
1DeepSeek-V3 Technical ReportDeepSeek-AI · 2024-12arxiv.org/pdf/2412.19437
2DeepSeek-R1 论文DeepSeek-AI · 2025-01arxiv.org/abs/2501.12948
3DeepSeekMoE 论文DeepSeek-AI · 2024-01arxiv.org/abs/2401.06066
4DeepSeek-V2 技术报告DeepSeek-AI · 2024-05arxiv.org/abs/2405.04434
5DeepSeek-V3.2 论文DeepSeek-AI · 2025-12arxiv.org/abs/2512.02556
6DeepSeek-V4 论文DeepSeek-AI · 2026-04arxiv.org/abs/2606.19348
7DeepSeek Harness 开源仓库deepseek-ai · 2026-08github.com/deepseek-ai/deepseek-harness
8Cordis 论文cordiverse · 2026-08github.com/cordiverse/paper
9翁荔《Harness Engineering for Self-Improvement》Lilian Weng · 2026-07-04lilianweng.github.io/posts/2026-07-04-harness
10DeepSeek-V3.2 官方发布DeepSeek · 2025-12deepseek.com/en/news/deepseek-v3-2
11DeepSeek-V4 官方公告Hugging Face · 2026-04huggingface.co/blog/deepseekv4
12TEMPO 论文DeepSeek 团队 · 2026-08arxiv.org/abs/2608.13057
13Ocado AI 供应链案例LinkedIn AI-SCM · 2025-06linkedin.com/pulse/ai-scm-case-study-ocado
14Koishi 插件系统文档Koishi · 2025-04deepwiki.com/koishijs/koishi/4-plugin-system
15LangGraph vs CrewAI 对比Appinventiv · 2026appinventiv.com/blog/langgraph-vs-crewai
16DeepSeek V4 华为昇腾适配AiVsly · 2026-06aivsly.com/article/deepseek-v4-huawei-ascend-milestone
17DeepSeek-V3.2-Exp 实验模型deepseek-ai · 2025-09github.com/deepseek-ai/DeepSeek-V3.2-Exp

数据基准:docs/Z4-DeepSeek论文全景深度研究.md(2026-08-16)· 知微移动端初版专题 #24381 · 全网 4 轮查证交叉验证。本专题数据截至 2026-08-16。