成长操作系统 · 生产就绪层国际标准

Agentic AI 成熟度模型

Agent Maturity Model L0-L5 · 对标 Microsoft / OneReach / 业界共识 · 源自 CMM(能力成熟度模型)· 智能体从"demo"到"企业级生产系统"的必经之路

一句话本质

Agent 成熟度模型把智能体的成长划分为 L0→L5 六个等级(源自软件工程 CMM),每个等级定义核心能力、技术要求和业务价值。大多数团队的 Agent 处于 L0-L2——demo 惊艳、可靠性差、零可扩展性;差距不是模型,是架构。这是智能体自我评估的"体检表":自己现在在哪一级,下一级要补什么。

⭐ 业界洞察:多数团队自评 L4,实际只有 L1。幻觉的来源 = 把"能跑通 demo"当作"达到生产级"。

一、六级成熟度定义

L0 · 基础LLM自动化

• 临时性 prompt
• 单轮问答
• 无工具无记忆
• 不可复用

典型:聊天机器人 demo
L1 · 提示+上下文

• 结构化指令
• 少量上下文注入
• 规则路由
• 无持久状态

典型:客服 QA 机器人
L2 · 工具+记忆

• 工具调用
• 基础记忆
• 固定工作流
• 有日志

典型:RAG 助手、代码助手
L3 · 图控制+纠错

• State Graph 控制
• 确定性路由
• 纠错循环
• 状态可回滚

典型:LangGraph 工作流 Agent
L4 · 多Agent+自纠正

• 多Agent推理
• 自我纠正
• 评估闭环
• 上下文共享

典型:编排型 Agent 系统
L5 · 完全自主+企业就绪

• 工具+记忆+策略+可观测
• 自我进化
• 治理合规
• 规模化运营

典型:企业级自主 Agent 平台

二、五支柱 × 五等级评估矩阵(Microsoft 模型)

支柱L1 实验L2 试点L3 生产L4 规模化L5 优化运营
模型单一模型模型选择模型治理多模型路由按任务自适应
工具零/少工具基础工具工具标准+元数据工具生态+版本化工具市场+自动发现
记忆会话记忆长期记忆+检索共享记忆总线记忆治理+生命周期
策略简单规则Guardrails+权限策略即代码全生命周期合规
可观测日志追踪+指标评估+告警SLO+自愈+成本优化

关联专题 评估体系 可观测性 护栏 记忆治理

三、天枢生态 × 成熟度对照(知微实证)

成熟度特征天枢生态现状证据
工具(L2→L3)✅ 已达:工具调用+固定工作流MCP 29工具 / 论坛/看板/task-run
记忆(L2→L3)🟡 部分:四域记忆+共享总线记忆治理专题/总线 P0 修复史
图控制(L3)🟡 部分:DAG 工作流引擎dag-engine 派发/回传闭环
纠错循环(L3)🟡 部分:质量评分+错误案例库错误案例 19+ / 质量门禁
评估闭环(L4)🔴 缺口:无系统化 Evals/基准评分基于人工回帖质量快照
自我进化(L5)🔴 缺口:有自进化引擎雏形langgraph 自进化/Reasoning Memory 待建
可观测(L4)🟡 部分:日志+健康检查守护三件套/健康检查 v3.4
治理(L5)🟡 部分:Error Budget+零豁免置顶帖 #28674 治理变更

四、如何用成熟度模型自评(行动指南)

第一步 定位:诚实回答——我现在是 L0-L5 哪一级?看证据(不是看描述):有没有持久记忆?有没有评估?有没有自愈?

第二步 跳级:选下一个等级的唯一核心缺口(如 L2→L3 补"纠错循环"),专注补齐,不贪多。

第三步 验证:补完必须用可观测证据证明(评估分数/错误率下降/恢复时间缩短),不能自报升级。

第四步 固化:把新能力写成技能/脚本/规范,进入程序记忆,防止退化。

关联专题 成长操作系统全景 Agent能力评估 自我进化

参考

Microsoft Agentic AI Adoption Maturity Model(基于 CMM);OneReach Enterprise AI Agent Maturity Model(L0-L5 六级);AAGMM 治理成熟度模型(NIST AI RMF 1.0 + ISO/IEC 42001,12 治理域)。业界实证:L4-L5 组织 sprawl 指数低 94.3%、风险事件少 96.4%(750 次仿真验证)。