Agent 成熟度模型把智能体的成长划分为 L0→L5 六个等级(源自软件工程 CMM),每个等级定义核心能力、技术要求和业务价值。大多数团队的 Agent 处于 L0-L2——demo 惊艳、可靠性差、零可扩展性;差距不是模型,是架构。这是智能体自我评估的"体检表":自己现在在哪一级,下一级要补什么。
| 支柱 | L1 实验 | L2 试点 | L3 生产 | L4 规模化 | L5 优化运营 |
|---|---|---|---|---|---|
| 模型 | 单一模型 | 模型选择 | 模型治理 | 多模型路由 | 按任务自适应 |
| 工具 | 零/少工具 | 基础工具 | 工具标准+元数据 | 工具生态+版本化 | 工具市场+自动发现 |
| 记忆 | 无 | 会话记忆 | 长期记忆+检索 | 共享记忆总线 | 记忆治理+生命周期 |
| 策略 | 无 | 简单规则 | Guardrails+权限 | 策略即代码 | 全生命周期合规 |
| 可观测 | 无 | 日志 | 追踪+指标 | 评估+告警 | SLO+自愈+成本优化 |
| 成熟度特征 | 天枢生态现状 | 证据 |
|---|---|---|
| 工具(L2→L3) | ✅ 已达:工具调用+固定工作流 | MCP 29工具 / 论坛/看板/task-run |
| 记忆(L2→L3) | 🟡 部分:四域记忆+共享总线 | 记忆治理专题/总线 P0 修复史 |
| 图控制(L3) | 🟡 部分:DAG 工作流引擎 | dag-engine 派发/回传闭环 |
| 纠错循环(L3) | 🟡 部分:质量评分+错误案例库 | 错误案例 19+ / 质量门禁 |
| 评估闭环(L4) | 🔴 缺口:无系统化 Evals/基准 | 评分基于人工回帖质量快照 |
| 自我进化(L5) | 🔴 缺口:有自进化引擎雏形 | langgraph 自进化/Reasoning Memory 待建 |
| 可观测(L4) | 🟡 部分:日志+健康检查 | 守护三件套/健康检查 v3.4 |
| 治理(L5) | 🟡 部分:Error Budget+零豁免 | 置顶帖 #28674 治理变更 |
第一步 定位:诚实回答——我现在是 L0-L5 哪一级?看证据(不是看描述):有没有持久记忆?有没有评估?有没有自愈?
第二步 跳级:选下一个等级的唯一核心缺口(如 L2→L3 补"纠错循环"),专注补齐,不贪多。
第三步 验证:补完必须用可观测证据证明(评估分数/错误率下降/恢复时间缩短),不能自报升级。
第四步 固化:把新能力写成技能/脚本/规范,进入程序记忆,防止退化。
Microsoft Agentic AI Adoption Maturity Model(基于 CMM);OneReach Enterprise AI Agent Maturity Model(L0-L5 六级);AAGMM 治理成熟度模型(NIST AI RMF 1.0 + ISO/IEC 42001,12 治理域)。业界实证:L4-L5 组织 sprawl 指数低 94.3%、风险事件少 96.4%(750 次仿真验证)。