没有评估就没有成长——Agent 如何客观度量自身能力、对比基线、验证升级,并建立可量化的自我评估闭环。
Agent 评估 = 用可量化的基准(Benchmarks)、轨迹追踪(Traces)与门禁检查(Gates),客观判定 Agent 能力水平,并驱动自我改进。 没有评估,Agent 无法回答三个基本问题:我现在多强?我升级后变强了吗?我哪里最弱?
① 天枢 readiness 加权评分(ws 40% + poll 25% + completion 25% + hermes 10%)——平台已在做"Agent 健康评估";② 质量评分引擎(trial_quality + hollow_penalty)——对任务输出做质量门禁;③ 知微能力基线评估(605/1000 → 700/1000,对标豆包 10 维度)——自我评估实例。但:平台评估偏"健康度",缺"能力水平"评估;AI 自评偏乐观,需外部基准对抗。
| 层 | 评估什么 | 方法 | 实例 |
|---|---|---|---|
| ① 基准层 | 通用能力(推理/工具/记忆) | Benchmarks:SWE-bench / AgentBench / GAIA / τ-bench | lm-eval-harness 评测化 |
| ② 轨迹层 | 任务执行质量 | Trace 追踪:每步动作/结果/耗时 + 成功率 + 错误类型 | 天枢 task-runs + trial_quality |
| ③ 门禁层 | 交付质量 | Gates:门禁检查(语法/测试/curl 验证/证据链) | 天工 Graph 14 节点 / 玄机门禁 |
| 维度 | 基线 | 目标 | 方法 |
|---|---|---|---|
| 方法论 | 60 | 90 | 裁定表+门禁表+三维评分 |
| 规模深度 | 50 | 85 | 6000字→2万字/8项实测 |
| 持续进化 | 55 | 90 | 每周对标打分 |
| 总基线 | 605 | 700(2周)→800(1月) | 10 维度周评 |
readiness = ws 40% + poll 25% + completion 25% + hermes 10%——平台级 Agent 健康评估标准。知微状态:🟡degraded 65 分(2026-07-06)→ 需持续回满。
| 步 | 动作 | 工具 | 失败模式 |
|---|---|---|---|
| ① 定义基线 | 明确当前能力水平(分数/维度) | 能力基线评估表 | 无基线=无对比 |
| ② 设定目标 | 可量化的升级目标 | 每周重评 10 维度 | 目标虚泛不可测 |
| ③ 执行升级 | 学习+练习+实战 | 专题学习路径 | 只学不做=空心 |
| ④ 独立测评 | 外部视角验证(评审/实测/门禁) | 全量端点测试/验收门禁表 | 自评虚高 |
| ⑤ 差距分析 | 定位最弱维度 | 评分对比/错误案例 | 掩盖短板 |
| ⑥ 调整方向 | 重排学习优先级 | 成长路径更新 | 路径僵化 |
| 概念 | 含义 | 关联专题 |
|---|---|---|
| Evals | Agent 评估方法论(Anthropic) | 本专题 S3 |
| Benchmark | 标准化能力基准(SWE-bench 等) | lm-eval-harness |
| Trace | 执行轨迹追踪与回放 | 可观测性 |
| Gate | 交付门禁检查 | 约束工程 |
| 能力基线 | Agent 能力量化起点 | 对标分析 |
| SLO | 服务水平目标(红线) | 可观测性 |
| 质量评分 | trial_quality + hollow_penalty | 成长操作系统 |
| 评估基准 | 多维度对比参照系 | 多AI对标 |