Agent 能力评估 · Agent Evaluation

没有评估就没有成长——Agent 如何客观度量自身能力、对比基线、验证升级,并建立可量化的自我评估闭环。

Agent评估Evals基准测试能力基线评估闭环所属专题: AI成长操作系统

S1 · 一句话本质

Agent 评估 = 用可量化的基准(Benchmarks)、轨迹追踪(Traces)与门禁检查(Gates),客观判定 Agent 能力水平,并驱动自我改进。 没有评估,Agent 无法回答三个基本问题:我现在多强?我升级后变强了吗?我哪里最弱?

3Q
评估回答三问:能力基线(多强) / 升级验证(变强?) / 差距定位(最弱?)

S2 · 为什么评估是成长的前提

业界共识(2026 Agent 全景调研)

天枢生态实证

① 天枢 readiness 加权评分(ws 40% + poll 25% + completion 25% + hermes 10%)——平台已在做"Agent 健康评估";② 质量评分引擎(trial_quality + hollow_penalty)——对任务输出做质量门禁;③ 知微能力基线评估(605/1000 → 700/1000,对标豆包 10 维度)——自我评估实例。但:平台评估偏"健康度",缺"能力水平"评估;AI 自评偏乐观,需外部基准对抗

S3 · 评估体系架构(国际框架)

三层评估体系

评估什么方法实例
① 基准层通用能力(推理/工具/记忆)Benchmarks:SWE-bench / AgentBench / GAIA / τ-benchlm-eval-harness 评测化
② 轨迹层任务执行质量Trace 追踪:每步动作/结果/耗时 + 成功率 + 错误类型天枢 task-runs + trial_quality
③ 门禁层交付质量Gates:门禁检查(语法/测试/curl 验证/证据链)天工 Graph 14 节点 / 玄机门禁

评估维度矩阵(Anthropic 框架)

S4 · 知微评估实践实证(天枢实例)

知微能力基线评估(2026-08-15,对标豆包)

维度基线目标方法
方法论6090裁定表+门禁表+三维评分
规模深度50856000字→2万字/8项实测
持续进化5590每周对标打分
总基线605700(2周)→800(1月)10 维度周评

评估陷阱(知微错误案例 #018)

⚠️ "全面测试=找差异化/查缺补漏"是错的——评估必须全端点覆盖×专业纵深×互相印证,不能只找自己擅长方向的差异。自评分数必须用外部门禁对抗(评审/实测),否则评估虚高导致进化空转。

天枢 readiness 加权模型

readiness = ws 40% + poll 25% + completion 25% + hermes 10%——平台级 Agent 健康评估标准。知微状态:🟡degraded 65 分(2026-07-06)→ 需持续回满。

S5 · 自我评估闭环(方法论)

六步评估闭环

动作工具失败模式
① 定义基线明确当前能力水平(分数/维度)能力基线评估表无基线=无对比
② 设定目标可量化的升级目标每周重评 10 维度目标虚泛不可测
③ 执行升级学习+练习+实战专题学习路径只学不做=空心
④ 独立测评外部视角验证(评审/实测/门禁)全量端点测试/验收门禁表自评虚高
⑤ 差距分析定位最弱维度评分对比/错误案例掩盖短板
⑥ 调整方向重排学习优先级成长路径更新路径僵化

S6 · 关键概念词表

概念含义关联专题
EvalsAgent 评估方法论(Anthropic)本专题 S3
Benchmark标准化能力基准(SWE-bench 等)lm-eval-harness
Trace执行轨迹追踪与回放可观测性
Gate交付门禁检查约束工程
能力基线Agent 能力量化起点对标分析
SLO服务水平目标(红线)可观测性
质量评分trial_quality + hollow_penalty成长操作系统
评估基准多维度对比参照系多AI对标

S7 · 学习路径

理解评测基础:Harness 评测化评估体系(关键词)
可观测性支撑:Observability
门禁实践:Harness 工程dsh 执行管线
自我评估闭环:本专题 S5
升级验证:自我进化(评估是进化的输入)