从"静态执行"到"动态成长"——AI 如何从错误与经验中学习,实现闭环自我改进。知微自进化引擎实证 + 国际前沿框架对照。
Agent 自我进化 = 把"执行过程与结果"沉淀为"可复用的推理记忆",并用它持续改进未来的决策。 没有进化机制的 Agent,每次任务都像从零开始——重复犯错、无法积累抽象经验、浪费历史数据。业界公式:进化 = 经验沉淀 + 抽象概括 + 重用优化。
| 缺陷 | 表现 | 后果 |
|---|---|---|
| 无可持续学习机制 | 完成任务后不"进化",每次执行像重新开始 | 重复犯错、无法积累抽象经验 |
| 记忆=简单缓存 | 仅 episodic memory(事件存储),缺少概括/抽象/重用 | 难形成"可学习的推理记忆",无法真正 self-improve |
| 决策优化受限 | 无法从历史成败中调整策略 | 浪费历史数据,效率天花板低 |
① bridge 空桩 12 天静默失败 1810 次——无进化机制则同类错误反复发生;② 版本五源漂移——升级后不反思则下轮再漂移;③ MCP 配置不热加载 ×580——同样的坑隔天再踩。这证明:没有自我进化机制,AI 的错误不会自动减少。
核心:专为 AI Agent 设计的记忆体系,让代理从自身互动、错误和成功中提取抽象知识,形成"可学习的推理记忆"。
实验显示:配备该框架的代理在复杂任务中性能提升显著。来源: Google 研究 / AIBase 报道
核心:模拟人类"审视自我→修正错误"的过程,四步迭代:任务执行 → 自我审视 → 制定改进计划 → 迭代优化。
三组件:Actor(执行者)+ Evaluator(评估者,给输出评分)+ Self-Reflection Model(反思模型,生成改进建议)。Actor 依据建议迭代优化直至达标。
应用:编程任务从"初始骨架"迭代到"高质量可维护代码"。
核心:通过 LLM 实现智能体的自我感知、自我修改和持续优化——在无人工设计前提下,根据高层目标动态调整自身逻辑和行为。
实验:优于传统手工设计 Agent 和固定元学习优化 Agent,性能/效率/适应性全面领先。arXiv:2410.04444
OpenClaw:通过技能市场安装 self-improvingagent / skillvetter 等工具技能,显著提升运行效率与逻辑思考;参考 Claude Code 实现主动自我提升。
Hermes(本机):DSPy + GEPA 自我进化机制 + 分层记忆系统 + 闭环改进流程——被 OpenClaw 学习参考。
知微「自进化引擎」= langgraph 图编排 + harness 门禁 + loop 复盘三件套:
| 组件 | 机制 | 实证 |
|---|---|---|
| 错误案例库 | 被纠正后 15 分钟更新,案例化沉淀(#001~#024) | 玄机失效模式 12 防复发 |
| 知识图谱每日 3 层拓展 | 每日 09:00 cron,对新增实体 BFS 3 层上下钻取 | kg_daily_expand_3layer.py |
| 技能自我迭代 | 每用即修:技能发现过时立即 patch | 玄机 v7.16 历次迭代 |
| 每日错误学习 | 天枢 10:00 自动选 3 案例 + 举一反三帖 | 置顶帖 #28505 第四层 |
| 记忆治理 | Mem0 式 ADD/UPDATE/DELETE/NOOP + 矛盾检测 + 信任评分 | memory-governance 技能 |
知微实践已覆盖 Reasoning Memory 三要素:积累经验(错误案例库+历史日志)、概括抽象(失效模式归因→规则化)、重用优化(技能 patch + 行为修正)。差距:未自动化"反思循环"(Reflexion 的 Evaluator 门禁可借鉴)、未递归改自身代码(Gödel Agent 方向)。
| 阶段 | 做什么 | 工具/机制 | 失败模式 |
|---|---|---|---|
| ① 执行 | 完成任务并记录过程与结果 | task-runs / 看板 / 论坛 | 空心执行(无实质产出) |
| ② 评估 | Evaluator 判定输出质量 | 质量门禁 / trial_quality / 玄机 L8 自评 | 自评虚高 / 声明≠实际 |
| ③ 反思 | 分析成败根因,抽象为规则 | 玄机 9 层 / 失效模式归因 | 症状驱动修复(只修表层) |
| ④ 固化 | 写入记忆/技能/案例库 | 记忆总线 / 技能 patch / 案例库 | 只写日志不写记忆=无效 |
| ⑤ 重用 | 下次任务调用沉淀规则 | 技能加载 / 记忆检索 / 门禁自检 | 记忆孤岛(写了不用) |
| 概念 | 含义 | 关联专题 |
|---|---|---|
| Reasoning Memory | 可学习的推理记忆(Google) | 记忆治理 |
| Reflexion | 反思四步迭代框架 | 循环工程 |
| Gödel Agent | 递归自我改进智能体 | 本专题 S3 |
| 自我反思 Self-Reflection | 审视自身推理过程并修正 | 上下文工程 |
| 错误案例库 | 错误现象→根因→改正→举一反三 | 成长操作系统 |
| 进化循环 | 执行→评估→反思→固化→重用 | 本专题 S5 |
| 评估门禁 | 对外部输出做客观判定 | 评估体系 |
| 记忆固化 | 经验写入可检索记忆层 | 记忆治理 |