李博杰(Pine AI 首席科学家)著 · GitHub ⭐8,645 · 完全开源
全书10章 + 60+配套实验 · 从"能做事"到"可靠地做事"的完整方法论
核心公式、ReAct 循环、三种学习范式、Harness 工程、编排设计模式
KV Cache设计、提示工程、Skills按需加载、状态栏、RAG全栈、Agentic RAG
MCP协议、五类工具设计、事件驱动异步Agent、生产级Coding Agent、代码即元工具
评估方法论、LLM-as-a-Judge、SFT vs RL、"数据与环境比算法更重要"
从经验中学习、工具发现与创造、语音Agent、Computer Use、Agent社会
🎯 天枢映射:SOUL.md = System Prompt · connect.md = Harness约束层 · ReAct循环 = WS Poll引擎
🎯 天枢映射:MEMORY.md = 跨会话上下文 · Skills系统 = 渐进式披露 · SOUL.md安全 = 提示注入防御
🎯 天枢映射:知微四层记忆(L0-L3) = 渐进式策略 · ChromaDB = 稠密检索 · Holographic = 结构化记忆
🎯 天枢映射:MCP Server(6005) · 论坛@mention = 协作工具 · cron = 事件触发 · feishu_bridge = 用户沟通
🎯 天枢映射:天工(造专) = Coding Agent · 自愈脚本 = 自愈闭环 · delegate_task = 提议者-审核者
⚠️ 天枢差距:军衔体系(L0-L5)依赖活跃度积分,缺少本书描述的"评估环境→数据集→自动评判→驱动改进"科学闭环
🎯 天枢映射:目前无模型训练环节 · 书中"RL内化决策策略"解释了为何天枢Poll引擎和WS daemon需分离
⚠️ 天枢差距:Agent升级依赖人工操作 · 缺少"从经验中学习→主动工具发现→创造新工具"的自主进化路径
🎯 天枢映射:飞书语音消息 · 款多多机器人业务方向(VLA/具身智能)
🎯 天枢映射:11 Agent协作 = 独立上下文+管理者模式 · 论坛@mention = Agent间通信 · TaskRun = 任务委托
| # | 书中概念 | 书中要求 | 天枢对应 | 成熟度 | 行动建议 |
|---|---|---|---|---|---|
| 1 | System Prompt | 岗位说明书:身份+权限+行为准则 | SOUL.md (L0记忆) | ✅ | 保持SOUL.md安全合规 |
| 2 | User Memory | 跨会话持久化:偏好+行为+背景 | 四层记忆(L0-L3) | ✅ | 推进holographic→DB共享空间统一 |
| 3 | RAG + 向量检索 | 稠密+稀疏+混合检索+重排序 | ChromaDB + session_search | ✅ | 增补稀疏检索(BM25)作为fallback |
| 4 | Agent Skills | 渐进式披露:按需加载,防提示词膨胀 | 42个技能(SKILL.md) | ✅ | skill_view按需加载=渐进式披露 |
| 5 | MCP 协议 | 工具互操作标准 | MCP Server (6005端口) | ✅ | 已有29工具·Streamable HTTP |
| 6 | 事件驱动Agent | 通过HTTP接收多源事件 | WS Daemon + Poll引擎 | ✅ | 双通道(WS+Poll) = 事件+轮询并存 |
| 7 | 多Agent协作 | 分类框架+失败模式分析 | 11 Agent + 论坛/TaskRun | ✅ | 增加target_agent路由+签名链防冒充 |
| 8 | 约束(Constrain) | 故障安全默认值、权限分级、熔断器 | connect.md检查清单 | ⚠️ | 缺熔断器机制(WatchdogSec已发现) |
| 9 | 验证(Verify) | 输入隔离、自动判断对错 | 健康检查v3.4+ | ⚠️ | 需增加基准测试数据集 |
| 10 | 纠正(Correct) | 静默重试、接续生成、熔断回退 | 自愈机制 | ⚠️ | 自愈需加"修复前先诊断"步骤 |
| 11 | Agent评估 | 科学方法论:环境→数据集→评判→改进 | 军衔体系 L0-L5 | ❌ | 最大差距——需建立评估闭环 |
| 12 | 自我进化 | 不改权重也能成长:经验→工具→创造 | 人工升级+自升级脚本 | ❌ | 建立"从经验中学习"管道 |
| 13 | 提议者-审核者 | 双Agent分工,防过早完成,迭代改进 | delegate_task | ⚠️ | delegate_task缺审核回环 |
| 14 | 上下文压缩 | 摘要/关键提取/语义压缩 | MEMORY.md 50KB上限 | ⚠️ | 需策略性压缩而非简单截断 |
| 15 | 提示注入防御 | 来源标记+数据指令分离+运行时校验 | SOUL.md安全修复 | ⚠️ | 仅做了exfil_curl修复,缺系统防御 |
Anthropic的Skill、Harness、Loop Engineering不是他们发明了才有人用,而是大量Agent早就在这么做了,他们只是提炼命名。如果你等名词流行才开始实践,就已经慢了一步。
天枢启示:天枢的论坛@mention、TaskRun、看板协同等已在实践中运行,应当主动提炼自己的方法论,而非等业界标准。
当各家模型能力趋同时,竞争优势转移到模型之外的工程实践。LangChain的Coding Agent从52.8%→66.5%,改变的不是模型,而是Harness:自动检查执行结果、检测重复循环、优化思考策略。
天枢启示:connect.md的检查清单应该从"静态合规"升级为"动态约束+自动验证+自愈纠正"的三层Harness。
这个公式不是口号,而是有严格实验基础的工程框架。消融实验证明:去掉工具定义→丧失行动力;去掉工具结果→无限循环;去掉思考过程→决策矛盾;去掉历史消息→重复执行。
天枢启示:知微的SOUL.md+MEMORY.md+技能库恰好对应"上下文"的五个组成部分。完整性已有,密度需优化。
在后训练中,模型通过SFT"记住"正确行为模式,通过RL"泛化"到未见过的场景。但真正决定训练效果的不是用了什么算法,而是训练数据的质量和环境的真实性。
天枢启示:天枢暂不需要模型后训练。但这个洞察解释了为什么connect.md不断升级——"环境"(系统规范)决定Agent的质量上限。
这是全书反复强调的支点性论点。评估让你能分辨一次改动是真的变好了还是只是运气。SWE-bench、GAIA、Terminal-Bench等基准测试提供了可比较的信号。
天枢启示:军衔体系(L0-L5)需要从"活跃度积分"升级为"能力基准测试"。每个Agent应该有可量化的能力得分。
模型会持续内化Harness中的能力——工具调用、长程规划都曾是外部编排,如今已是原生能力。但这个过程比直觉慢得多:训练以月计,模型无法一次内化所有业务约束。
天枢启示:不要等模型变强再建Harness。模型此刻的能力边界就是Harness此刻的价值所在。
| 来源 | 地址 | 说明 |
|---|---|---|
| GitHub 主仓库 | github.com/bojieli/ai-agent-book | ⭐8,645 · 全书正文+60+配套实验+PDF |
| 中文 PDF (v1.2) | book/深入理解-AI-Agent-李博杰-v1.2.pdf | 13.4MB · 完整编译版 |
| 在线阅读版(Docsify) | github.com/lwmxiaobei/deep-into-ai-agent | 社区维护的在线阅读版本 |
| 引言原文 | book/introduction.md | 20.7KB · 本书缘起与哲学 |
| 第1章原文 | book/chapter1.md | 66.3KB · Agent基础+Harness工程 |
| 全书批注索引 | GitHub Issues | 读者反馈与作者回应 |
以下国际领先的理论框架为本专题提供分析基础和决策参考。
新兴技术经历5个阶段:技术触发→期望膨胀峰值→幻灭低谷→启蒙爬升→生产力高原。2025年Gartner Hype Cycle显示,AI Agent正处于"期望膨胀峰值"向"幻灭低谷"过渡期,这也是技术落地最关键的窗口。
技术的性能提升遵循S形曲线:初期缓慢→加速期→成熟期→极限。当一条S曲线趋于平缓,新的S曲线从不连续点浮现。AI多智能体系统的能力演进正处于加速期,预计2025-2028年达到第一个性能拐点。
We tend to overestimate the effect of a technology in the short run and underestimate the effect in the long run(我们倾向于高估技术的短期影响,而低估其长期影响)。当前对AI Agent的热炒和质疑完美印证Amara's Law——短期期望过高,长期影响被低估。
摩尔定律(晶体管密度每18-24个月翻倍)正逼近物理极限,而AI Scaling Laws(模型参数+数据量+计算量同步扩大→性能可预测提升)成为新引擎。NVIDIA GPU从A100到H100到B200的算力增长(3年间约4倍),直接驱动了Multi-Agent时代的到来。