让AI调用工具、调用能力、调用知识的工程学科 · 从Tool Use到MCP协议的标准演进
Skill = Tool + Knowledge + Capability + Interface + MCP Protocol
以下数据由天眼查工商数据库实时核验,补充专题页已有的公开信息,确保主体真实性。
| 项目 | 内容 |
|---|---|
| 统一社会信用代码 | 91360122MA35G2WM3C |
| 法定代表人 | 罗军 |
| 注册资本 | 15206.48万人民币 |
| 实缴资本 | 15206.48万人民币 |
| 成立日期 | 2015-12-24 |
| 经营状态 | 存续 |
| 企业类型 | 其他有限责任公司 |
| 行业 | 批发业 |
| 注册地址 | 江西省南昌市新建区长堎镇子实路1589号2栋 |
| 核准日期 | 2023-11-16 |
| 参保人数 | 50-99人 |
| 股东名称 | 持股比例 | 认缴出资 |
|---|---|---|
| 江西科骏技术有限公司 | 65.7614% | 10000万元人民币 |
| 江西新建经开区产业投资集团有限公司 | 24.3227% | 3698.63万元人民币 |
| 深圳国腾安职业教育科技有限公司 | 9.9158% | 1507.85万元人民币 |
数据来源:天眼查(tianyancha.com)工商公示数据,查询时间 2026-08-25。专题页原有内容(招股书/新闻/调研)不受影响,本卡仅补充权威工商核验维度。若与本页其他来源冲突,以天眼查工商登记为准。
Skill Engineering(技能工程):让AI能够发现、调用、组合、复用外部能力(工具、知识、API)的系统工程。 核心问题:如何让AI高效地使用工具,以及如何让工具被AI理解和使用。 从早期的Tool Use到2024年MCP协议的发布,Skill Engineering正在走向标准化。
LLM-based Agent
AI应用(Claude Desktop等)
协议客户端(轻量)
工具提供者(可扩展)
Filesystem, API, DB...
从自然语言理解用户意图,找到最合适的工具
MCP标准协议,JSON-RPC 2.0,工具描述Schema
多个工具组合完成复杂任务,依赖图编排
权限控制、危险操作拦截、OpenSkillRisk基准
DynamicMCPBench,真实MCP服务器上的效果评估
安装、更新、版本管理、发现与共享
Microsoft/NJU: ChatGPT作为编排器,连接HuggingFace上数百个AI模型。展示了多模型协作的可行性
ToolBench: 工具学习的benchmark。ReAct: 推理+行动交织,工具调用成为Agent的核心能力
OpenAI引入Function Calling API,将工具调用标准化为函数调用,这是现代Tool Use的事实标准
Anthropic发布Model Context Protocol,将工具接口标准化。Claude Desktop率先支持,开创生态互操作
arXiv:2607.20531 — 首个在真实MCP服务器上评估Agent的benchmark,解决了"ground truth固定工具列表"的局限性
背景:LLM在计算、查日历、搜索等任务上不如专用工具。如何让LLM学会调用外部工具?
核心方法:
核心价值:开启了"LLM + 工具"的研究热潮,证明了LLM可以通过API调用扩展能力。
背景:HuggingFace上有数百个AI模型(图像、语音、文本等),如何让LLM有效地编排这些模型完成复杂任务?
核心方法(Graph结构):
核心洞察:当工具数量爆炸,核心问题变成如何在众多工具中找到合适的并正确编排——图结构天然适合。
背景:工具调用需要标准化——不同模型、不同框架需要统一接口。
核心方法:
影响:成为Tool Use的事实标准,被广泛借鉴和采用。
背景:每个AI模型-工具组合都需要单独适配,没有互操作性。Anthropic提出了MCP来解决这个问题。
核心方法:
生态:已有Filesystem、Github、Slack、Puppeteer等开源MCP Server实现。
背景:现有benchmark评估工具调用时,给定固定的"ground truth工具列表"。但真实MCP服务器是live和stateful的——数据随时间变化,工具行为也变化。
核心创新:
核心价值:将工具评估从"离线固定测试"推向"在线动态评估"。
背景:LLM-based Agent使用大量第三方Skill(工具/API)。这些Skill可能包含隐藏的安全风险——看似无害的Skill在实际执行时可能产生危险行为。
核心问题:
核心价值:首个系统性地研究第三方Skill安全风险的基准,推动Skill Engineering进入安全考量时代。
背景:AI编程助手(如Cursor、Copilot)如何让开发者发现和复用团队积累的技能(工作流、工具链)?
核心实践:
核心洞察:Skill Engineering的成熟不仅需要协议标准化,还需要开发者体验的优化。
将能力抽象为Skill:输入/输出定义、错误处理、权限要求。 遵循MCP协议标准,用JSON Schema定义工具描述。 关键问题:这个Skill的原子性如何?应该独立还是组合?
当Agent收到任务时,需要从众多Skill中找到最合适的。 方法:自然语言意图匹配(Embedding相似度)、ToolBench评估、函数签名匹配。 对于复杂任务,可能需要多跳发现:先找到一个工具,再用它获取更多信息。
按照MCP协议构造请求 → 调用MCP Server → 处理响应。 关键:参数校验(Agent可能传错参数)、错误处理(超时、网络错误、无权访问)、结果解析。
参考OpenSkillRisk方法:对每个Skill进行安全风险评估(描述与行为一致性、权限范围、副作用)。 关键Skill需要人工审核;普通Skill可自动扫描明显风险。
用DynamicMCPBench等基准测试真实环境中的效果。 监控生产环境中的Skill调用成功率、延迟、错误类型。 根据监控结果优化Skill接口或替换底层实现。
| 陷阱类型 | 描述 | 解决方向 |
|---|---|---|
| Skill过于原子化 | 将Skill切分过细,导致组合爆炸,Agent需要调用几十个Skill才能完成简单任务 | 设计适当粒度的Skill,保留常用组合作为复合Skill |
| Skill描述模糊 | Agent无法准确理解何时应该调用某个Skill,导致误用或漏用 | 提供详细的功能描述、输入输出示例、适用场景说明 |
| 第三方Skill安全风险 | OpenSkillRisk揭示的:Skill描述无害但执行时危险 | 沙箱执行环境、最小权限原则、执行前安全扫描 |
| 版本碎片化 | 不同Agent使用了不同版本的同一Skill,行为不一致 | MCP协议中的版本协商机制,统一版本管理 |
| 评估与真实环境脱节 | benchmark评估用固定ground truth,无法反映真实MCP服务器的动态性 | 使用DynamicMCPBench进行live环境评估 |
MCP之前是各自为战的工具适配,MCP之后是协议驱动的生态互操作。这是Skill Engineering成熟的标志。
OpenSkillRisk揭示:第三方Skill的安全风险尚未被系统性解决。这将在2025-2026成为焦点。
DynamicMCPBench的核心洞察:静态benchmark无法评估真实环境。Live评估是方向。
HuggingGPT证明:当Skill数量大时,图结构(依赖、组合关系)比列表更适合组织和发现。
Toolformer → Function Calling → MCP,技术演进的方向是统一的:让工具成为AI可调用的技能单元。
Matt Pocock的实践揭示:Skill Engineering的普及不仅需要协议,还需要好的开发者体验。
• Schick et al. (2023). Toolformer: Language Models Can Teach Themselves to Use Tools. arXiv:2302.04761
• Shen et al. (2023). HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face. arXiv:2303.17580
• OpenAI Function Calling: platform.openai.com/docs/guides/function-calling
• Anthropic MCP: github.com/modelcontextprotocol (Model Context Protocol Specification)
• Kamiński et al. (2025). DynamicMCPBench: A Trace-Grounded Benchmark for LLM Agents over Live MCP Servers. arXiv:2607.20531
• Liu et al. (2025). OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills. arXiv:2607.20121
• Total TypeScript / Matt Pocock: Skill-based Development Resources
以下国际领先的理论框架为本专题提供分析基础和决策参考。
新兴技术经历5个阶段:技术触发→期望膨胀峰值→幻灭低谷→启蒙爬升→生产力高原。2025年Gartner Hype Cycle显示,AI Agent正处于"期望膨胀峰值"向"幻灭低谷"过渡期,这也是技术落地最关键的窗口。
技术的性能提升遵循S形曲线:初期缓慢→加速期→成熟期→极限。当一条S曲线趋于平缓,新的S曲线从不连续点浮现。AI多智能体系统的能力演进正处于加速期,预计2025-2028年达到第一个性能拐点。
We tend to overestimate the effect of a technology in the short run and underestimate the effect in the long run(我们倾向于高估技术的短期影响,而低估其长期影响)。当前对AI Agent的热炒和质疑完美印证Amara's Law——短期期望过高,长期影响被低估。
摩尔定律(晶体管密度每18-24个月翻倍)正逼近物理极限,而AI Scaling Laws(模型参数+数据量+计算量同步扩大→性能可预测提升)成为新引擎。NVIDIA GPU从A100到H100到B200的算力增长(3年间约4倍),直接驱动了Multi-Agent时代的到来。