🛠️ 知微专题 · AI工程方法论

Skill Engineering
技能工程

让AI调用工具、调用能力、调用知识的工程学科 · 从Tool Use到MCP协议的标准演进
Skill = Tool + Knowledge + Capability + Interface + MCP Protocol

7大顶级案例
2022-2026完整演进脉络
天枢AI深度学习专题
技能即能力单元 · 接口即标准
Skill Engineering = Tool Use + Knowledge Binding + Capability Interface + Skill Discovery + Skill Composition
2022
Toolformer
2024
MCP协议发布
2025
DynamicMCPBench
1000+
HuggingFace工具

🔍 天眼查权威核验 数据来源: 天眼查(tianyancha.com)· tyc-verified 2026-08-25

工商登记信息

以下数据由天眼查工商数据库实时核验,补充专题页已有的公开信息,确保主体真实性。

项目内容
统一社会信用代码91360122MA35G2WM3C
法定代表人罗军
注册资本15206.48万人民币
实缴资本15206.48万人民币
成立日期2015-12-24
经营状态存续
企业类型其他有限责任公司
行业批发业
注册地址江西省南昌市新建区长堎镇子实路1589号2栋
核准日期2023-11-16
参保人数50-99人

🏛 主要股东(天眼查)

股东名称持股比例认缴出资
江西科骏技术有限公司65.7614%10000万元人民币
江西新建经开区产业投资集团有限公司24.3227%3698.63万元人民币
深圳国腾安职业教育科技有限公司9.9158%1507.85万元人民币

⚠ 天眼风险总览

  • [警示] 法院公告:该公司的高管罗军被起诉的法院公告(关联: 罗军)
  • [警示] 开庭公告:该公司的高管罗军被起诉的开庭公告(关联: 罗军)
  • [高风险] 限制消费令:该公司投资的南昌科骏置业开发有限公司被法院列为限制高消费企业(关联: 南昌科骏置业开发有限公司)
  • [警示] 股权出质:该公司的股东江西科骏技术有限公司的部分股权处于出质状态(关联: 江西科骏技术有限公司)
  • [警示] 开庭公告:该公司的股东江西新建经开区产业投资集团有限公司起诉他人或公司的开庭公告(关联: 江西新建经开区产业投资集团有限公司、深圳国腾安职业教育科技有限公司、江西科骏实业有限公司深圳分公司)
  • [警示] 裁判文书:该公司的股东江西新建经开区产业投资集团有限公司曾因民间借贷纠纷而起诉他人或公司(关联: 江西新建经开区产业投资集团有限公司)
  • [警示] 法院公告:该公司的股东江西新建经开区产业投资集团有限公司被公告内容提及的法院公告(关联: 江西新建经开区产业投资集团有限公司、深圳国腾安职业教育科技有限公司、南昌科骏置业开发有限公司)
  • [警示] 送达公告:该公司的股东深圳国腾安职业教育科技有限公司起诉他人或公司的送达公告(关联: 深圳国腾安职业教育科技有限公司、南昌科骏置业开发有限公司)
  • [警示] 立案信息:该公司投资的南昌科骏置业开发有限公司被起诉的立案信息(关联: 南昌科骏置业开发有限公司、江西新建经开区产业投资集团有限公司)

数据说明

数据来源:天眼查(tianyancha.com)工商公示数据,查询时间 2026-08-25。专题页原有内容(招股书/新闻/调研)不受影响,本卡仅补充权威工商核验维度。若与本页其他来源冲突,以天眼查工商登记为准。

01

第一性原理 · First Principles

🎯 核心定义

Skill Engineering(技能工程):让AI能够发现、调用、组合、复用外部能力(工具、知识、API)的系统工程。 核心问题:如何让AI高效地使用工具,以及如何让工具被AI理解和使用。 从早期的Tool Use到2024年MCP协议的发布,Skill Engineering正在走向标准化。

工具是AI能力的延伸。好的Skill Engineering让AI能像人类一样使用工具——发现问题、选择工具、执行操作、评估结果、迭代改进。 MCP协议的出现标志着这一领域从"各自为战"走向"标准化互操作"。

🔌 MCP协议架构(Anthropic, 2024)

🤖 AI Agent

LLM-based Agent

📡 MCP Host

AI应用(Claude Desktop等)

🔌 MCP Client

协议客户端(轻量)

🖥️ MCP Server

工具提供者(可扩展)

🛠️ Local/Remote Tools

Filesystem, API, DB...

MCP核心价值:一次开发,处处运行。任何MCP Server实现一次协议,任何MCP Client即可连接,无需为每个工具-模型组合单独适配。

🏗️ Skill Engineering架构

Skill Engineering = 发现 × 调用 × 组合 × 安全 × 协议

🔍 Skill Discovery

从自然语言理解用户意图,找到最合适的工具

📋 Skill Interface

MCP标准协议,JSON-RPC 2.0,工具描述Schema

🔗 Skill Composition

多个工具组合完成复杂任务,依赖图编排

🛡️ Skill Safety

权限控制、危险操作拦截、OpenSkillRisk基准

📊 Skill Evaluation

DynamicMCPBench,真实MCP服务器上的效果评估

🔄 Skill Lifecycle

安装、更新、版本管理、发现与共享

📅 演进时间线

2022.03 · Toolformer

工具学习起点

Meta提出让LLM调用外部工具(计算器、搜索引擎、日历等),arXiv:2302.04761。开启了"LLM+工具"研究热潮

2023.03 · HuggingGPT

LLM编排AI模型生态

Microsoft/NJU: ChatGPT作为编排器,连接HuggingFace上数百个AI模型。展示了多模型协作的可行性

2023.06 · ToolBench / ReAct

工具学习的系统化

ToolBench: 工具学习的benchmark。ReAct: 推理+行动交织,工具调用成为Agent的核心能力

2023.11 · GPT-4V + Function Calling

Function Calling标准化

OpenAI引入Function Calling API,将工具调用标准化为函数调用,这是现代Tool Use的事实标准

2024.11 · Anthropic MCP

MCP协议发布

Anthropic发布Model Context Protocol,将工具接口标准化。Claude Desktop率先支持,开创生态互操作

2025 · DynamicMCPBench

Live MCP评估

arXiv:2607.20531 — 首个在真实MCP服务器上评估Agent的benchmark,解决了"ground truth固定工具列表"的局限性

2025 · OpenSkillRisk

Skill安全评估

arXiv:2607.20121 — 第三方Skill引入的安全风险,Skill可能包含隐藏的安全隐患

02

成功案例 · Top Cases

🔧
ToolformerMeta AI · 2023 · arXiv:2302.04761
工具学习起点 · 自监督 · API调用

背景:LLM在计算、查日历、搜索等任务上不如专用工具。如何让LLM学会调用外部工具?

核心方法:

  • 自监督学习:让LLM在大量无标注数据中学习何时、如何调用工具
  • 工具包括:计算器、搜索引擎、翻译API、日历、文件系统等
  • 每个工具定义为API格式:名称、描述、参数、返回值
  • 模型学习决定:是否调用、调用哪个、传入什么参数

核心价值:开启了"LLM + 工具"的研究热潮,证明了LLM可以通过API调用扩展能力。

Self-Supervised API Call External Tools
🤗
HuggingGPTMicrosoft/NJU · 2023 · arXiv:2303.17580
多模型编排 · 工具图 · 4步Pipeline

背景:HuggingFace上有数百个AI模型(图像、语音、文本等),如何让LLM有效地编排这些模型完成复杂任务?

核心方法(Graph结构):

  • 节点:AI模型(功能描述)
  • 边:依赖关系、兼容性、数据流
  • 四步Pipeline:任务规划 → 模型选择 → 任务执行 → 响应汇总
  • ChatGPT解析用户请求 → 在模型图上搜索最合适的模型 → 动态构建执行图

核心洞察:当工具数量爆炸,核心问题变成如何在众多工具中找到合适的并正确编排——图结构天然适合。

Tool Graph Multi-modal Model Orchestration
📞
GPT-4 Function CallingOpenAI · 2023 · Function Calling API
事实标准 · 工业级 · 广泛采用

背景:工具调用需要标准化——不同模型、不同框架需要统一接口。

核心方法:

  • 将工具定义为Function对象:名称、描述、参数JSON Schema
  • LLM输出函数调用(而非文本),格式标准化
  • 支持并行调用(一个请求中调用多个函数)
  • 与JSON Mode配合,确保输出结构化

影响:成为Tool Use的事实标准,被广泛借鉴和采用。

Standard API Function Call Industry Standard
🔌
Model Context Protocol (MCP)Anthropic · 2024 · github.com/modelcontextprotocol
协议标准化 · 生态互操作 · 开源

背景:每个AI模型-工具组合都需要单独适配,没有互操作性。Anthropic提出了MCP来解决这个问题。

核心方法:

  • Transport层:支持stdio和HTTP+SSE两种传输方式
  • JSON-RPC 2.0:请求/响应/通知三种消息类型
  • 工具描述协议:标准化的工具发现、调用、结果返回机制
  • 资源系统:除了工具,还能访问文件和数据库
  • Prompt模板:服务器可提供可复用的Prompt片段

生态:已有Filesystem、Github、Slack、Puppeteer等开源MCP Server实现。

Protocol Open Source Interoperability Ecosystem
📊
DynamicMCPBenchKamiński et al. · 2025 · arXiv:2607.20531
Live MCP评估 · 真实服务器 · 2025最新

背景:现有benchmark评估工具调用时,给定固定的"ground truth工具列表"。但真实MCP服务器是live和stateful的——数据随时间变化,工具行为也变化。

核心创新:

  • 首个在真实运行的MCP服务器上评估Agent的benchmark
  • 任务会随服务器状态变化,评估Agent的动态适应能力
  • 评分基于实际效果而非固定ground truth
  • 揭示了现有benchmark的脆弱性:无法捕捉真实环境的复杂性

核心价值:将工具评估从"离线固定测试"推向"在线动态评估"。

Live Evaluation Stateful 2025
⚠️
OpenSkillRiskLiu et al. · 2025 · arXiv:2607.20121
Skill安全 · 第三方风险 · 2025最新

背景:LLM-based Agent使用大量第三方Skill(工具/API)。这些Skill可能包含隐藏的安全风险——看似无害的Skill在实际执行时可能产生危险行为。

核心问题:

  • 描述与行为不一致:Skill的描述听起来无害,但实际调用时会产生危险副作用
  • 组合放大风险:多个无害Skill组合后可能产生危险结果
  • 动态风险:Skill在调用前无法完全评估,只能在执行时发现

核心价值:首个系统性地研究第三方Skill安全风险的基准,推动Skill Engineering进入安全考量时代。

Security Third-party Risk Safety 2025
Skill-Based Development (Matt Pocock)Total TypeScript / 2024
工程实践 · DX优化 · Skill SDK

背景:AI编程助手(如Cursor、Copilot)如何让开发者发现和复用团队积累的技能(工作流、工具链)?

核心实践:

  • Skill作为可复用单元:每个Skill有输入/输出定义,可被AI理解和调用
  • Skill发现机制:AI能根据任务描述自动找到合适的Skill
  • Skill组合:多个Skill可以组合成更复杂的workflow
  • 开发者体验(DX):Skill的定义和调试应该对开发者友好

核心洞察:Skill Engineering的成熟不仅需要协议标准化,还需要开发者体验的优化。

Developer Experience SDK Workflow
03

方法论 · 操作步骤

Step 1: 技能建模与接口设计

将能力抽象为Skill:输入/输出定义、错误处理、权限要求。 遵循MCP协议标准,用JSON Schema定义工具描述。 关键问题:这个Skill的原子性如何?应该独立还是组合?

Step 2: Skill发现与选择

当Agent收到任务时,需要从众多Skill中找到最合适的。 方法:自然语言意图匹配(Embedding相似度)、ToolBench评估、函数签名匹配。 对于复杂任务,可能需要多跳发现:先找到一个工具,再用它获取更多信息。

Step 3: Skill调用与执行

按照MCP协议构造请求 → 调用MCP Server → 处理响应。 关键:参数校验(Agent可能传错参数)、错误处理(超时、网络错误、无权访问)、结果解析。

Step 4: Skill安全审计

参考OpenSkillRisk方法:对每个Skill进行安全风险评估(描述与行为一致性、权限范围、副作用)。 关键Skill需要人工审核;普通Skill可自动扫描明显风险。

Step 5: Skill评估与迭代

用DynamicMCPBench等基准测试真实环境中的效果。 监控生产环境中的Skill调用成功率、延迟、错误类型。 根据监控结果优化Skill接口或替换底层实现。

04

常见陷阱 · Pitfalls

陷阱类型描述解决方向
Skill过于原子化 将Skill切分过细,导致组合爆炸,Agent需要调用几十个Skill才能完成简单任务 设计适当粒度的Skill,保留常用组合作为复合Skill
Skill描述模糊 Agent无法准确理解何时应该调用某个Skill,导致误用或漏用 提供详细的功能描述、输入输出示例、适用场景说明
第三方Skill安全风险 OpenSkillRisk揭示的:Skill描述无害但执行时危险 沙箱执行环境、最小权限原则、执行前安全扫描
版本碎片化 不同Agent使用了不同版本的同一Skill,行为不一致 MCP协议中的版本协商机制,统一版本管理
评估与真实环境脱节 benchmark评估用固定ground truth,无法反映真实MCP服务器的动态性 使用DynamicMCPBench进行live环境评估
05

关键洞察 · Key Insights

🔌 MCP是Skill Engineering的分水岭

MCP之前是各自为战的工具适配,MCP之后是协议驱动的生态互操作。这是Skill Engineering成熟的标志。

⚠️ 安全是Skill Engineering的盲点

OpenSkillRisk揭示:第三方Skill的安全风险尚未被系统性解决。这将在2025-2026成为焦点。

📊 评估需要动态化

DynamicMCPBench的核心洞察:静态benchmark无法评估真实环境。Live评估是方向。

🔗 Skill Graph > Skill List

HuggingGPT证明:当Skill数量大时,图结构(依赖、组合关系)比列表更适合组织和发现。

🛠️ 工具即Skill,Skill即工具

Toolformer → Function Calling → MCP,技术演进的方向是统一的:让工具成为AI可调用的技能单元。

📦 DX决定采用率

Matt Pocock的实践揭示:Skill Engineering的普及不仅需要协议,还需要好的开发者体验。

REF

参考资料

• Schick et al. (2023). Toolformer: Language Models Can Teach Themselves to Use Tools. arXiv:2302.04761

• Shen et al. (2023). HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face. arXiv:2303.17580

• OpenAI Function Calling: platform.openai.com/docs/guides/function-calling

• Anthropic MCP: github.com/modelcontextprotocol (Model Context Protocol Specification)

• Kamiński et al. (2025). DynamicMCPBench: A Trace-Grounded Benchmark for LLM Agents over Live MCP Servers. arXiv:2607.20531

• Liu et al. (2025). OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills. arXiv:2607.20121

• Total TypeScript / Matt Pocock: Skill-based Development Resources

国际理论对标

以下国际领先的理论框架为本专题提供分析基础和决策参考。

1. Gartner Hype Cycle 技术成熟度曲线

Gartner, Inc. | Gartner Research | 1995-present (Annual)

新兴技术经历5个阶段:技术触发→期望膨胀峰值→幻灭低谷→启蒙爬升→生产力高原。2025年Gartner Hype Cycle显示,AI Agent正处于"期望膨胀峰值"向"幻灭低谷"过渡期,这也是技术落地最关键的窗口。

2. Technology S-Curve 技术S曲线理论

McKinsey & Company | Richard N. Foster | 1986 (Innovation: The Attacker's Advantage)

技术的性能提升遵循S形曲线:初期缓慢→加速期→成熟期→极限。当一条S曲线趋于平缓,新的S曲线从不连续点浮现。AI多智能体系统的能力演进正处于加速期,预计2025-2028年达到第一个性能拐点。

3. Amara's Law 阿马拉定律

Institute for the Future (IFTF) | Roy Amara | 1972

We tend to overestimate the effect of a technology in the short run and underestimate the effect in the long run(我们倾向于高估技术的短期影响,而低估其长期影响)。当前对AI Agent的热炒和质疑完美印证Amara's Law——短期期望过高,长期影响被低估。

4. Moore's Law & AI Scaling Laws 摩尔定律与AI扩展律

Intel / Stanford / Berkeley | Gordon E. Moore / OpenAI / Anthropic | 1965 (Moore) / 2020-2024 (Scaling Laws)

摩尔定律(晶体管密度每18-24个月翻倍)正逼近物理极限,而AI Scaling Laws(模型参数+数据量+计算量同步扩大→性能可预测提升)成为新引擎。NVIDIA GPU从A100到H100到B200的算力增长(3年间约4倍),直接驱动了Multi-Agent时代的到来。