💡 知微专题 · AI工程方法论

Prompt Engineering
提示工程

让AI准确理解人类意图的核心工程学科 · 从Few-shot到自动优化的范式演进
Prompt = Task Decomposition + Pattern Selection + Example Engineering + Output Control

7大顶级案例
2022-2026完整演进脉络
天枢AI深度学习专题
提示即程序 · 工程即优化
Prompt不是自然语言提问,而是对AI行为的完整编程。优秀的Prompt Engineering是将认知科学、语言学知识编码为机器可执行指令的系统工程。
2022
Chain of Thought
15K+
CoT引用量
92%
PaLM+CoT GSM8K
2025
BayesPO自动优化

🔍 天眼查权威核验 数据来源: 天眼查(tianyancha.com)· tyc-verified 2026-08-25

工商登记信息

以下数据由天眼查工商数据库实时核验,补充专题页已有的公开信息,确保主体真实性。

项目内容
统一社会信用代码91310115350689047D
法定代表人盛锡传
注册资本9000万美元
实缴资本7641.02万美元
成立日期2015-08-25
经营状态存续
企业类型有限责任公司(港澳台法人独资)
行业专业技术服务业
注册地址上海市徐汇区虹漕路25-1号2层1285室
核准日期2024-11-27
参保人数小于50人

🏛 主要股东(天眼查)

股东名称持股比例认缴出资
Emotibot Technologies (Hong Kong) Limited100%9000万美元

⚠ 天眼风险总览

  • [高风险] 限制消费令:该公司投资的竹间智慧科技(北京)有限公司被法院列为限制高消费企业(关联: 竹间智慧科技(北京)有限公司、盛锡传)
  • [高风险] 终本案件:该公司投资的竹间智慧科技(北京)有限公司有终本案件信息(关联: 竹间智慧科技(北京)有限公司)
  • [警示] 股权冻结:该公司投资的竹间智能科技(广州)有限公司有股东的股权被冻结(关联: 竹间智能科技(广州)有限公司、竹间智能科技(深圳)有限公司、竹间智慧科技(北京)有限公司)

数据说明

数据来源:天眼查(tianyancha.com)工商公示数据,查询时间 2026-08-25。专题页原有内容(招股书/新闻/调研)不受影响,本卡仅补充权威工商核验维度。若与本页其他来源冲突,以天眼查工商登记为准。

01

第一性原理 · First Principles

🎯 核心定义

Prompt Engineering(提示工程):设计、优化prompt以有效控制LLM行为的系统工程。 核心目标是将人类意图准确转化为AI可执行的指令序列。 不是写好话求人,而是对AI的编程

提示词不是"问问题",而是"写程序"。好的prompt是完整的任务规范:输入是什么、输出是什么、中间步骤是什么、边界在哪里。2026年的提示工程已经从"技巧"演进为"科学"——有理论框架(BayesPO)、有系统方法论、有自动化工具。

📋 Prompt Pattern分类体系(Sooben & Syriani, 2026, arXiv:2607.00043

🎯 In-Context Definition

在prompt内部直接提供任务所需的全部定义和规则,而非依赖外部知识

"你是X领域的专家。请根据以下定义和规则回答:定义1... 规则A..."

🔗 Chain of Thought

要求模型输出中间推理步骤,将复杂问题分解为可验证的子步骤

"请分步骤解答:Step 1: 理解问题... Step 2: 分析... Step 3: 得出结论"

🧩 Role Assignment

通过角色定义激活模型中与该角色相关的知识和行为模式

"你是一位资深软件架构师,有15年+大型系统设计经验..."

📤 Output Format Control

精确指定输出格式:JSON Schema、XML标签、Markdown表格等结构化格式

"请以JSON格式返回:{"reasoning": "...", "answer": "...", "confidence": 0.95}"

⚠️ Constraint Specification

明确禁止的行为和边界条件,是Harness Engineering在prompt层面的实现

"注意:不要编造数据;对于不确定的信息,请明确说明"不知道""

🔄 Iterative Refinement

通过多轮对话逐步优化输出,每轮提供具体的改进方向

"上一版的不足:1)... 2)... 请重点改进这两点"

📅 演进时间线

2020 · GPT-3

Prompt作为Few-shot学习载体

GPT-3展示了在prompt中提供少量示例即可激活任务能力,但主要是手工设计

2022.01 · CoT

Chain of Thought —— 推理链提示

Google Brain/Stanford (arXiv:2201.11903)。要求模型输出中间步骤,PaLM 540B在GSM8K从57%→92%。引用15000+次

2022.03 · InstructGPT

RLHF对齐 —— 从外部反馈到模型权重

OpenAI (arXiv:2203.02155)。用人类偏好数据微调,让模型从内心理解"好回答"的标准

2022.12 · Constitutional AI

AI反馈替代人类标签

Anthropic (arXiv:2212.08073)。用AI自我批评替代部分人类标注,降低对齐成本

2023.03 · Self-Consistency

多路径推理投票

Google (arXiv:2203.11171)。生成多个推理路径,投票选择最一致的答案,进一步提升CoT效果

2023.05 · Tree of Thoughts

树状搜索推理

Princeton/NYU (arXiv:2305.10601)。将推理建模为树搜索,允许回溯和分支探索

2023.11 · DSPy

Prompt的编程语言抽象

Stanford提出。声明式模块化prompt编程,prompt模板与参数分离,支持自动优化

2024-2025 · 自动优化

BayesPO / EvoPrompt — 从手工到自动

BayesPO (arXiv:2607.16001): 贝叶斯优化prompt离散空间。EvoPrompt: 进化算法优化。Prompt工程进入自动化时代

02

成功案例 · Top Cases

⛓️
Chain of Thought PromptingGoogle Brain/Stanford · NeurIPS 2022 · arXiv:2201.11903
引用15000+次 · PaLM 57%→92% · 最具影响力Prompt技术

背景:LLM在复杂推理任务上性能远低于人类。研究者发现要求模型输出中间推理步骤后,性能大幅提升。

核心方法:

  • Few-shot示例中包含中间推理步骤,而非直接给答案
  • 每个中间步骤是对前一步的验证和修正机会
  • 不需要训练,无需改变模型权重,只需改变prompt格式
  • 扩展系谱:Zero-shot CoT → Self-Consistency → Tree of Thoughts

量化效果:

  • PaLM 540B + CoT: GSM8K 57% → 92%(超越大10倍的模型)
  • PaLM 540B + CoT: MATH 34% → 46%
  • GPT-3 + CoT: StrategyQA 56% → 65%
Few-shot Reasoning Intermediate Steps 15K+ Citations
🗳️
Self-ConsistencyGoogle Brain · ICLR 2023 · arXiv:2203.11171
多路径投票 · CoT最强扩展 · 推理一致性

背景:CoT生成单一推理路径,可能在某个错误步骤上"一条路走到黑"。Self-Consistency引入采样多样性。

核心方法:

  • temperature采样生成多条不同推理路径
  • 每条路径独立到达一个最终答案
  • 投票选择出现最频繁的答案(多数投票)
  • 与CoT互补:CoT提升单路径质量,Self-Consistency提升多路径覆盖

量化效果:在GSM8K上比CoT再提升3-5个百分点;在MATH上提升更显著。

Sampling Majority Vote Diversity
🌳
Tree of Thoughts (ToT)Princeton/NYU · NeurIPS 2023 · arXiv:2305.10601
树搜索推理 · Game of 24 84% · 创意写作

背景:CoT是线性链,ToT将其推广为树结构——每个节点是一个"思考状态",允许分支、回溯、评估。

核心方法:

  • 将问题分解为中间思考步骤(树的节点)
  • 每个节点可评估"好坏"(用LLM评估当前状态)
  • 通过BFS/DFS/Beam搜索有潜力的分支
  • 允许回溯——发现某条路走不通时返回上一步

量化效果:Game of 24任务从传统CoT的4%提升到ToT的84%

Tree Search Backtracking Game of 24
🔧
DSPyStanford NLP · 2023-2024
Prompt编程语言 · 声明式抽象 · 自动优化

背景:手工设计prompt是经验性的、不可复用的。当任务/模型/数据变化时需要重新手工调整。

核心方法:

  • 声明式抽象:定义"模块"(Signature)和"程序"(Pipeline),而非写死的prompt文本
  • Teleprompter:自动编译优化prompt参数(few-shot数量、指令措辞等)
  • 编译器:将高层任务描述编译为具体prompt,支持不同模型
  • 典型流程:声明任务签名 → 组合模块 → 编译器优化 → 得到最优prompt

核心价值:Prompt工程从"艺术"变为"工程"——可测量、可优化、可复用。

Programming Abstraction Auto-Optimization Module System
📊
BayesPOZhou et al. · ICML 2025 · arXiv:2607.16001
贝叶斯Prompt优化 · 概率推断 · 离散优化

背景:现有自动prompt优化依赖进化算法或纯梯度方法,缺乏对不确定性的系统性建模。BayesPO将贝叶斯优化引入离散prompt空间。

核心方法:

  • 将prompt视为离散变量,用贝叶斯方法建模"prompt → 性能"映射
  • 使用并行回火MCMC(Parallel-Tempered MCMC)在离散空间采样
  • 同时探索(不确定性高)和利用(预期性能高)的平衡
  • 不需要梯度,不依赖模型参数,支持黑盒LLM

核心创新:首个将概率推断系统性地引入Prompt优化的框架,填补了理论空白。

Bayesian Optimization Discrete Space MCMC 2025
🧬
EvoPromptChen et al. · 2024
进化算法 · LLM+LLM协同 · 自动优化

背景:进化算法在连续优化中表现优异,但离散prompt空间的进化一直没有系统验证。EvoPrompt填补了这一空白。

核心方法:

  • LLM作为进化算子(变异+交叉),而非手工设计
  • 初始化多个候选prompt → LLM变异生成新prompt → 评估 → 选择最优 → 迭代
  • 利用LLM的语言能力自动生成有意义的变异(改写、增强、组合)

效果:在多个基准上超过人工设计的prompt,接近BayesPO但计算效率更高。

Evolutionary Algorithm LLM-as-Evolution Auto-Optimization
📖
OpenAI Prompt Engineering GuideOpenAI · 2024-2025 · platform.openai.com
官方最佳实践 · 工业级指南 · 实用技巧

核心原则(OpenAI官方):

  • 写清楚指示:在prompt中说明想要什么、不要什么,提供足够背景
  • 给参考文本:RAG模式,让模型在给定参考资料范围内回答
  • 将复杂任务拆分为简单子任务:Pipeline模式,每个步骤一个prompt
  • 让模型"思考":先用CoT理解问题,再给出答案
  • 测试prompt的多个版本:迭代优化是核心方法
  • 系统prompt vs 用户prompt:系统prompt定义角色和约束,用户prompt定义具体任务
Best Practices Industrial Official
03

方法论 · 操作步骤

Step 1: 任务分解与模式选择

明确任务类型(推理/生成/分类/提取),选择对应的Prompt Pattern。 推理任务→CoT/ToT;生成任务→角色+约束;分类任务→定义+示例;提取任务→格式规范。 参考Sooben & Syriani (2026)的Pattern Taxonomy选择最合适模式。

Step 2: 构建Prompt骨架

包含:角色定义(可选)、任务描述(清晰具体)、输出格式(JSON/表格/段落)、约束条件(边界行为)。 System Prompt定义长期约束,User Prompt定义具体任务。

Step 3: Few-shot示例工程

选择3-5个覆盖典型场景和边界情况的示例。 示例应包含:输入→中间推理(CoT时)→输出的完整映射。 示例多样性比数量更重要。确保示例覆盖正向和负向案例。

Step 4: 迭代测试与优化

用固定测试集评估prompt效果。测量:准确率、召回率、一致性、边界行为。 根据失败案例调整:推理错误→强化CoT;格式错误→明确格式;边界模糊→添加约束。 可使用DSPy框架进行系统性参数搜索,或BayesPO/EvoPrompt进行自动优化。

Step 5: 部署与监控

Prompt的鲁棒性测试(换词/改顺序/加噪声)。 监控生产环境中的异常case,定期用新数据重新评估。 建立Prompt版本管理,记录每次改动的效果变化。

04

常见陷阱 · Pitfalls

陷阱类型描述解决方向
Prompt脆弱性 换一种说法效果差异巨大,Prompt对措辞过于敏感 多次测试变体,用DSPy/BayesPO进行系统优化
过度工程化 在简单任务上使用过于复杂的Prompt设计,增加成本和延迟 根据任务难度选择匹配复杂度的Prompt策略
示例偏差 Few-shot示例过于同质化,覆盖不了真实分布 刻意设计多样化示例,覆盖边界情况
幻觉引导 Prompt中暗示了答案,模型顺着暗示生成而非真实推理 确保示例的答案分布合理,不偏向特定答案
Context Window浪费 Prompt过长但有效信息少,浪费宝贵的context空间 精简Prompt内容,优先放入高质量示例
05

关键洞察 · Key Insights

💡 Prompt即编程

2026年的Prompt Engineering已从"技巧"演进为"科学"——有BayesPO的概率框架、有DSPy的抽象体系、有自动优化工具。

🔗 Pattern有分类体系

Sooben & Syriani (2026)给出了最系统的Pattern Taxonomy,这是该领域首个形式化分类。

🧠 CoT是推理的催化剂

要求输出中间步骤不仅提升推理质量,还让推理过程可审计、可修正。

📊 自动优化是未来

手工调优的prompt已进入瓶颈,BayesPO/EvoPrompt等自动优化框架代表下一代方向。

🎯 多模式互补

CoT + Self-Consistency + ToT不是竞争关系,而是互补——单路径/多路径/树搜索各有适用场景。

⚡ 迭代优于一次到位

Prompt优化是实验科学——建立评估基准 → 测试 → 改进 → 迭代,远比一次设计完美更有效。

REF

参考资料

• Wei et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022, arXiv:2201.11903 (15K+ citations)

• Wang et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023, arXiv:2203.11171

• Yao et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS 2023, arXiv:2305.10601

• Khattab et al. (2023). Demonstrate-Search-Predict: Composing Retrieval and Language Models for Knowledge-Intensive NLP. arXiv:2303.10144 (DSPy的前身)

• Zhou et al. (2025). BayesPO: Bayesian Prompt Optimization via Parallel-Tempered MCMC. ICML 2025, arXiv:2607.16001

• Sooben & Syriani (2026). A Taxonomy of Single-Turn Textual Prompt Patterns. arXiv:2607.00043

• OpenAI Prompt Engineering Guide: platform.openai.com/docs/guides/prompt-engineering

• Anthropic Research: modelBehavior: Studying prompt patterns in Claude

国际理论对标

以下国际领先的理论框架为本专题提供分析基础和决策参考。

1. Gartner Hype Cycle 技术成熟度曲线

Gartner, Inc. | Gartner Research | 1995-present (Annual)

新兴技术经历5个阶段:技术触发→期望膨胀峰值→幻灭低谷→启蒙爬升→生产力高原。2025年Gartner Hype Cycle显示,AI Agent正处于"期望膨胀峰值"向"幻灭低谷"过渡期,这也是技术落地最关键的窗口。

2. Technology S-Curve 技术S曲线理论

McKinsey & Company | Richard N. Foster | 1986 (Innovation: The Attacker's Advantage)

技术的性能提升遵循S形曲线:初期缓慢→加速期→成熟期→极限。当一条S曲线趋于平缓,新的S曲线从不连续点浮现。AI多智能体系统的能力演进正处于加速期,预计2025-2028年达到第一个性能拐点。

3. Amara's Law 阿马拉定律

Institute for the Future (IFTF) | Roy Amara | 1972

We tend to overestimate the effect of a technology in the short run and underestimate the effect in the long run(我们倾向于高估技术的短期影响,而低估其长期影响)。当前对AI Agent的热炒和质疑完美印证Amara's Law——短期期望过高,长期影响被低估。

4. Moore's Law & AI Scaling Laws 摩尔定律与AI扩展律

Intel / Stanford / Berkeley | Gordon E. Moore / OpenAI / Anthropic | 1965 (Moore) / 2020-2024 (Scaling Laws)

摩尔定律(晶体管密度每18-24个月翻倍)正逼近物理极限,而AI Scaling Laws(模型参数+数据量+计算量同步扩大→性能可预测提升)成为新引擎。NVIDIA GPU从A100到H100到B200的算力增长(3年间约4倍),直接驱动了Multi-Agent时代的到来。