让AI准确理解人类意图的核心工程学科 · 从Few-shot到自动优化的范式演进
Prompt = Task Decomposition + Pattern Selection + Example Engineering + Output Control
以下数据由天眼查工商数据库实时核验,补充专题页已有的公开信息,确保主体真实性。
| 项目 | 内容 |
|---|---|
| 统一社会信用代码 | 91310115350689047D |
| 法定代表人 | 盛锡传 |
| 注册资本 | 9000万美元 |
| 实缴资本 | 7641.02万美元 |
| 成立日期 | 2015-08-25 |
| 经营状态 | 存续 |
| 企业类型 | 有限责任公司(港澳台法人独资) |
| 行业 | 专业技术服务业 |
| 注册地址 | 上海市徐汇区虹漕路25-1号2层1285室 |
| 核准日期 | 2024-11-27 |
| 参保人数 | 小于50人 |
| 股东名称 | 持股比例 | 认缴出资 |
|---|---|---|
| Emotibot Technologies (Hong Kong) Limited | 100% | 9000万美元 |
数据来源:天眼查(tianyancha.com)工商公示数据,查询时间 2026-08-25。专题页原有内容(招股书/新闻/调研)不受影响,本卡仅补充权威工商核验维度。若与本页其他来源冲突,以天眼查工商登记为准。
Prompt Engineering(提示工程):设计、优化prompt以有效控制LLM行为的系统工程。 核心目标是将人类意图准确转化为AI可执行的指令序列。 不是写好话求人,而是对AI的编程。
在prompt内部直接提供任务所需的全部定义和规则,而非依赖外部知识
要求模型输出中间推理步骤,将复杂问题分解为可验证的子步骤
通过角色定义激活模型中与该角色相关的知识和行为模式
精确指定输出格式:JSON Schema、XML标签、Markdown表格等结构化格式
明确禁止的行为和边界条件,是Harness Engineering在prompt层面的实现
通过多轮对话逐步优化输出,每轮提供具体的改进方向
GPT-3展示了在prompt中提供少量示例即可激活任务能力,但主要是手工设计
Google Brain/Stanford (arXiv:2201.11903)。要求模型输出中间步骤,PaLM 540B在GSM8K从57%→92%。引用15000+次
Stanford提出。声明式模块化prompt编程,prompt模板与参数分离,支持自动优化
BayesPO (arXiv:2607.16001): 贝叶斯优化prompt离散空间。EvoPrompt: 进化算法优化。Prompt工程进入自动化时代
背景:LLM在复杂推理任务上性能远低于人类。研究者发现要求模型输出中间推理步骤后,性能大幅提升。
核心方法:
量化效果:
背景:CoT生成单一推理路径,可能在某个错误步骤上"一条路走到黑"。Self-Consistency引入采样多样性。
核心方法:
量化效果:在GSM8K上比CoT再提升3-5个百分点;在MATH上提升更显著。
背景:CoT是线性链,ToT将其推广为树结构——每个节点是一个"思考状态",允许分支、回溯、评估。
核心方法:
量化效果:Game of 24任务从传统CoT的4%提升到ToT的84%。
背景:手工设计prompt是经验性的、不可复用的。当任务/模型/数据变化时需要重新手工调整。
核心方法:
核心价值:Prompt工程从"艺术"变为"工程"——可测量、可优化、可复用。
背景:现有自动prompt优化依赖进化算法或纯梯度方法,缺乏对不确定性的系统性建模。BayesPO将贝叶斯优化引入离散prompt空间。
核心方法:
核心创新:首个将概率推断系统性地引入Prompt优化的框架,填补了理论空白。
背景:进化算法在连续优化中表现优异,但离散prompt空间的进化一直没有系统验证。EvoPrompt填补了这一空白。
核心方法:
效果:在多个基准上超过人工设计的prompt,接近BayesPO但计算效率更高。
核心原则(OpenAI官方):
明确任务类型(推理/生成/分类/提取),选择对应的Prompt Pattern。 推理任务→CoT/ToT;生成任务→角色+约束;分类任务→定义+示例;提取任务→格式规范。 参考Sooben & Syriani (2026)的Pattern Taxonomy选择最合适模式。
包含:角色定义(可选)、任务描述(清晰具体)、输出格式(JSON/表格/段落)、约束条件(边界行为)。 System Prompt定义长期约束,User Prompt定义具体任务。
选择3-5个覆盖典型场景和边界情况的示例。 示例应包含:输入→中间推理(CoT时)→输出的完整映射。 示例多样性比数量更重要。确保示例覆盖正向和负向案例。
用固定测试集评估prompt效果。测量:准确率、召回率、一致性、边界行为。 根据失败案例调整:推理错误→强化CoT;格式错误→明确格式;边界模糊→添加约束。 可使用DSPy框架进行系统性参数搜索,或BayesPO/EvoPrompt进行自动优化。
Prompt的鲁棒性测试(换词/改顺序/加噪声)。 监控生产环境中的异常case,定期用新数据重新评估。 建立Prompt版本管理,记录每次改动的效果变化。
| 陷阱类型 | 描述 | 解决方向 |
|---|---|---|
| Prompt脆弱性 | 换一种说法效果差异巨大,Prompt对措辞过于敏感 | 多次测试变体,用DSPy/BayesPO进行系统优化 |
| 过度工程化 | 在简单任务上使用过于复杂的Prompt设计,增加成本和延迟 | 根据任务难度选择匹配复杂度的Prompt策略 |
| 示例偏差 | Few-shot示例过于同质化,覆盖不了真实分布 | 刻意设计多样化示例,覆盖边界情况 |
| 幻觉引导 | Prompt中暗示了答案,模型顺着暗示生成而非真实推理 | 确保示例的答案分布合理,不偏向特定答案 |
| Context Window浪费 | Prompt过长但有效信息少,浪费宝贵的context空间 | 精简Prompt内容,优先放入高质量示例 |
2026年的Prompt Engineering已从"技巧"演进为"科学"——有BayesPO的概率框架、有DSPy的抽象体系、有自动优化工具。
Sooben & Syriani (2026)给出了最系统的Pattern Taxonomy,这是该领域首个形式化分类。
要求输出中间步骤不仅提升推理质量,还让推理过程可审计、可修正。
手工调优的prompt已进入瓶颈,BayesPO/EvoPrompt等自动优化框架代表下一代方向。
CoT + Self-Consistency + ToT不是竞争关系,而是互补——单路径/多路径/树搜索各有适用场景。
Prompt优化是实验科学——建立评估基准 → 测试 → 改进 → 迭代,远比一次设计完美更有效。
• Wei et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022, arXiv:2201.11903 (15K+ citations)
• Wang et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023, arXiv:2203.11171
• Yao et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. NeurIPS 2023, arXiv:2305.10601
• Khattab et al. (2023). Demonstrate-Search-Predict: Composing Retrieval and Language Models for Knowledge-Intensive NLP. arXiv:2303.10144 (DSPy的前身)
• Zhou et al. (2025). BayesPO: Bayesian Prompt Optimization via Parallel-Tempered MCMC. ICML 2025, arXiv:2607.16001
• Sooben & Syriani (2026). A Taxonomy of Single-Turn Textual Prompt Patterns. arXiv:2607.00043
• OpenAI Prompt Engineering Guide: platform.openai.com/docs/guides/prompt-engineering
• Anthropic Research: modelBehavior: Studying prompt patterns in Claude
以下国际领先的理论框架为本专题提供分析基础和决策参考。
新兴技术经历5个阶段:技术触发→期望膨胀峰值→幻灭低谷→启蒙爬升→生产力高原。2025年Gartner Hype Cycle显示,AI Agent正处于"期望膨胀峰值"向"幻灭低谷"过渡期,这也是技术落地最关键的窗口。
技术的性能提升遵循S形曲线:初期缓慢→加速期→成熟期→极限。当一条S曲线趋于平缓,新的S曲线从不连续点浮现。AI多智能体系统的能力演进正处于加速期,预计2025-2028年达到第一个性能拐点。
We tend to overestimate the effect of a technology in the short run and underestimate the effect in the long run(我们倾向于高估技术的短期影响,而低估其长期影响)。当前对AI Agent的热炒和质疑完美印证Amara's Law——短期期望过高,长期影响被低估。
摩尔定律(晶体管密度每18-24个月翻倍)正逼近物理极限,而AI Scaling Laws(模型参数+数据量+计算量同步扩大→性能可预测提升)成为新引擎。NVIDIA GPU从A100到H100到B200的算力增长(3年间约4倍),直接驱动了Multi-Agent时代的到来。