概念更新于 2026-06-21 · 版本 1.0
什么是提示词工程?
提示词工程是设计提供给语言模型的输入以使其可靠地产生所需输出的实践。一个好的提示词会指定角色、任务、约束、输出格式以及(在有用时)示例。它是引导模型行为最易用的手段——也是围绕模型的更广泛支撑系统(harness)中的一层——但仅凭其自身并不能使系统在大规模下保持可靠。
证据: 基准测试置信度: 高来源: 基准测试来源: 论文来源: 行业观察
定义
提示词工程是设计和改进提供给语言模型的指令、上下文和示例,以可靠地引导出所需输出的实践。
核心要点
- 一个强大的提示词应说明角色、任务、约束、格式和示例。
- 对于结构化任务,示例(少样本/few-shot)的效果通常优于仅有指令。
- 思维链(chain-of-thought)提示词可以提高多步推理能力。
- 提示词应该经过测试和版本控制,而不是凭感觉手动调整。
- 它是支撑系统(harness)的一层,不能替代工具、内存和评估。
背景
因为模型遵循自然语言指令,所以任务的表述方式会实质性地改变结果。提示词工程就是将其表述得当的学科:明确目标、受众、约束以及你希望返回的格式。
这是提高输出质量最快、最便宜的方法,也是大多数团队的起点。但随着系统演变为智能体,提示词编写变成了工具、内存、检索和评估(即完整的支撑系统/harness)中的一个组件。
架构
常用技术:零样本/zero-shot(仅指令)、少样本/few-shot(指令加示例)、思维链/chain-of-thought(要求逐步推理)、角色和格式规范,以及分解(将任务拆分为更小的提示词)。
成熟的实践将提示词视为代码:进行存储、版本控制、针对评估(evals)进行测试,并谨慎地进行更改。可复用的提示词模板和结构化输出模式(schemas)可以减少偏差。
组件
角色 / 人设(persona)任务指令约束条件输出格式示例(少样本/few-shot)推理线索
优势
- 改变模型行为最快、最便宜的方法。
- 无需训练或基础设施。
- 适用于各种模型和任务。
- 易于迭代并与其他技术结合。
风险
- 脆弱性:微小的措辞变化就可能改变模型行为。
- 当提示词包含不可信输入时,存在提示词注入风险。
- 仅靠提示词很难规模化地提升可靠性。
- 隐性耦合于特定模型的独特怪癖。
工具与技术
提示词模板结构化输出 / JSON SchemaLangSmith / Langfuse(提示词测试)评估套件
示例
- 添加几个完整示例,使模型输出一致的 JSON。
- 要求进行分步推理,以提高数学或逻辑回答的准确性。
- 指定严格的格式,以便下游代码能够解析响应。
常见问题解答
- 随着模型能力的提升,提示词工程依然重要吗?
- 是的,但其作用范围在缩小。更好的模型需要更少的引导,但清晰的指令、示例和格式规范仍然能显著提高可靠性——特别是在智能体内部。
- 它与上下文工程有什么区别?
- 提示词工程侧重于指令本身。而上下文工程是一项更广泛的任务,旨在决定在每一步中哪些信息进入模型有限的上下文窗口。
- 思维链(Chain-of-Thought)总是有效吗?
- 它在多步推理任务中帮助最大,代价是消耗更多 Token。对于简单的查询,它只会增加延迟而无任何益处。
- 如何保持提示词的可靠性?
- 将它们视为代码:进行版本控制,对照评估集进行测试,并有目的地进行修改,而不是盲目试错。