Harness Engineering更新于 2026-06-21 · 版本 1.0

什么是上下文工程?

上下文工程是一门决定在每一步中哪些信息进入模型有限的上下文窗口,以及哪些信息被排除在外的学科。随着智能体运行多个步骤,盲目地将所有内容塞入上下文中会降低质量并增加成本。上下文工程通过策划正确的指令、检索到的知识、工具结果和记忆,使模型在需要时恰好拥有其所需的内容。它是 Harness Engineering 的核心部分。

证据: 行业观察置信度: 来源: 行业观察来源: 论文

定义

上下文工程是指策划、压缩和排序放入模型上下文窗口中的信息的实践,以便它在每一步都拥有最相关的信号和最少的噪音。

核心要点

  • 上下文是一种稀缺资源;你排除的内容与你包含的内容同样重要。
  • 更多的上下文并不意味着更好——无关的 Token 会降低质量并增加成本。
  • 技术包括:检索、摘要、精简和结构化记忆。
  • 它将提示词工程从单一提示词推广到整个智能体运行过程。
  • 它是模型周围支撑系统的核心层。

背景

每个模型都有有限的上下文窗口,当其中充斥着低信号内容时,质量就会下降。在单轮交互中,这是可以控制的,但智能体会跨多个步骤累积历史记录、工具输出和检索到的文档,从而迅速使窗口过载。

上下文工程将窗口视为需要刻意管理的预算:保留持久指令,仅检索当前相关的内容,对其余内容进行摘要或精简,并将长期状态存储在窗口之外的记忆中。

架构

核心动作:选择(仅检索相关段落)、压缩(对先前步骤进行摘要)、精简(丢弃或折叠陈旧的轮次)以及外部化(将长期状态推送到记忆库中,并根据需要拉回)。

在智能体循环中,上下文在每一步都从分层源中重新组装:稳定的系统指令、任务状态、相关的检索知识、最近的工具结果以及选定的长期记忆——并进行排序,使最重要的信号最显著。

组件

系统指令任务状态检索到的知识工具结果长期记忆摘要 / 压缩

优势

  • 随着任务变长,仍能保持高质量。
  • 控制 Token 成本和延迟。
  • 减少噪声带来的干扰和幻觉。
  • 在有限的上下文内实现长程智能体。

风险

  • 过度压缩可能会遗漏所需信息。
  • 检索效果差会引入无关或错误的上下文。
  • 在每一步决定保留什么内容具有复杂性。
  • 此处的缺陷会表现为隐蔽的质量退化。

工具与技术

检索 / RAG 流水线摘要模型记忆存储上下文管理框架(例如 LangGraph)

示例

  • 对智能体先前的步骤进行摘要,使窗口保持专注于当前的子任务。
  • 仅检索与问题相关的政策章节,而不是整本手册。
  • 将用户的偏好存储在记忆中,并仅在相关时进行召回。

常见问题解答

上下文工程与提示词工程有什么区别?
提示词工程构建的是单条指令。而上下文工程则管理整个智能体运行过程中窗口内的完整信息集——包括检索、记忆、工具结果和压缩。
为什么不直接使用更大的上下文窗口?
更大的窗口有所帮助,但无法消除问题:随着窗口被低信号 Token 填满,质量和成本都会恶化。精细筛选依然是更好的选择。
它与 RAG 和记忆有什么关系?
RAG 和记忆是上下文的来源;上下文工程决定其中哪些内容在何时以何种形式真正进入窗口。
它是 Harness Engineering(智能体支撑系统工程)的一部分吗?
是的。上下文管理是该支撑系统的核心层之一,它将模型能力转化为可靠的智能体行为。

参考文献