Harness Engineering更新于 2026-06-24 · 版本 1.1
什么是 AI 智能体可观测性?
AI 可观测性是指对 AI 系统(尤其是智能体)进行插桩的实践,以便您能够了解它们做了什么以及原因。它捕获每一步的追踪:提示词、工具调用、检索到的上下文、模型输出、Token、延迟和成本。由于智能体具有非确定性和多步骤特征,可观测性使故障诊断和系统性改进成为可能。它是为评估提供数据并闭环 Harness Engineering(智能体支撑系统工程)的层。
证据: 生产环境置信度: 中来源: 生产系统来源: 个人经验来源: 行业观察
定义
AI 可观测性是指捕获 AI 系统行为的追踪、指标和日志的实践——包括每一次提示词、工具调用、检索、输出、Token、延迟和成本——以便理解、调试和改进其决策。
核心要点
- 可观测性使非确定性智能体变得可调试。
- 追踪记录了每一步:提示词、工具、上下文、输出、成本。
- 它为评估提供数据——你只能改进你能看到和衡量的内容。
- 统一追踪质量、延迟、成本和安全性。
- 新兴标准(OpenTelemetry GenAI)使追踪具备可移植性。
背景
传统软件是确定性的,易于记录日志。智能体则不然:相同的输入可能会走不同的路径、调用不同的工具并产生不同的输出。如果没有追踪,故障就是一个黑盒子。
可观测性打开了这个黑盒子。通过记录运行的完整轨迹,团队可以看到智能体在哪里出错、工具为什么失败、成本在哪里激增,并将这些发现反馈到评估和支撑系统变更中。
架构
插桩捕获每一步的 Span——模型调用、工具调用、检索——包括输入、输出、Token、延迟和错误,并将其链接到整个运行的追踪中。指标则随时间聚合质量、成本、延迟和失败率。
OpenTelemetry 的 GenAI 语义约定标准化了这些追踪的结构,使其能够流入通用的可观测性后端,而不是局限于专有的孤岛。追踪也成为了评估数据集的原材料。
组件
追踪(每一步的 Span)指标(质量、成本、延迟)日志Token 与成本核算错误跟踪追踪到评估流水线
优势
- 将不透明的智能体运行转化为可诊断的追踪。
- 显现成本、延迟和失败热点。
- 为评估和持续改进提供数据。
- 支持事件响应和治理审计。
风险
- 追踪可能会捕获需要脱敏的敏感数据。
- 大规模情况下的插桩开销和存储成本。
- 缺乏良好查询的海量数据会掩盖关键信号。
- 记录提示词的隐私和保留义务。
工具与技术
OpenTelemetry(GenAI 约定)LangSmithLangfuseArize / Phoenix标准 APM 后端
示例
- 将失败的智能体运行追踪到具体出错的工具调用。
- 跟踪每个任务的 Token 成本以找出高成本的提示词。
- 将生产环境的追踪转化为评估数据集。
- 实践案例:一个为期 57 天的单操作员自主部署(OpenClaw),通过本地轨迹追踪记录了 161 个会话 / 2,776 轮交互——会话成功率达 98.8%,每轮交互的 p50 延迟为 8.1 秒,p95 延迟为 87.6 秒,约 70% 的 Token 来自缓存服务,混合成本为每 100 万个 Token 15.21 美元(部分成本为估算,因此是底线值)。每个数据均源自该智能体自身的追踪。
常见问题解答
- 为什么智能体比聊天机器人更需要可观测性?
- 智能体具有多步骤和非确定性特征,因此单一的回答会隐藏许多内部决策。如果没有这些步骤的追踪,就无法诊断故障。
- 可观测性与评估有什么关系?
- 可观测性捕获发生的事情;评估判断其好坏。追踪成为运行评估的数据,从而闭环改进流程。
- AI 追踪有标准吗?
- OpenTelemetry 的生成式 AI 语义约定正逐渐成为一种可移植的标准,使 AI 追踪能够流入主流的可观测性工具中。
- 应该衡量什么?
- 统一衡量质量(任务成功率)、成本(Token)、延迟和安全性——一个速度快、成本低但任务失败的智能体并不是一个好的智能体。