GOV-004指南更新于 2026-06-21 · 版本 1.0

智能体 AI 治理清单

一份实用且不绑定特定厂商的清单,用于在企业中治理智能体 AI —— 将 EU AI Act、ISO/IEC 42001 和 NIST AI RMF 的原则转化为可在支撑系统中实施的具体控制措施。它涵盖了人工监督、护栏、审计日志、评估、访问控制、提示词注入防御和事件响应,并将每项控制措施映射到使其落地运行的模式和知识单元。在允许智能体在生产环境中运行之前,将其用作就绪性闸口。

证据: 行业观察置信度: 来源: 行业观察来源: 个人经验
EU AI ActISO/IEC 42001NIST AI RMF

定义

智能体 AI 治理清单是一套操作性控制集,它将 AI 治理框架转化为针对在生产环境中运行的自主智能体的具体、可实施的要求。

范围

适用于构建或部署使用工具、在系统上执行操作或做出重大决策的自主或半自主智能体的团队。它是正式框架的实用指南,不能替代法律咨询。

关键要求

  • 基于风险的人工监督:对高影响、不可逆或受监管的操作设置人工审批闸口。
  • 输入和输出的护栏,包括提示词注入 and PII 防御。
  • 完整的审计日志和可观测性,确保每项操作都可追溯。
  • 部署前后的评估,对照维护的评估集进行。
  • 对智能体可触及的工具和数据实行最小特权访问。
  • 为生产环境中的智能体定义明确的事件响应和紧急停机开关(kill-switch)。

控制措施

人工审批闸口
将高影响操作路由至人工检查点(EU AI Act 第 14 条)。实现 human-approval-gate 模式。
护栏
验证并约束输入和输出;防御提示词注入并阻止违反策略的操作。
审计日志与可观测性
追溯每一次决策、工具调用和操作,使智能体可被审查,且事件可被重现。
评估支撑系统
在发布前对照评估集对行为进行评分,并在发布后监控退化情况 —— NIST 'Measure'。
最小特权访问
将智能体可触及的工具、数据和权限限制在其任务所需的最低限度。
事件响应与紧急停机开关
定义如何检测、停止和纠正行为异常的智能体,包括立即暂停其运行的方法。

清单

  • 01对智能体的风险进行分类,并识别哪些操作需要人工审批。
  • 02实施输入/输出护栏和提示词注入防御。
  • 03启用端到端审计日志和可观测性。
  • 04建立评估集,并在部署前及运行中持续运行该评估集。
  • 05对工具、数据和凭据应用最小特权范围限制。
  • 06定义事件响应、监控阈值 and 紧急停机开关。
  • 07将每项控制措施映射到您在 EU AI Act、ISO 42001 和 NIST AI RMF 下的义务。
  • 08记录所有权并定期审查智能体。

常见误区

  • 为了“安全起见”授予智能体广泛的工具/数据访问权限,从而造成巨大的爆炸半径。
  • 对所有操作都设置闸口(导致审批疲劳)或完全不设闸口(缺乏监督),而不是基于风险设置闸口。
  • 在没有评估集的情况下发布,导致质量和安全性无法衡量。
  • 当智能体在生产环境中行为异常时,没有紧急停机开关或事件应对计划。
  • 忽视提示词注入作为使用工具的智能体的攻击面。

生产环境证据

上下文
将自主或半自主智能体投入生产环境,使其使用工具并执行重大操作的团队。
场景
在上线前,团队将该清单作为就绪性闸口运行:对智能体的风险进行分类、对高影响操作设置人工审批闸口、添加护栏和提示词注入防御、启用审计日志和可观测性、建立评估集、限制最小特权访问,并定义事件响应和紧急停机开关。
技术
一个结合了人工审批闸口、护栏、审计日志/可观测性、评估支撑系统以及受限工具/凭据访问的支撑系统。
负载
在部署前应用于每个智能体,并定期重新审查;最重的控制措施(人工审批)仅保留给少数高影响操作。
结果
观察到的模式:从第一天起就基于风险设置闸口、强制执行最小特权并进行插桩的团队,能够控制智能体错误的影响范围;而那些为了“安全起见”授予广泛访问权限或在没有评估的情况下发布的团队,则会在生产环境中发现故障。衡量指标包括升级适当性、错误操作率和平均检测时间。

经验教训

  • 将清单视为就绪性闸口,而不是一次性审计 —— 随着智能体工具和自主性的增加,应重新运行该清单。
  • 与任何单一护栏相比,最小特权访问和基于风险的人工审批更能限制爆炸半径。
  • 如果在发布前没有建立评估集和审计日志,你将无法区分一个安全的智能体和一个仅仅是运气好的智能体。
  • 将每项控制措施映射到具体的责任人;没有问责制的治理仅仅是文档。

示例

  • 一个退款操作需要人工审批,而只读查询可以自由运行的智能体。
  • 一个阻止通过工具外泄数据的提示词注入指令的护栏。
  • 在智能体更新发布前捕获安全性退化的评估运行。

常见问题

这可以替代 EU AI Act 或 ISO 42001 吗?
不能。它是一套实用的控制集,旨在将这些原则落实到智能体的运行中。请将其与正式框架和法律咨询结合使用,而不是取而代之。
对于自主智能体来说,哪项控制措施最重要?
基于风险的人工监督,加上最小特权访问和审计日志 —— 它们共同限制了智能体可以执行的操作,并使每项操作都可问责。
它如何与模式库相联系?
每项控制措施都映射到实现它的模式 —— 用于监督的 human-approval-gate,用于质量的 reflection 和 evaluator-optimizer —— 以及诸如护栏和 AI 可观测性等知识单元。

参考文献