治理更新于 2026-06-21 · 版本 1.0
什么是 AI 护栏?
护栏是运行时控制机制,用于约束 AI 系统的输入和输出,确保其行为安全、符合策略且合规。它们检查并过滤输入和输出、验证工具操作、拦截不合规内容并强制执行限制——作为安全层环绕在模型周围。护栏是 AI 治理中的主要运营控制手段,也是防范滥用和提示词注入的关键防线。
证据: 行业观察置信度: 高来源: 行业观察来源: 论文
定义
AI 护栏是运行时安全保护机制,通过验证、过滤或约束模型的输入、输出和操作,确保其行为安全、合规且处于定义的策略范围内。
核心要点
- 护栏在运行时对输入、输出和操作起作用。
- 它们强制执行安全、策略和合规性,而非模型质量。
- 类型:输入过滤、输出验证、操作白名单、限制。
- 防范滥用和提示词注入的核心防线。
- 护栏是评估和监督的补充,而非替代方案。
背景
模型本身没有可强制执行的边界;它会尝试提示词诱导的任何内容。护栏在运营层面上增加了这些边界:介于用户、模型以及模型可触及系统之间的确定性或基于模型的检查。
它们是将治理策略转化为实时控制的方式。例如,“绝不泄露 PII”或“未经批准绝不执行付款”的策略,可以通过在运行时进行实际检查和拦截的护栏来实现。
架构
输入护栏筛选提示词(例如,针对注入、策略违规、PII)。输出护栏验证响应(格式、安全性、事实约束、PII 脱敏)。操作护栏通过权限和白名单限制工具调用。速率、范围和预算限制则用于控制爆炸半径。
护栏可以是确定性的(规则、Schema、正则表达式、白名单),也可以是基于模型的(分类器或 LLM 裁判)。它们与可观测性相结合以记录违规行为,并与高影响操作的人机协同(human-in-the-loop)审批相结合。
组件
输入过滤输出验证/脱敏操作白名单与权限速率与范围限制策略分类器违规日志记录
优势
- 在运行时强制执行安全和策略,而不仅仅是在指南中。
- 减少滥用、不安全输出和注入的影响。
- 使治理和合规要求落地运营。
- 限制智能体操作的爆炸半径。
风险
- 过度拦截会损害实用性(误报)。
- 拦截不足会产生虚假的安全感。
- 基于模型的护栏会增加延迟和成本。
- 它们并非万无一失的防线;需与监督和评估相结合。
工具与技术
护栏框架(例如 NeMo Guardrails、Guardrails AI)内容审核/安全分类器Schema 与输入验证权限与策略引擎违规行为的可观测性
示例
- 在展示模型输出之前,对其进行个人数据脱敏。
- 拦截超出安全操作白名单范围的工具调用。
- 拒绝不符合所需 JSON Schema 的响应。
常见问题解答
- 护栏和对齐(alignment)是一回事吗?
- 不是。对齐是在训练期间塑造模型的内在行为;而护栏是围绕已部署系统的外部运行时控制。两者相辅相成。
- 护栏能阻止提示词注入吗?
- 它们可以减轻其影响——输入筛选和操作白名单会有所帮助——但没有任何护栏能完全阻止注入。对于敏感操作,请使用分层防御并结合人工审批。
- 确定性护栏还是基于模型的护栏?
- 两者兼有。确定性检查(Schema、白名单)对于明确的规则而言成本低且可靠;基于模型的检查可以处理微妙的内容,但代价是增加延迟。
- 护栏如何融入 AI 治理?
- 它们是运营层:通过日志记录和审计来证明,将治理策略转化为强制执行行为的运行时控制。