治理更新于 2026-08-22 · 版本 1.0

什么是 AI 网络防御?

AI 网络防御是保护 AI 系统(模型、智能体、它们调用的工具以及它们访问的数据)免受利用这些系统推理和行为方式的攻击的实践。对于智能体而言,它不是事后添加的层:阻止攻击的控制措施与使智能体正常工作的支撑系统组件完全相同——工具权限、上下文边界、审批关口、可观测性。防御智能体就是构建其支撑系统。

证据: 行业观察置信度: 来源: 行业观察来源: 论文来源: 个人经验

定义

AI 网络防御是保护 AI 系统及其运营组织免受针对 AI 自身(其输入、上下文、工具和自主性)攻击的实践,这些防御是通过在模型周围的支撑系统中实施控制,而不是在模型权重中实施控制来实现的。

核心要点

  • 模型本身很少是攻击面;其周围的支撑系统才是。
  • 攻击的目标是智能体的输入、记忆、工具和自主性——而不是其参数。
  • 你无法通过给语言模型打补丁来防御提示词注入。你只能限制被劫持的智能体所能做的事情。
  • 每项防御性控制同时也是可靠性控制:最小特权、验证、审批关口、审计日志。
  • 有两个方向共享这一名称:防御 AI 系统,以及使用 AI 进行防御。它们共享工具,但不共享威胁模型。

背景

传统应用安全假设代码做决策而数据是惰性的。智能体打破了这一假设:它读取不可信的内容,然后据此做出决策,因此任何文档、网页或工具响应都可能成为潜在的指令。

这就是企业落地停滞不前的原因。安全审查是智能体从 Demo 走向生产环境最常见的阻碍,因为这种风险是陌生的:系统完全按照设计运行,但仍然会被滥用。

架构

输入边界——不可信内容被界定并标记为数据,绝不直接拼接进指令通道。

工具层——每个工具仅携带能使其正常工作的最小凭证,并声明其是否为只读。

操作关口——不可逆或高价值的操作会暂停以等待人工审批,而不是完全信任模型的判断。

出口控制——出口目的地被列入白名单,因此数据外泄需要有人故意留出的漏洞。

可观测性——每次工具调用、其参数和结果都会被记录,因为无法重现的安全事件就是无法结案的事件。

对抗性评估——注入和滥用用例在 CI 中与功能测试并排运行,因此回归问题会导致构建失败,而不是让客户受损。

组件

针对特定智能体的威胁模型最小特权工具凭证指令与内容之间的信任边界针对不可逆操作的人工审批关口出口白名单防篡改的工具调用审计日志对抗性评估套件覆盖智能体行为的事件响应流程

优势

  • 控制措施是可审计和可测试的,不像模型层面的保证那样无法从外部验证。
  • 同样的工作也能带来可靠性:一个无法因恶意删除错误记录的智能体,也同样不会因失误而删除它。
  • 它直接对应了组织已经面临的义务——欧盟《AI 法案》的鲁棒性和网络安全职责、ISO/IEC 42001、NIST AI RMF。
  • 它为安全审查提供了具体的审批依据,而这正是打通生产环境的关键。

风险

  • 安全演戏:一个护栏模型在过滤文本,而智能体却仍然持有具备写入权限的 API 密钥。
  • 过度限制导致智能体无法使用,并迫使用户转向没有任何控制措施的非官方副本。
  • 假设供应商默认设置是安全的,特别是对于团队中无人阅读过其代码的第三方工具服务器。
  • 将其视为一次性审查,而不是一个生命周期:新工具意味着新的攻击面。

工具与技术

OWASP LLM 应用十大安全漏洞——共享的风险词汇表MITRE ATLAS——针对 AI 系统观察到的对手战术和技术NIST AI RMF 及其生成式 AI 配置文件输入/输出护栏和验证库沙箱执行环境和出口代理接入 CI 的对抗性评估支撑系统

示例

  • 一个读取共享收件箱并能发送邮件的智能体:一封被注入的电子邮件指示它将最后二十条消息转发到外部地址。
  • 一个持有代码仓库 Token 的编码智能体,指向一个其 README 包含隐藏指令的依赖项。
  • 一个连接到第三方工具服务器的 MCP 客户端,该服务器的工具描述中包含针对模型而非开发者的指令。

常见问题解答

更强大的模型能解决提示词注入问题吗?
不能。该漏洞是结构性的:指令和内容通过同一个通道(即文本)传入。更好的模型只是提高了攻击成本;只有支撑系统才能限制其爆炸半径。
这与 AI 治理有什么不同?
治理决定了什么是被允许的以及谁为此负责。网络防御则使被允许的事情难以被滥用。它们共享证据(日志、评估、审批),这就是为什么它们通常是一起构建的。
团队应该从哪里开始?
为单个智能体编写威胁模型,列出它可能被诱导做出的最糟糕的事情,并在没有人工干预的情况下剥夺其执行该操作的能力。其余的一切都是细化完善。
这适用于仅有读取权限的智能体吗?
适用,但攻击面较小。只读智能体仍然可以外泄它读取的内容,因此即使没有工具可以执行写入操作,上下文边界和出口控制仍然至关重要。

参考文献