SANTISMM Labs · Harness Engineering

智能体控制沙箱

配置智能体、选择威胁、开启或关闭 18 个控制项。屏幕上的所有内容均源自分类学和控制矩阵——包括本实验拒绝向您展示的那个数字。

矩阵 v1.2 · 分类学 v1.1EU AI Act · ISO/IEC 42001 · NIST AI RMF · OWASP LLM Top 10 · MITRE ATLAS

大多数智能体安全演示最终都会给出一个令人安心的数字:弹性空间、保护评分,或者一个在您开启足够多开关时变绿的仪表盘。但本沙箱并非如此,而这种刻意的省略正是关键所在。这 18 个控制项及其框架映射是真实存在的,但其中没有任何一个曾针对模型生成内容进行过量化测量——因此,任何残留风险数据都需要一个根本不存在的系数。相反,您获得的是覆盖率:您填补了哪些象限、留空了哪些象限,以及触及了哪些威胁映射。覆盖率是关于您所做选择的事实。而残留风险则将是对现实世界的一种主观宣称。

01智能体

Claude CodeGAA3·T2·D1·M2·L1·I1

为何在此分类: 终端原生。就地编辑,通过 Git 交付 PR。

A自主性

谁扣动扳机?

受委托:运行整个任务,由人类进行审查

T时间跨度

它的生命周期有多长?

任务:几分钟到几小时,交付后消亡

D领域广度

它覆盖什么范围?

垂直:单一领域(编程、CX、法律……)

M记忆与身份

它能记住什么,以及它如何改变?

用户/项目记忆(记住,但不改变)

L模型耦合度

是否绑定到单一实验室?

单一模型,绑定到提供商

I操作身份

它使用谁的凭证进行操作?

用户凭证(在审计中无法区分)

02威胁

直接读取控制措施本身:下方的每个条目都是至少有一项控制措施声称要解决的 OWASP LLM Top 10 项目。数字表示声称解决该项目的控制措施数量。

03防御措施

0/18

权限与范围

  • 前馈推论性
  • 前馈确定性
  • 前馈确定性

出口与暴露

  • 前馈确定性
  • 反馈确定性
  • 前馈确定性

执行

  • 前馈确定性
  • 反馈确定性
  • 反馈推论性

人工监督

  • 前馈推论性
  • 反馈推论性

证据

  • 反馈确定性
  • 反馈推论性

生命周期与输入

  • 前馈确定性
  • 前馈确定性
  • 反馈推论性
  • 前馈确定性
  • 反馈推论性