SANTISMM Labs · Harness Engineering
智能体控制沙箱
配置智能体、选择威胁、开启或关闭 18 个控制项。屏幕上的所有内容均源自分类学和控制矩阵——包括本实验拒绝向您展示的那个数字。
矩阵 v1.2 · 分类学 v1.1EU AI Act · ISO/IEC 42001 · NIST AI RMF · OWASP LLM Top 10 · MITRE ATLAS
大多数智能体安全演示最终都会给出一个令人安心的数字:弹性空间、保护评分,或者一个在您开启足够多开关时变绿的仪表盘。但本沙箱并非如此,而这种刻意的省略正是关键所在。这 18 个控制项及其框架映射是真实存在的,但其中没有任何一个曾针对模型生成内容进行过量化测量——因此,任何残留风险数据都需要一个根本不存在的系数。相反,您获得的是覆盖率:您填补了哪些象限、留空了哪些象限,以及触及了哪些威胁映射。覆盖率是关于您所做选择的事实。而残留风险则将是对现实世界的一种主观宣称。
01智能体
Claude CodeGAA3·T2·D1·M2·L1·I1
为何在此分类: 终端原生。就地编辑,通过 Git 交付 PR。
A自主性
谁扣动扳机?
受委托:运行整个任务,由人类进行审查
T时间跨度
它的生命周期有多长?
任务:几分钟到几小时,交付后消亡
D领域广度
它覆盖什么范围?
垂直:单一领域(编程、CX、法律……)
M记忆与身份
它能记住什么,以及它如何改变?
用户/项目记忆(记住,但不改变)
L模型耦合度
是否绑定到单一实验室?
单一模型,绑定到提供商
I操作身份
它使用谁的凭证进行操作?
用户凭证(在审计中无法区分)
02威胁
直接读取控制措施本身:下方的每个条目都是至少有一项控制措施声称要解决的 OWASP LLM Top 10 项目。数字表示声称解决该项目的控制措施数量。
03防御措施
0/18
权限与范围
- 前馈推论性
- 前馈确定性
- 前馈确定性
出口与暴露
- 前馈确定性
- 反馈确定性
- 前馈确定性
执行
- 前馈确定性
- 反馈确定性
- 反馈推论性
人工监督
- 前馈推论性
- 反馈推论性
证据
- 反馈确定性
- 反馈推论性
生命周期与输入
- 前馈确定性
- 前馈确定性
- 反馈推论性
- 前馈确定性
- 反馈推论性