Harness 成熟度模型

Harness 成熟度模型

共七个级别,从提示词驱动(prompted)到自适应(adaptive)。除最低级别外,每个级别都包含可以通过或失败的标准,因为仅用形容词描述的级别无法对任何人进行定位。它是累积性的:只有当该级别及以下的所有标准都通过时,你才算达到该级别。

版本 1.0 · 更新时间 2026-08-27 · 7 级别 · 18 标准

JSON机器可读

如何解读

累积性,而非菜单式。只有当 1、2、3 和 4 级的所有要求都通过时,一个支撑系统才算达到 4 级——而不是仅仅因为它有一个评估套件。如果没有这条规则,每个人都会挑选自己已经达到的阶梯,该模型也就失去了对任何人进行定位的作用。

每个标准都是一个带有结果的行动。如果你无法运行它并获得答案,它就不属于这里。其措辞刻意与控制矩阵的测试保持相同的形式,因为它们属于同一种事物。

每个级别还说明了如果你止步于此,哪些问题仍未解决。这一半是诚实的:级别并非美德,它们是有人刻意做出的权衡。

这是自我评估,这是最弱的评估形式。发布该模型是为了让大家对标准进行讨论,其背后的断言阐明了什么会证伪这一排序。

cumulativetheoreticallow

此项所依据的声明: HE-CLAIM-006可通过 MCP 使用 get_claim 检索。

级别 0

提示词驱动

prompted

每次运行都由人工驱动。模型被手动调用,提示词存在于聊天窗口和某些人的笔记中,运行结束后不留存任何内容。

基底。它本身没有评估标准:当级别 1 失败时,支撑系统即处于此状态。

如果在此处停止,哪些问题仍未解决

没有任何内容是可重复的,因此无法进行任何改进。两个人请求相同的内容会构建出两个不同的系统,且双方都无法说明为什么自己的系统能正常工作。

级别 1

脚本化

scripted

调用写在代码中,提示词是版本化的产物。可以从代码仓库中复现运行,而不是凭某人的记忆。

标准

  1. 获取上个月的一次运行并进行复现。提示词、模型和参数均来自版本控制。

    读取自ACM-15

  2. 修改提示词。该变更以包含作者和日期的差异对比(diff)形式呈现,且先前的版本仍可检索。

    读取自ACM-15

  3. 查询是哪个模型版本服务了特定的运行。答案来自记录,而非基于对该周当前版本的假设。

    读取自ACM-10ACM-15

如果在此处停止,哪些问题仍未解决

智能体仍然无法对任何事物采取行动,因此其成本受限于其无用性。在此处停止是一个合理的选择;但将您现有的东西称为智能体则不合理。

级别 2

工具化

tooled

智能体通过声明的工具界面对真实系统采取行动:每个工具都被列出、限定范围、明确所有者,并在指向不该去的地方时在服务端被拒绝。

标准

  1. 提供工具目录。智能体可以调用的每个工具都在其中,并写明了范围、是否执行写入操作以及指定的所有者。

    读取自ACM-01

  2. 对于每个工具,展示其凭据以及该凭据的服务端范围。没有两个工具会共享一个范围超出其各自所需范围的凭据。

    读取自ACM-02

  3. 使用超出范围的目标调用具有写入能力的工具。该调用会被工具自身的边界拒绝,而不是由模型拒绝。

    读取自ACM-03测量指标contain

如果在此处停止,哪些问题仍未解决

智能体现在可能会造成损害,且目前没有任何限制。从现在开始,每一次事故都是在重要系统中发生的事故。

级别 3

受限

bounded

支撑系统强制执行它不要求模型遵守的限制:出口默认拒绝,消耗由主机限制,且不可信内容被视为数据而非指令。

标准

  1. 从智能体环境内部请求一个不在列表中的主机。该请求在网络或代理层失败,且拒绝信息作为安全信号到达,而非超时。

    读取自ACM-04ACM-05

  2. 运行一个旨在不终止的任务。配额会停止该任务,停止操作会被记录,且该尝试的成本在开始前就已受限并已知。

    读取自ACM-07

  3. 在智能体检索的文档中植入一条指令。智能体可以读取它,但绝不能对其采取行动,且该尝试在事后是可见的。

    读取自ACM-12ACM-13

如果在此处停止,哪些问题仍未解决

爆炸半径受限,而质量不受限。系统安全地发生故障,且没人能说清它是否正常工作。

级别 4

已评估

evaluated

变更由某人曾目睹其失败的测试套件进行把关。回归会阻止发布,可重复性是一个数字,且智能体声称的内容与验证器发现的内容之间的差距是可衡量的。

标准

  1. 引入一个已知的回归。测试套件捕获了它,且变更未发布。从未见其失败过的测试套件其捕获率是未知的,而非完美的。

    读取自ACM-11测量指标catch

  2. 在没有任何变更的情况下运行评估集五次,并说明有多少个案例每次都得出相同的结论。该数字存在且有人知道它。

    读取自ACM-11测量指标dband

  3. 将智能体在一组运行中声称的内容与独立验证器发现的内容进行比较。差异是一个数字,且不假设其为零。

    读取自ACM-10ACM-11测量指标vgap

如果在此处停止,哪些问题仍未解决

质量得到了衡量,但问责制没有。当出现问题时,您可以证明它发生了回归,但无法证明是谁允许其通过的。

级别 5

已治理

governed

权限、证据和升级都有所有者。不在场的人也可以重建运行,把关机制的存在是因为风险标准将其置于此处,且威胁模型比工具目录更新。

标准

  1. 随机选择过去的一次运行,仅根据日志端到端地进行重建,而无需原始操作员在场。然后确认日志中没有包含不需要的机密信息。

    读取自ACM-10测量指标recon

  2. 列出受控的操作以及将其置于此处的风险标准。强制进行升级;它在规定时间内到达指定人员处,并携带采取行动所需的上下文。

    读取自ACM-08ACM-09测量指标hir

  3. 展示当前的威胁模型以及工具目录的最近变更日期。如果目录更新,则此标准失败,且无法保持该级别。

    读取自ACM-18

如果在此处停止,哪些问题仍未解决

一切都已就绪,且没有任何内容会过期。明年,支撑系统仍将强制执行模型去年所需的补偿措施。

级别 6

自适应

adaptive

支撑系统根据证据进行变更,包括自行移除。组件携带了它们经过验证的模型以及废除它们的条件,并且某些内容实际上已被废除。

标准

  1. 列举在过去两个季度中移除的一个控制项、提示词规则或上下文块,并展示证明其移除合理性的测量数据。“我们尝试了不加它,感觉还行”不能算作测量数据。

    测量指标cvo

  2. 对于仍在使用的组件,说明其针对哪个模型进行了验证,以及在什么条件下会将其停用。这两点都必须有书面记录,而不是凭记忆。

    读取自ACM-15

  3. 展示在两个模型世代中,针对相同任务集,每个正确验证结果的成本,其中每个世代都配有该世代实际需要的支撑系统。

    测量指标cvotvo

如果在此处停止,哪些问题仍未解决

这里没有任何东西是稳定的,而这正是关键所在。一个根据证据进行调整的支撑系统需要高质量的证据,而且记分卡上的每一项指标都可能被被考核者钻空子。