提示词驱动
prompted每次运行都由人工驱动。模型被手动调用,提示词存在于聊天窗口和某些人的笔记中,运行结束后不留存任何内容。
基底。它本身没有评估标准:当级别 1 失败时,支撑系统即处于此状态。
如果在此处停止,哪些问题仍未解决
没有任何内容是可重复的,因此无法进行任何改进。两个人请求相同的内容会构建出两个不同的系统,且双方都无法说明为什么自己的系统能正常工作。
共七个级别,从提示词驱动(prompted)到自适应(adaptive)。除最低级别外,每个级别都包含可以通过或失败的标准,因为仅用形容词描述的级别无法对任何人进行定位。它是累积性的:只有当该级别及以下的所有标准都通过时,你才算达到该级别。
版本 1.0 · 更新时间 2026-08-27 · 7 级别 · 18 标准
累积性,而非菜单式。只有当 1、2、3 和 4 级的所有要求都通过时,一个支撑系统才算达到 4 级——而不是仅仅因为它有一个评估套件。如果没有这条规则,每个人都会挑选自己已经达到的阶梯,该模型也就失去了对任何人进行定位的作用。
每个标准都是一个带有结果的行动。如果你无法运行它并获得答案,它就不属于这里。其措辞刻意与控制矩阵的测试保持相同的形式,因为它们属于同一种事物。
每个级别还说明了如果你止步于此,哪些问题仍未解决。这一半是诚实的:级别并非美德,它们是有人刻意做出的权衡。
这是自我评估,这是最弱的评估形式。发布该模型是为了让大家对标准进行讨论,其背后的断言阐明了什么会证伪这一排序。
cumulativetheoreticallow
此项所依据的声明: HE-CLAIM-006 — 可通过 MCP 使用 get_claim 检索。
每次运行都由人工驱动。模型被手动调用,提示词存在于聊天窗口和某些人的笔记中,运行结束后不留存任何内容。
基底。它本身没有评估标准:当级别 1 失败时,支撑系统即处于此状态。
如果在此处停止,哪些问题仍未解决
没有任何内容是可重复的,因此无法进行任何改进。两个人请求相同的内容会构建出两个不同的系统,且双方都无法说明为什么自己的系统能正常工作。
调用写在代码中,提示词是版本化的产物。可以从代码仓库中复现运行,而不是凭某人的记忆。
标准
如果在此处停止,哪些问题仍未解决
智能体仍然无法对任何事物采取行动,因此其成本受限于其无用性。在此处停止是一个合理的选择;但将您现有的东西称为智能体则不合理。
智能体通过声明的工具界面对真实系统采取行动:每个工具都被列出、限定范围、明确所有者,并在指向不该去的地方时在服务端被拒绝。
标准
如果在此处停止,哪些问题仍未解决
智能体现在可能会造成损害,且目前没有任何限制。从现在开始,每一次事故都是在重要系统中发生的事故。
支撑系统强制执行它不要求模型遵守的限制:出口默认拒绝,消耗由主机限制,且不可信内容被视为数据而非指令。
标准
如果在此处停止,哪些问题仍未解决
爆炸半径受限,而质量不受限。系统安全地发生故障,且没人能说清它是否正常工作。
变更由某人曾目睹其失败的测试套件进行把关。回归会阻止发布,可重复性是一个数字,且智能体声称的内容与验证器发现的内容之间的差距是可衡量的。
标准
如果在此处停止,哪些问题仍未解决
质量得到了衡量,但问责制没有。当出现问题时,您可以证明它发生了回归,但无法证明是谁允许其通过的。
权限、证据和升级都有所有者。不在场的人也可以重建运行,把关机制的存在是因为风险标准将其置于此处,且威胁模型比工具目录更新。
标准
如果在此处停止,哪些问题仍未解决
一切都已就绪,且没有任何内容会过期。明年,支撑系统仍将强制执行模型去年所需的补偿措施。
支撑系统根据证据进行变更,包括自行移除。组件携带了它们经过验证的模型以及废除它们的条件,并且某些内容实际上已被废除。
标准
如果在此处停止,哪些问题仍未解决
这里没有任何东西是稳定的,而这正是关键所在。一个根据证据进行调整的支撑系统需要高质量的证据,而且记分卡上的每一项指标都可能被被考核者钻空子。