ハーネス成熟度モデル

ハーネス成熟度モデル

プロンプト型から適応型まで、7つのレベルがあります。形容詞で説明されたレベルでは誰も位置づけられないため、最下層より上のすべてのレベルには、合否を判定できる基準が設けられています。これは累積的であり、そのレベルおよびそれ以下のすべての基準に合格した場合にのみ、そのレベルを保持しているとみなされます。

バージョン 1.0 · 更新日 2026-08-27 · 7 レベル · 18 基準

JSONマシン読み取り可能

読み方

メニュー形式ではなく、累積的です。ハーネスがレベル4を保持するのは、評価スイートがあるときではなく、レベル1、2、3、4のすべてに合格したときです。このルールがなければ、誰もがすでに満たしている段階だけを選択してしまい、モデルによる位置づけが機能しなくなります。

すべての基準は、結果を伴うアクションです。実行して回答を得られないものは、ここには含まれません。表現がコントロールマトリックスのテストと意図的に同じ形式になっているのは、それらが本質的に同じ種類のものだからです。

また、各レベルには、そこで立ち止まった場合に何が壊れたままになるかも示されています。この後半部分こそが誠実な内容です。レベルは美徳ではなく、誰かが意図的に行ったトレードオフなのです。

これは自己評価であり、最も弱い評価形式です。このモデルは基準について議論できるように公開されており、その背後にある主張には、どのような場合にその順序付けを覆す条件が示されています。

cumulativetheoreticallow

根拠となる主張: HE-CLAIM-006get_claim を使用して MCP 経由で取得可能。

レベル 0

プロンプト駆動(Prompted)

prompted

人間がすべての実行を主導します。モデルは手動で呼び出され、プロンプトはチャットウィンドウや誰かのメモの中に存在し、実行に関する情報は何も残りません。

最下層。独自の基準はありません。レベル1を満たせない場合、ハーネスはこの状態になります。

ここで停止した場合に破損したままになるもの

再現性が一切ないため、改善も不可能です。2人の人間が同じことを要求しても、異なる2つのシステムが構築され、どちらもなぜ自分のシステムが機能しているのかを説明できません。

レベル 1

スクリプト化(Scripted)

scripted

呼び出しがコード化され、プロンプトはバージョン管理された成果物となります。実行は、誰かの記憶からではなく、リポジトリから再現できます。

基準

  1. 先月の実行結果を取得して再現します。プロンプト、モデル、およびパラメータはすべてバージョン管理システムから取得されます。

    読み取り元ACM-15

  2. プロンプトを変更します。変更は作成者と日付を伴う差分(diff)として表示され、以前のバージョンも引き続き取得可能です。

    読み取り元ACM-15

  3. 特定の実行を提供したモデルのバージョンを問い合わせます。回答は、その週に何が最新であったかという推測からではなく、記録から得られます。

    読み取り元ACM-10ACM-15

ここで停止した場合に破損したままになるもの

エージェントはまだ何も実行できないため、そのコストは役に立たないという事実によって制限されます。ここで立ち止まるのは妥当な選択肢ですが、手元にあるものをエージェントと呼ぶのは妥当ではありません。

レベル 2

ツール化(Tooled)

tooled

エージェントは、宣言されたツールサーフェスを介して実際のシステムに作用します。すべてのツールがリスト化され、スコープが定義され、所有者が割り当てられ、不適切な場所を指している場合はサーバー側で拒否されます。

基準

  1. ツールカタログを提示します。エージェントが呼び出せるすべてのツールがカタログに含まれており、書面によるスコープ、書き込み権限の有無、および指名された所有者が明記されている必要があります。

    読み取り元ACM-01

  2. 各ツールについて、その資格情報と、その資格情報のサーバー側のスコープを示します。2つのツールが、それぞれの範囲を超えるような資格情報を共有していないことを確認します。

    読み取り元ACM-02

  3. スコープ外のターゲットを指定して、書き込み可能なツールを呼び出します。モデルが拒否するのではなく、ツール自体の境界によって拒否されることを確認します。

    読み取り元ACM-03測定方法contain

ここで停止した場合に破損したままになるもの

エージェントが被害をもたらす可能性が生じ、その規模を制限するものはまだありません。これ以降のすべてのインシデントは、重要なシステムにおけるインシデントとなります。

レベル 3

境界制限(Bounded)

bounded

ハーネスは、モデルに遵守を求めることなく制限を強制します。送信(egress)はデフォルト拒否、消費はホストによって上限が設定され、信頼できないコンテンツは命令ではなくデータとして扱われます。

基準

  1. エージェントの環境内部から、リストにないホストをリクエストします。ネットワークまたはプロキシレイヤーで失敗し、拒否がタイムアウトではなくセキュリティシグナルとして届くことを確認します。

    読み取り元ACM-04ACM-05

  2. 終了しないように設計されたタスクを実行します。クォータによって停止され、その停止が記録され、試行コストが開始前に制限され、把握されていたことを確認します。

    読み取り元ACM-07

  3. エージェントが取得するドキュメント内に命令を仕込みます。エージェントはそれを読み取ることはあっても、実行してはならず、その試行が後から確認できる必要があります。

    読み取り元ACM-12ACM-13

ここで停止した場合に破損したままになるもの

影響範囲(ブラストライディアス)は制限されますが、品質は制限されません。システムは安全に失敗しますが、それが機能しているかどうかは誰にもわかりません。

レベル 4

評価(Evaluated)

evaluated

変更は、誰かが失敗するのを確認したテストスイートによってゲート(制限)されます。デグレード(リグレッション)はリリースをブロックし、再現性は数値化され、エージェントの主張と検証者が発見した事実とのギャップが測定されます。

基準

  1. 既知のデグレードを導入します。テストスイートがそれを検出し、変更が出荷されないことを確認します。一度も失敗したことのないテストスイートの検出率は、完璧なのではなく、不明であるとみなされます。

    読み取り元ACM-11測定方法catch

  2. 何も変更せずに評価セットを5回実行し、何件のケースが毎回同じ判定に達したかを特定します。その数値が存在し、誰かがそれを把握している必要があります。

    読み取り元ACM-11測定方法dband

  3. 一連の実行においてエージェントが主張した内容と、独立した検証者が発見した内容を比較します。その差異は数値化され、ゼロであるとは仮定されません。

    読み取り元ACM-10ACM-11測定方法vgap

ここで停止した場合に破損したままになるもの

品質は測定されますが、説明責任は測定されません。問題が発生した際、それがデグレードしたことは証明できても、誰がそれを通過させたのかは証明できません。

レベル 5

ガバナンス(Governed)

governed

権限、エビデンス、およびエスカレーションに所有者が存在します。その場にいなかった人でも実行を再構築でき、リスク基準に基づいてゲートが設置され、脅威モデルはツールカタログよりも新しく維持されています。

基準

  1. 過去の実行をランダムに選択し、元のオペレーターが立ち会うことなく、ログのみから最初から最後まで再構築します。その後、ログに不要な機密情報が含まれていないことを確認します。

    読み取り元ACM-10測定方法recon

  2. ゲートが設定されたアクションと、それを設定したリスク基準をリストアップします。強制的にエスカレーションを発生させ、規定の時間内に、対応に必要なコンテキストを伴って指名された担当者に届くことを確認します。

    読み取り元ACM-08ACM-09測定方法hir

  3. 現在の脅威モデルと、ツールカタログの最終変更日を表示します。カタログの方が新しい場合、この基準は不合格となり、そのレベルは維持されません。

    読み取り元ACM-18

ここで停止した場合に破損したままになるもの

すべてが整っていますが、期限切れになるものがありません。ハーネスは、モデルが昨年必要としていた補償措置を、来年になっても強制し続けることになります。

レベル 6

適応型(Adaptive)

adaptive

ハーネスはエビデンスに基づいて変化し、自身を削除することもあります。コンポーネントは、検証対象となったモデルと、自身を廃止するための条件を保持しており、実際に何かが廃止された実績があります。

基準

  1. 過去2四半期に削除されたコントロール、プロンプトルール、またはコンテキストブロックを挙げ、その削除を正当化する測定結果を示してください。「それなしで試してみたが問題なさそうだった」というのは測定ではありません。

    測定方法cvo

  2. 現在も導入されているコンポーネントについて、それが検証されたモデルと、それが廃止される条件を述べてください。これらは記憶に頼るのではなく、両方とも文書化されている必要があります。

    読み取り元ACM-15

  3. 2つのモデル世代にわたり、同じタスクセットに対して正しく検証された成果あたりのコストを示してください。それぞれの世代には、その世代が実際に必要としたハーネスが適用されているものとします。

    測定方法cvotvo

ここで停止した場合に破損したままになるもの

ここにあるものは何一つ安定していませんが、それこそが本質です。根拠に基づいて変化するハーネスには、その根拠が優れていることが求められます。また、スコアカード上のすべての指標は、測定対象となる人物によってハックされる可能性があります。