GOV-007プレイブック更新日 2026-06-21 · バージョン 1.0

人間による監視と説明責任に関するポリシー

EU AI Act第14条の人間による監視を、エージェント型AI向けに実践へと落とし込む運用ポリシーです。エージェントごとに明確な責任ある所有者を割り当て、リスクに応じて監視レベル(in-the-loop、on-the-loop、out-of-the-loop)を設定し、介入、オーバーライド、停止権限、およびエスカレーションパスを定義します。監視者が有能であり、行動を起こす時間があることを要求し、形骸化(ラバースタンプ)や自動化バイアスを防ぎます。このポリシーは、2つの失敗、すなわち「人間が不在であること」と、エージェントの行動を実際に理解、オーバーライド、または説明できない「名ばかりの人間」を防ぐために存在します。

エビデンス: 業界での観察確信度: ソース: 業界での観察ソース: 論文
EU AI Act

定義

人間による監視と説明責任に関するポリシーとは、各エージェントに対して責任を負う特定の人間を割り当て、有能な人物がその行動を理解、介入、および停止できることを保証する、拘束力のあるルールセットです。

スコープ

ツールを使用する、システム上で動作する、または重大な意思決定を行うすべての本番環境またはパイロット版のエージェント、およびそれらを監視するシステム所有者、承認者、オペレーター。これは第14条を運用可能にするものであり、法的助言に代わるものではありません。

主な要件

  • 各エージェントには、特定の責任ある所有者が1名割り当てられます。説明責任がモデルに移転されることは決してありません。
  • 監視レベルはリスクに適合させます。影響が大きい、または不可逆的なアクションにはin-the-loop、可逆的で大量のアクションにはon-the-loop、低リスクで可逆的なタスクにのみout-of-the-loopを適用します。
  • すべてのエージェントは、十分な情報に基づいた意思決定に必要なコンテキストとともに、テスト済みの拒否、修正、および停止(キルスイッチ)コントロールを公開します。
  • エスカレーションのしきい値により、影響、不可逆性、権利または安全性、確信度、および新規性に基づいて、重大な意思決定が人間にルーティングされます。
  • 監視者は、有能であり、分かりやすく情報を与えられ、行動するための真の権限と時間を持っていなければなりません。
  • 自動化バイアスや形骸化(ラバースタンプ)は、想定から排除するのではなく、積極的に対策を講じます。

コントロール

特定の責任ある所有者
各エージェントの成果に対して責任を負う人間を1名割り当てます。「モデルが決定した」という説明は受け入れられません。
リスクに適合した監視レベル
アクションの影響度と可逆性に基づいて、エージェントごとに in-the-loop、on-the-loop、または out-of-the-loop を定義します。影響度の高いアクションに対して human-approval-gate パターンを実装します。
オーバーライドおよび停止の権限
テスト済みの拒否、変更、および停止のコントロールを公開し、十分な情報に基づいたオーバーライドを行うための十分なコンテキストを提示します。停止は迅速かつ到達可能でなければなりません。
エスカレーションのしきい値
影響度、不可逆性、権利/安全性、信頼度の低さ、または新規性のしきい値を超えた場合、意思決定を人間にルーティングします。human-escalation パターンを実装します。
監視者の適格性
監視が名目上のものではなく有意義なものとなるよう、エージェントのドメインと限界について監視者をトレーニングし、認定します。
形骸化防止のセーフガード
承認を制限し、理由の提示を義務付けます。自動化バイアスを検出するために、承認時間とオーバーライド率を監視します。

チェックリスト

  • 01本番環境の各エージェントに対して責任あるオーナーを1名指名し、記録します。
  • 02各エージェントのアクションを影響度と可逆性によって分類し、監視レベルを割り当てます。
  • 03すべてのエージェントに対して、拒否、変更、および停止(キルスイッチ)のコントロールを実装し、テストします。
  • 04監視が必要な意思決定について、エージェントが理解可能なコンテキストを提示するようにします。
  • 05影響度、権利/安全性、信頼度、および新規性のエスカレーションしきい値を定義し、設定します。
  • 06エージェントのドメインと限界について監視者をトレーニングし、その認定を最新の状態に維持します。
  • 07形骸化防止のセーフガードを追加し、承認時間とオーバーライド率を監視します。
  • 08すべての承認とオーバーライドを実行者、理由、タイムスタンプとともにログに記録し、定期的にしきい値を見直します。

一般的な落とし穴

  • 形ばかりの監視:人間が、アクションを実際に評価するためのコンテキスト、権限、または時間がないまま「承認」をクリックしてしまうこと。
  • 自動化バイアス:承認者がエージェントを過度に信頼し、その出力を精査しなくなること。
  • 責任の分散:指名された単一のオーナーが存在しないため、障害が発生した際に対応すべき責任者が曖昧になること。
  • 到達不可能なオーバーライド:停止コントロールの動作が遅い、隠されている、または一度もテストされていないこと。
  • しきい値のドリフト:エスカレーションの制限が一度設定されたきり、エージェントの適用範囲が拡大しても更新されないこと。

  • 支出上限を超える支払いには人間による in-the-loop の承認が必要である一方、照合業務は on-the-loop で実行される財務エージェント。
  • 信頼度が低い場合や、リクエストが顧客の権利に影響を与える場合に、人間にエスカレーションするサポートエージェント。
  • 指名されたオーナーが責任を問われ、オーバーライドログによって誰がなぜそのアクションを承認したかが示されるインシデント。

FAQ

人間による監視とは、人間がすべてを承認することを意味しますか?
いいえ。監視は階層化されています。影響度が高いアクションや不可逆的なアクションには in-the-loop、可逆的で大量のアクションには on-the-loop のモニタリング、そして全体として human-in-command の姿勢をとります。このモデルはリスクに応じて拡張されるため、監視が承認疲れに陥ることなく、有意義な状態を維持できます。
責任をAIベンダーに負わせることはできますか?
いいえ。ベンダーとの関係は別途管理されますが、エージェントがどのようにデプロイされ使用されるかについては、指名されたシステムオーナーが引き続き責任を負います。自動化はツールであり、言い訳にはなりません。
形骸化や自動化バイアスを防ぐにはどうすればよいですか?
各意思決定について理解可能なコンテキストを提示し、承認を制限して理由の提示を義務付け、承認時間とオーバーライド率を監視し、トレーニングやローテーションを通じて監視者の適格性を維持します。

参考文献