SANTISMM Labs · ハーネスエンジニアリング

エージェント型コントロールサンドボックス

エージェントを設定し、脅威を選択し、18のコントロールをオン/オフに切り替えます。画面上のすべての情報は、タクソノミーとコントロールマトリクスから派生したものです(このラボが表示を拒否している数値も含みます)。

マトリクス v1.2 · タクソノミー v1.1EU AI Act · ISO/IEC 42001 · NIST AI RMF · OWASP LLM Top 10 · MITRE ATLAS

多くのエージェントセキュリティのデモは、レジリエンスマージンや保護スコア、十分な数のスイッチをオンにすると緑色になるゲージなど、安心感を与える数値で終わります。しかし、このデモはそうではありません。その数値を省いていることこそが重要なポイントです。18のコントロールとそれに対応するフレームワークのマッピングは本物ですが、モデルの生成結果に対して測定されたものは一つもありません。そのため、残留リスクの数値を算出するには、存在しない係数が必要になります。代わりに得られるのは「カバレッジ」です。どのクアドラントを満たし、どれを空のままにし、どの脅威マッピングに触れたかを示します。カバレッジは選択に関する事実です。一方で、残留リスクは世界に対する主張になってしまいます。

01エージェント

Claude CodeGAA3·T2·D1·M2·L1·I1

ここに分類される理由: ターミナルネイティブ。インプレースで編集し、Git経由でPRを配信します。

A自律性

誰がトリガーを引くか?

Delegated(委任):タスク全体を実行し、人間がレビューする

T時間的ホライズン

どのくらいの期間生存するか?

Task(タスク):数分〜数時間、成果物の納品時に消滅する

Dドメインの広さ

何をカバーするか?

Vertical(垂直):1つのドメイン(コーディング、CX、法務など)

Mメモリとアイデンティティ

何を記憶し、どのように変化するか?

ユーザー/プロジェクトメモリ(記憶するが、変化しない)

Lモデル結合度

特定のラボに紐づいているか?

単一モデル(Mono-model):プロバイダーに紐づいている

I稼働アイデンティティ

誰の資格情報で動作するか?

ユーザーの資格情報(監査において区別不能)

02脅威

コントロール自体から読み取ります。以下の各エントリは、少なくとも1つのコントロールが対処を主張しているOWASP LLM Top 10の項目です。数値は、それを主張しているコントロールの数を示しています。

03防御策

0/18

権限とアクセス範囲

  • フィードフォワード推論的
  • フィードフォワード確定的
  • フィードフォワード確定的

送信と露出

  • フィードフォワード確定的
  • フィードバック確定的
  • フィードフォワード確定的

実行

  • フィードフォワード確定的
  • フィードバック確定的
  • フィードバック推論的

人の監視

  • フィードフォワード推論的
  • フィードバック推論的

エビデンス

  • フィードバック確定的
  • フィードバック推論的

ライフサイクルと入力

  • フィードフォワード確定的
  • フィードフォワード確定的
  • フィードバック推論的
  • フィードフォワード確定的
  • フィードバック推論的