ハーネスエンジニアリング更新日 2026-06-24 · バージョン 1.1

AIエージェントのオブザーバビリティとは何ですか?

AIオブザーバビリティとは、AIシステム(特にエージェント)をインストルメンテーションし、何を実行したか、そしてその理由を可視化する手法です。プロンプト、ツール呼び出し、取得されたコンテキスト、モデルの出力、トークン、レイテンシ、コストなど、各ステップのトレースをキャプチャします。エージェントは非決定的かつマルチステップであるため、オブザーバビリティこそが障害の診断を可能にし、体系的な改善を実現します。これは評価にデータを供給し、ハーネスエンジニアリング (Harness Engineering) のループを閉じるレイヤーです。

エビデンス: 本番環境確信度: ソース: 本番システムソース: 個人の経験ソース: 業界での観察

定義

AIオブザーバビリティとは、AIシステムの挙動(すべてのプロンプト、ツール呼び出し、リトリーバル、出力、トークン、レイテンシ、コスト)のトレース、メトリクス、ログをキャプチャし、その意思決定を理解、デバッグ、改善できるようにする手法です。

主な要点

  • オブザーバビリティにより、非決定的なエージェントのデバッグが可能になります。
  • トレースは、プロンプト、ツール、コンテキスト、出力、コストといった各ステップを記録します。
  • 評価にデータを供給します。可視化し測定できるものこそが改善可能です。
  • 品質、レイテンシ、コスト、安全性を統合して追跡します。
  • 新たな標準(OpenTelemetry GenAI)により、トレースのポータビリティが向上します。

コンテキスト

従来のソフトウェアは決定的であり、ログの記録も容易です。しかし、エージェントは異なります。同じ入力であっても異なる経路をたどり、異なるツールを呼び出し、異なる出力を生成することがあります。トレースがなければ、障害はブラックボックスのままです。

オブザーバビリティはそのブラックボックスを開きます。実行の全軌跡を記録することで、チームはエージェントがどこで誤ったのか、なぜツールが失敗したのか、どこでコストが膨らんだのかを把握し、それらの知見を評価(evals)やハーネスの変更に反映させることができます。

アーキテクチャ

インストルメンテーションは、モデル呼び出し、ツール呼び出し、リトリーバルといった各ステップのスパンを、入力、出力、トークン、レイテンシ、エラーとともにキャプチャし、実行全体のトレースにリンクします。メトリクスは、品質、コスト、レイテンシ、失敗率を時系列で集計します。

OpenTelemetryのGenAIセマンティックコンベンションは、これらのトレースの構造を標準化し、独自のサイロではなく一般的なオブザーバビリティバックエンドに流し込めるようにします。また、トレースは評価データセットの原材料にもなります。

コンポーネント

トレーシング(ステップごとのスパン)メトリクス(品質、コスト、レイテンシ)ログトークンとコストの集計エラートラッキングトレースから評価へのパイプライン

メリット

  • 不透明なエージェントの実行を、診断可能なトレースに変換します。
  • コスト、レイテンシ、障害のホットスポットを顕在化させます。
  • 評価と継続的な改善にデータを供給します。
  • インシデント対応やガバナンス監査をサポートします。

リスク

  • トレースに墨消し(マスキング)が必要な機密データが含まれる可能性があります。
  • 大規模運用におけるインストルメンテーションのオーバーヘッドとストレージコスト。
  • 適切なクエリがない大量のデータは、重要なシグナルを埋もれさせます。
  • ログに記録されたプロンプトに対するプライバシーおよび保持の義務。

ツールとテクノロジー

OpenTelemetry(GenAIコンベンション)LangSmithLangfuseArize / Phoenix標準的なAPMバックエンド

  • 失敗したエージェントの実行を、エラーが発生した正確なツール呼び出しまでトレースすること。
  • タスクごとのトークンコストを追跡し、高コストなプロンプトを特定すること。
  • 本番環境のトレースを評価データセットに変換すること。
  • 実践例:単一オペレーターによる57日間の自律型デプロイメント(OpenClaw)において、ローカルの軌跡トレースから161セッション/2,776ターンを追跡。セッション成功率98.8%、1ターンあたりp50が8.1秒、p95が87.6秒、トークンの約70%がキャッシュから提供され、100万トークンあたりのブレンドコストは15.21ドル(一部のコストのみ計上されているため最低値)。すべての数値はエージェント自身のトレースから導出されています。

FAQ

なぜエージェントにはチャットボット以上のオブザーバビリティが必要なのですか?
エージェントはマルチステップかつ非決定的であるため、単一の回答の裏に多くの内部的な意思決定が隠されています。それらのステップのトレースがなければ、障害を診断することはできません。
オブザーバビリティは評価とどのように関係していますか?
オブザーバビリティは何が起きたかをキャプチャし、評価はそれが適切であったかを判断します。トレースは評価(evals)が実行されるデータとなり、改善のループを閉じます。
AIトレースの標準はありますか?
OpenTelemetryの生成AI(generative-AI)セマンティックコンベンションがポータブルな標準として台頭しつつあり、AIトレースを主要なオブザーバビリティツールに流し込めるようになっています。
何を測定すべきですか?
品質(タスクの成功)、コスト(トークン)、レイテンシ、安全性を統合して測定します。タスクに失敗する、高速で安価なエージェントは優れたエージェントとは言えません。

参考文献