Agentic AIとは何か?
Agentic AIとは、単一の回答を生成するのではなく、計画、ツールの呼び出し、環境への働きかけ、フィードバックへの対応など、複数のステップにわたって目標を追求するシステムを指す。これにより、言語モデルはテキスト生成器から、タスクを完了できる実行者へと変化する。これが表すシフトは、人間がすべてのステップを主導する「DIY(Do-It-Yourself)ソフトウェア」から、システムが作業を実行して報告する「DIFM(Do-It-For-Me)ソフトウェア」への移行である。
定義
Agentic AIとは、モデルをメモリ、ツール、コントロールループと組み合わせることで、複数ステップのタスクを自律的に計画および実行するAIシステムのクラスである。
主な要点
- エージェント = モデル + ツール + メモリ + 次に何をすべきかを決定するコントロールループ。
- 自律性は、単一のツール呼び出しから長期的なタスク実行まで、スペクトラム(連続体)である。
- 信頼性は、モデル自体の生のIQからではなく、主にモデルを取り囲むハーネスから得られる。
- ツールの使用(ファンクションコーリング)は、モデルを実際のシステムやデータに接続するものである。
- 評価では、単なる回答の品質(能力)だけでなく、タスクの完了(エージェンシー)を測定しなければならない。
コンテキスト
LLM時代の大部分において、モデルはワンショットの応答者として使用されてきた。つまり、プロンプトを入力し、回答を出力する。Agentic AIは、モデルにループを提供することでこのパターンを打破する。モデルはツールの呼び出し、結果の読み取り、計画の修正を決定し、目標が達成されるか予算が使い果たされるまで継続できる。
これは、価値を「質問への回答」から「作業の完了」へと移行させるため、企業における応用AIの主要なフロンティアとなっている。例えば、サポートチケットのエンドツーエンドでの解決、コードベースのリファクタリング、調査タスクの実行、ワークフローの運用などである。
アーキテクチャ
最小限のエージェントは、推論モデル、呼び出し可能なツール群、何らかの形式のメモリまたは状態、そしてモデルの出力をアクションに変換して観察結果をフィードバックするオーケストレーションループの4つの部分で構成される。
パターンは、単純なもの(ツールと停止条件を備えたモデル)から複雑なもの(プランナーとエグゼキューターの分離、リフレクション、マルチエージェントチーム)まで多岐にわたる。Anthropicのガイダンスでは、機能する最も単純なパターンを優先し、測定可能な形で必要とされた場合にのみ構造を追加することを推奨している。
コンポーネント
メリット
- 単一の回答だけでなく、複数ステップの作業を完了する。
- フィードバックに適応し、途中のエラーから回復する。
- ツールやAPIを介して実際のシステムと統合する。
- 従来は人間のみが行っていた反復的な知識労働をスケールさせる。
リスク
- 長期的なタスクにおいてエラーが蓄積すること。
- 予算や停止条件がない場合、コストとレイテンシが際限なく増加すること。
- ツールのアクセス権限やプロンプトインジェクションによるセキュリティリスク。
- ワンショットのプロンプトと比較して、評価やデバッグが困難であること。
ツールとテクノロジー
例
- チケットを読み取り、注文を検索し、返金を適用して返信する、これらすべてをツールを介して行うカスタマーサービスエージェント。
- ファイルを編集し、テストを実行し、テストスイートが合格するまで繰り返すコーディングエージェント。
- 検索、ソースの読み込み、主張の検証を行い、引用文献付きの要約を作成するリサーチエージェント。
FAQ
- AIエージェントとアジェンティックAI(Agentic AI)の違いは何ですか?
- AIエージェントは具体的なシステムを指します。一方、アジェンティックAIは、そのような目標指向型でマルチステップのシステムを中心にソフトウェアを構築する、より広範なパラダイムを指します。
- アジェンティックであるためには、より強力なモデルが必要ですか?
- 必ずしもそうとは限りません。同じモデルであっても、タスクの成否は、それを取り囲むハーネス(ツール、メモリ、プロンプト、制御ループ)にほぼ完全に依存します。
- RAGはアジェンティックですか?
- 単なる検索拡張生成(RAG)は単一のステップです。マルチステップのループの一部として、システムが「いつ」「何を」検索するかを自律的に決定するようになったときに、アジェンティックになります。
- エージェントの信頼性が低くなる原因は何ですか?
- 長期的なタスク(ロングホライズン)では小さなエラーが蓄積され、ツールが失敗し、コンテキストが失われます。信頼性はハーネスエンジニアリング (Harness Engineering)(優れたツール、メモリ、ガードレール、評価)によってもたらされます。
- エージェントはどのように測定(評価)しますか?
- 単一の回答の品質だけでなく、環境内でのエンドツーエンドのタスク完了率をスコア化する、アジェンティックなベンチマークやタスクベースの評価(evals)を使用します。