オーケストレーション更新日 2026-06-24 · バージョン 1.1
ルーティング
ルーティングは、入力を分類し、最も適切な専用のハンドラー、プロンプト、またはモデルに転送します。各パスをそのケースに合わせて最適化できるようにすることで品質を向上させ、簡単なリクエストは安価なモデルに、難しいリクエストは能力の高いモデルに送信することでコストを制御します。
エビデンス: 本番環境確信度: 低ソース: 本番システムソース: 個人の経験ソース: 業界での観察
定義
ルーティングは、入ってくる各リクエストを分類し、最も適切なハンドラーまたはモデルにディスパッチするパターンです。これにより、簡単な入力には安価なパスを使用し、難しい入力には能力の高いパスを使用します。
課題
単一のプロンプトやモデルですべての種類の入力を処理すると、それぞれの処理品質が低下します。また、すべてに1つの高価なモデルを使用すると、簡単なリクエストに対して無駄なコストが発生します。
適用対象
入力が、異なる処理(異なるプロンプト、ツール、モデル、またはワークフロー)から恩恵を受ける明確なカテゴリに分類され、かつそれらのカテゴリを高い信頼性で分類できる場合にルーティングを使用します。
解決策
軽量な分類器(LLM呼び出しまたはモデル)が入力にラベルを付け、ルーターがそれを対応するダウンストリームのハンドラーに送信します。各ハンドラーはそのカテゴリに特化し、最適化されています。
ルーティングは、コストパフォーマンスの階層化(ティアリング)も可能にします。単純なクエリは高速で安価なモデルにルーティングし、複雑なクエリはより強力な推論モデルにルーティングすることで、必要なときにのみ能力に対してコストを支払うことができます。
コンポーネント
分類器ルーティングロジック専用ハンドラーフォールバック / デフォルトルート
メリット
- 各パスがそのケースに合わせて最適化され、品質が向上します。
- 難易度に応じてモデルを階層化することによるコスト制御。
- 関心の分離により、各ハンドラーをシンプルに保つことができます。
リスク
- 誤分類により、入力が誤ったパスに送信されます。
- 分類器によってステップが追加され、一定のレイテンシーが発生します。
- 時間の経過に伴うカテゴリのドリフトにより、ルーティングの精度が低下します。
非推奨のケース
- 入力が均一である場合:1つのハンドラーで十分です。
- カテゴリを高い信頼性で分類できない場合。
- 追加される分類ステップが、得られる効果に見合わない場合。
テクノロジー
Classifier modelsLangGraphModel routersRules engines
事例
- サポートチケットを請求、技術、または営業のハンドラーにルーティングする。
- 単純な質問は小規模なモデルに、難しい質問は推論モデルに送信する。
- 異なるドキュメントタイプを、タイプ固有の抽出器に転送する。
本番環境での実績
- コンテキスト
- エージェント自身のトラジェクトリトレースから集計された、57日間にわたる(161セッション / 2,776ターン)シングルオペレーター、ローカルファーストのOpenClawデプロイメントの観察結果。
- シナリオ
- インバウンドチャネルのメッセージと自律的な起動は、異なるエントリポイントを介して1つのエージェントにルーティングされ、チャネル/ピア/ロールのバインディングによってセッションが選択されます。
- テクノロジー
- バインディング + ルートレジストリ(resolveAgentRoute)、チャネルごとのセッションキー、および解決済みルートキャッシュ。
- 負荷
- 3つのチャネル(Telegram、Webチャット、WhatsApp)と4つのトリガータイプ(ユーザー、ハートビート、cron、メモリ)。
- 結果
- ルーティングは3つのチャネルすべてと4つのトリガータイプすべてで維持され、障害として表面化するような誤ルーティングはありませんでした(全体で98.8%のセッション成功率)。シングルオペレーター、ローカルファーストのデプロイメントであり、スケールベンチマークではなく、動作するリファレンスです。
KPI
- ルーティング精度
- 正しいハンドラー/モデルに送信された入力の割合。このパターンの価値を定義する唯一のメトリックです。
- 常に最良 of モデルを使用した場合と比較したコスト削減
- すべてに最上位のモデルを使用する代わりに、簡単な入力をより安価なモデルにルーティングすることによって節約されたコスト。
- 誤ルーティングコスト
- 誤ったルートによるダウンストリームへの被害。誤ルーティングは、追求した削減コストをはるかに上回るコストを伴う可能性があります。
- ルーターのレイテンシーオーバーヘッド
- 実際の処理が開始される前に、ルーティングの決定自体によって追加される時間。
観察された失敗パターン
- 誤分類:ルーターが誤ったモデルまたはパスに入力を送信し、回答の品質を低下させます。
- どのルートにも明確に適合せず、不適切なルートに強制的に割り当てられてしまう曖昧な入力。
- ルーターがすべてのリクエストのボトルネックまたは単一障害点になります。
- ドリフト:時間の経過とともに入力の分布が変化し、ルーターのカテゴリが陳腐化します。
得られた教訓
- ルーティングの正確性だけでなく、誤ルーティングのコストを最適化します。一部の誤ったルートは、他のルートよりもはるかにコストが高くなります。
- いずれにもうまく一致しない入力に対して、デフォルト/フォールバックルートを追加します。
- ルーターは安価かつ高速に保ちます。ルーターのコストが実際の処理と同等になってしまっては、本末転倒です。
- 入力のドリフトを監視し、分布の変化に応じてルートを再調整します。
FAQ
- 入力はどのように分類されますか?
- 通常は軽量なLLM呼び出しや専用の分類モデルを使用します。明確なケースでは、モデルを使用せずに決定論的なルールでルーティングすることも可能です。
- ルーティングによってどのようにコストを削減できますか?
- 階層化(ティアリング)によるものです。簡単なリクエストは安価で高速なモデルに送り、困難なリクエストのみを高価な推論モデルに送ることで、必要なときにだけ機能に対するコストを支払うようにします。
- 分類器が誤っていた場合はどうなりますか?
- 適切なデフォルトルートを用意し、誤ルーティングを監視します。フォールバックハンドラーと優れたオブザーバビリティにより、誤分類の影響を抑えることができます。