编排已更新 2026-06-24 · 版本 1.1

路由

路由对输入进行分类,并将其引导至最合适的专用处理器、提示词或模型。它通过让每条路径针对其具体情况进行优化来提高质量,并通过将简单的请求发送给便宜的模型、将困难的请求发送给能力更强的模型来控制成本。

证据: 生产环境置信度: 来源: 生产系统来源: 个人经验来源: 行业观察

定义

路由是一种对每个传入请求进行分类并将其分发到最合适的处理器或模型的模式,从而使简单的输入使用便宜的路径,而困难的输入使用能力更强的路径。

问题

由单个提示词或模型处理每种输入会导致每种情况的效果都变差,而对所有事情都使用一个昂贵的模型会在简单的请求上浪费资金。

适用场景

当输入属于不同的类别,且这些类别能从不同的处理方式(不同的提示词、工具、模型或工作流)中受益,并且这些类别可以被可靠地分类时,请使用路由。

解决方案

轻量级分类器(LLM 调用或模型)对输入进行标记,然后路由器将其发送到匹配的下游处理器。每个处理器都针对其类别进行了专门化和优化。

路由还支持性价比分层:将简单的查询路由到快速、便宜的模型,将复杂的查询路由到更强大的推理模型,仅在需要时才为高能力付费。

组件

分类器路由逻辑专用处理器后备/默认路由

优势

  • 每条路径都针对其具体情况进行了优化,从而提高了质量。
  • 通过根据难度对模型进行分层来控制成本。
  • 关注点分离使每个处理器保持简单。

风险

  • 错误分类会导致输入走向错误的路径。
  • 分类器增加了一个步骤和一些延迟。
  • 随着时间的推移,类别漂移会降低路由准确性。

不适用场景

  • 当输入是同质的——一个处理器就足够了。
  • 当类别无法被可靠地分类时。
  • 当增加的分类步骤不值得其带来的收益时。

技术

Classifier modelsLangGraphModel routersRules engines

示例

  • 将支持工单路由到计费、技术或销售处理器。
  • 将简单的问题发送给小模型,将困难的问题发送给推理模型。
  • 将不同的文档类型引导至特定类型的提取器。

生产实践证据

上下文
在 57 天内(161 个会话/2,776 轮)观察到的单操作员、本地优先的 OpenClaw 部署,数据从智能体自身的轨迹追踪中聚合而来。
场景
入站通道消息和自主唤醒通过不同的入口点路由到同一个智能体,并通过通道/对等体/角色绑定来选择会话。
技术
绑定 + 路由注册表(resolveAgentRoute)、每通道会话密钥以及已解析路由缓存。
负载
3 个通道(Telegram、网页聊天、WhatsApp)和 4 种触发类型(用户、心跳、cron、内存)。
结果
路由在所有三个通道和四种触发类型中均保持正常,没有出现因路由错误导致的失败(整体会话成功率为 98.8%)。单操作员本地优先部署——这是一个可运行的参考,而非规模基准。

KPI

路由准确性
发送到正确处理器/模型的输入比例;这是定义该模式价值的唯一指标。
相比于“始终使用最佳模型”所节省的成本
通过将简单的输入路由到更便宜的模型,而不是对所有内容都使用顶级模型所节省的资金。
路由错误成本
错误路由带来的下游损害——一次路由错误所付出的代价可能远远超过其试图节省的成本。
路由器延迟开销
在任何实际工作开始之前,路由决策本身所增加的时间。

已观测到的失效模式

  • 错误分类:路由器将输入发送到错误的模型或路径,从而降低回答质量。
  • 模糊的输入无法清晰地适应任何路由,从而被强行归入不佳的路由。
  • 路由器成为每个请求的瓶颈或单点故障。
  • 漂移:输入分布随着时间的推移而发生偏移,导致路由器的类别过时。

经验教训

  • 针对误路由的成本进行优化,而不仅仅是路由准确率——某些错误的路由路径其代价远比其他路径高昂。
  • 为无法良好匹配任何路径的输入添加默认/备用路由。
  • 保持路由器廉价且快速;如果路由本身的开销与实际工作的开销相当,那就失去了路由的意义。
  • 监控输入漂移,并在分布发生变化时重新调整路由。

常见问题

由什么来对输入进行分类?
通常是轻量级的 LLM 调用或专用的分类器模型;对于界限清晰的情况,确定性规则可以在无需模型的情况下进行路由。
路由是如何节省成本的?
通过分层:简单的请求流向便宜、快速的模型,只有复杂的请求才会到达昂贵的推理模型,从而实现仅在需要时才为高能力付费。
如果分类器出错怎么办?
提供合理的默认路由并监控误路由;备用处理器和良好的可观测性可以限制误分类的影响。

参考文献