编排已更新 2026-06-21 · 版本 1.0

并行化

并行化同时运行多个 LLM 调用并汇总结果。它有两种形式:分段(将任务拆分为独立子任务并并行运行)和投票(多次运行同一任务以提高可靠性或覆盖率)。它能降低延迟并提高质量。

证据: 行业观察置信度: 来源: 行业观察

问题

依次运行独立的子任务会浪费时间,而且对困难任务进行单次采样可能不可靠。

适用场景

当子任务相互独立时(分段),或者当对同一任务进行多次尝试可以提高置信度或覆盖率时(投票),请使用并行化。

解决方案

分段:将工作拆分为独立的部分,并发运行它们,然后合并输出。投票:多次运行相同的提示词(或带有变体),并通过多数票、并集或裁判模型进行汇总。

与顺序执行相比,两者都能减少实际运行时间;此外,在单次采样存在风险的任务中,投票通过增加额外成本来换取更高的可靠性。

组件

任务拆分器并发工作器聚合器(合并/投票/裁判)

优势

  • 通过并发运行调用来降低延迟。
  • 投票可以提高可靠性和覆盖率。
  • 每个并行调用都保持简单和专注。

风险

  • 投票会成倍增加 Token 成本。
  • 聚合逻辑可能很难处理得当。
  • 假设独立的子任务实际上可能会相互影响。

不适用场景

  • 当子任务依赖于彼此的输出时——请使用链式调用。
  • 当预算紧张且单次调用已足够时。
  • 当结果无法进行有意义的聚合时。

技术

LangGraphAsync runtimesOpenAI Agents SDKMap-reduce frameworks

示例

  • 同时总结多个文档,然后合并这些摘要。
  • 与主响应并行运行安全检查。
  • 对一个回答进行多次采样并取多数意见。

KPI

相比顺序执行的延迟降低幅度
通过并发运行调用节省的实际运行时间;这是该模式的核心意义。
聚合质量
合并并行输出是否能保持正确性——难点在于合并,而不是分发。
并发成本
所有并行分支的总 Token 数;这是用资金换取速度,因此需要注意倍数效应。
速率限制/限流率
并行调用触发服务商速率限制的频率,这会默默地将调用转为串行或导致失败。

已观测到的失效模式

  • 聚合错误:并行结果单独来看是正确的,但合并方式错误(如重复计算、相互矛盾)。
  • 速率限制将预期的并行执行重新变回缓慢的串行调用。
  • 意外的成本:即使只使用一个结果,N 个并行分支也会产生 N 倍的成本。
  • 部分失败处理:某个分支失败,导致聚合器阻塞或默默丢弃该分支。

经验教训

  • 优先设计聚合步骤——良好地合并结果比拆分工作更难。
  • 通过批处理或退避机制来遵守服务商的速率限制,否则并行性将不复存在。
  • 仅对独立的子任务进行并行化;存在依赖关系的任务无论如何都必须按顺序执行。
  • 在生产环境中发生部分失败之前,明确决定如何处理它们。

常见问题

分段和投票有什么区别?
分段将一个任务拆分为不同的独立子任务;投票则多次运行同一任务并进行聚合以提高可靠性。
投票总能提高质量吗?
在样本存在差异的任务中通常如此,但它会成倍增加成本。请将其保留用于单次采样存在风险的高风险步骤。
如何合并并行结果?
视具体情况而定:拼接各段内容、采用多数票、取结果的并集,或使用裁判模型进行综合。

参考文献