编排已更新 2026-06-21 · 版本 1.0
并行化
并行化同时运行多个 LLM 调用并汇总结果。它有两种形式:分段(将任务拆分为独立子任务并并行运行)和投票(多次运行同一任务以提高可靠性或覆盖率)。它能降低延迟并提高质量。
证据: 行业观察置信度: 高来源: 行业观察
问题
依次运行独立的子任务会浪费时间,而且对困难任务进行单次采样可能不可靠。
适用场景
当子任务相互独立时(分段),或者当对同一任务进行多次尝试可以提高置信度或覆盖率时(投票),请使用并行化。
解决方案
分段:将工作拆分为独立的部分,并发运行它们,然后合并输出。投票:多次运行相同的提示词(或带有变体),并通过多数票、并集或裁判模型进行汇总。
与顺序执行相比,两者都能减少实际运行时间;此外,在单次采样存在风险的任务中,投票通过增加额外成本来换取更高的可靠性。
组件
任务拆分器并发工作器聚合器(合并/投票/裁判)
优势
- 通过并发运行调用来降低延迟。
- 投票可以提高可靠性和覆盖率。
- 每个并行调用都保持简单和专注。
风险
- 投票会成倍增加 Token 成本。
- 聚合逻辑可能很难处理得当。
- 假设独立的子任务实际上可能会相互影响。
不适用场景
- 当子任务依赖于彼此的输出时——请使用链式调用。
- 当预算紧张且单次调用已足够时。
- 当结果无法进行有意义的聚合时。
技术
LangGraphAsync runtimesOpenAI Agents SDKMap-reduce frameworks
示例
- 同时总结多个文档,然后合并这些摘要。
- 与主响应并行运行安全检查。
- 对一个回答进行多次采样并取多数意见。
KPI
- 相比顺序执行的延迟降低幅度
- 通过并发运行调用节省的实际运行时间;这是该模式的核心意义。
- 聚合质量
- 合并并行输出是否能保持正确性——难点在于合并,而不是分发。
- 并发成本
- 所有并行分支的总 Token 数;这是用资金换取速度,因此需要注意倍数效应。
- 速率限制/限流率
- 并行调用触发服务商速率限制的频率,这会默默地将调用转为串行或导致失败。
已观测到的失效模式
- 聚合错误:并行结果单独来看是正确的,但合并方式错误(如重复计算、相互矛盾)。
- 速率限制将预期的并行执行重新变回缓慢的串行调用。
- 意外的成本:即使只使用一个结果,N 个并行分支也会产生 N 倍的成本。
- 部分失败处理:某个分支失败,导致聚合器阻塞或默默丢弃该分支。
经验教训
- 优先设计聚合步骤——良好地合并结果比拆分工作更难。
- 通过批处理或退避机制来遵守服务商的速率限制,否则并行性将不复存在。
- 仅对独立的子任务进行并行化;存在依赖关系的任务无论如何都必须按顺序执行。
- 在生产环境中发生部分失败之前,明确决定如何处理它们。
常见问题
- 分段和投票有什么区别?
- 分段将一个任务拆分为不同的独立子任务;投票则多次运行同一任务并进行聚合以提高可靠性。
- 投票总能提高质量吗?
- 在样本存在差异的任务中通常如此,但它会成倍增加成本。请将其保留用于单次采样存在风险的高风险步骤。
- 如何合并并行结果?
- 视具体情况而定:拼接各段内容、采用多数票、取结果的并集,或使用裁判模型进行综合。