ARCH-004AI 劳动力更新于 2026-06-21 · 版本 1.0

AI 员工

AI 员工是由专业智能体协同组成的编排团队,在主管智能体的领导下协作处理多步骤业务流程。主管智能体负责分解目标,并将子任务按优先级分配给专业智能体(如研究、起草、QA),它们通过公共存储共享状态。当智能体能力不足时会升级上报给人类,且每个步骤都是可观测和受治理的。应将其视为管理数字化员工:成功较少取决于单个智能体,而更多取决于协同、通过智能体注册表确立的清晰权责归属、人类监督以及对整个团队而非局部进行评估。

证据: 行业观察置信度: 来源: 行业观察来源: 论文

关键概念

  • 由主管智能体分解目标并分派给专业智能体,而不是由单个智能体包揽所有工作。
  • 共享状态和智能体注册表为团队提供了记忆、清晰的权责归属以及可发现的能力。
  • 人类监督、升级上报和治理机制可以在智能体行为失当时限制爆炸半径。
  • 您需要将 AI 员工作为一个系统进行评估和衡量,而不是孤立地评估每个智能体。

定义

AI 员工架构是一个受治理的多智能体系统,其中主管智能体负责分解目标,并将排好优先级的子任务分派给专业智能体。这些智能体共享状态、可升级上报给人类,并接受端到端的观测。

架构

核心是一个主管(或编排器)智能体,它接收业务目标,将其分解为子任务计划,排列优先级,并将每个子任务路由给最适合的专业智能体。专业智能体(例如研究、起草、QA 和工具智能体)注册在智能体注册表中,该注册表记录了每个智能体的能力、输入、输出、成本和所有者,以便主管智能体进行发现和选择,并让人类对智能体行为进行问责。

智能体并不完全通过提示词传递所有内容。它们读写共享内存或状态存储,其中保存着不断演进的任务上下文、中间产物和决策。这种共享状态将松散的智能体集合凝聚成一个团队:它保持了步骤之间的连续性,让智能体能够基于彼此的工作成果继续推进,并为可观测性和审计提供了单一可信源。护栏介于智能体与工具或数据之间,用以约束行为、验证输出并防止不安全的操作。

人类监督和治理贯穿整个系统。明确的升级上报路径允许智能体在置信度较低或任务风险较高时移交给人类,而审批关卡则要求在执行不可逆操作之前获得人类的签字批准。可观测性(每个智能体和每个任务的追踪、评估、成本和延迟)使团队的行为清晰可见。由于单个智能体的故障可能会级联放大,该架构通过限制范围、设置超时和熔断器来刻意限制爆炸半径。

请求流程

  1. 1. 准入:业务目标或任务进入系统,主管智能体记录其上下文、优先级和所有权。
  2. 2. 分解与排序:主管智能体将目标分解为有序的子任务,并结合依赖关系和紧急程度进行优先级排序。
  3. 3. 分派:根据能力和成本,从智能体注册表中选择合适的专业智能体,并将每个子任务路由给它。
  4. 4. 结合共享状态执行:智能体在受护栏保护的工具下工作,读写共享存储,以便后续智能体基于先前的结果继续构建。
  5. 5. 升级或审批:当置信度较低或风险较高时,智能体会在审批关卡处等待,或升级上报给人类。
  6. 6. 组装、验证与关闭:QA 步骤检查合并后的输出,主管智能体结束任务,并输出追踪和指标以供评估。

组件

负责规划和分派的主管/编排器包含所有者和能力的专业智能体注册表专业智能体(研究、起草、QA、工具)用于任务上下文的共享内存/状态存储针对工具、数据和输出的护栏人类监督:升级上报路径和审批关卡贯穿整个 AI 员工队伍的可观测性与评估

参考场景

上下文
一家中型企业希望自动起草面向客户的政策答复,目前这需要经过研究、起草和合规审查步骤,最后由人工签字批准。
场景
目标进入系统;主管智能体将其分解为研究、起草和 QA 子任务,分别分派给对应的专业智能体,并在发布前将任何涉及合规敏感的内容路由到人工审批关卡。
技术
使用 LangGraph 进行多智能体编排,使用智能体注册表进行能力发现和权责归属,使用共享状态存储保存任务上下文,针对检索和工具设置护栏,并使用 LangSmith 或 Langfuse 进行追踪和评估。
负载
示例业务量为每周数千个任务,在工作时间会出现峰值,并存在大量需要人工升级处理的复杂长尾任务。
结果
此处的所有数据均为在您自己的环境中进行检测和衡量的参考目标,并非保证:旨在跟踪端到端任务成功率、升级率、返工率以及每个已完成任务的成本,并在声称提高生产力之前对照人工基线进行验证。

优势

  • 专业化使得每个智能体比单体智能体更简单、更容易评估且更容易确定权责归属。
  • 具备优先级排序功能的主管智能体可以处理多步骤、充满依赖关系的工作,而单个智能体很难理清这些工作的顺序。
  • 共享状态和注册表使团队具备可审计性,拥有清晰的权责归属和可发现的能力。
  • 人类监督和治理让您能够在限制风险的同时,逐步引入自动化。

风险

  • 协同成本呈非线性增长;更多的智能体和交接可能会增加延迟并导致错误累积。
  • 单个智能体中的错误可能会在整个团队中级联,从而扩大故障的爆炸半径。
  • 如果没有智能体注册表和清晰的权责归属,行为就会变得不透明,且无人负责。
  • 如果仅按单项任务衡量,而不是对照真实的端到端人工基线,那么关于生产力提升的说法可能是虚幻的。

KPI

端到端任务成功率
无需人工纠正即可正确完成的任务比例;这是衡量团队是否真正发挥作用的首要指标。
升级率
移交给人类的任务比例;比例过高意味着自动化程度不足,过低则可能意味着存在不安全过度自动化的风险。
返工/纠正率
输出被退回或修正的频率;返工率上升标志着级联错误或 QA 环节薄弱。
每个已完成任务的成本
每个已完成任务的总模型、工具和人工审核成本;这是声称提高生产力背后的真实单体经济效益。
协同开销
与单智能体基线相比,因交接而增加的延迟和 Token 成本;需密切关注其随团队规模扩大而增长的情况。

成本与扩展

  • 通过在注册表后添加专业智能体来进行扩展,但要将每次添加视为需要评估的新协同界面。
  • 对工作进行分区,使独立的子任务并行运行,同时保持共享状态的一致性。
  • 应用超时、带退避的重试以及熔断器,使缓慢或失败的智能体不会拖延整个任务。
  • 对人类监督进行分级:对低风险任务进行较轻的审核,对不可逆或敏感任务设置强制审批关卡。

已观测到的失效模式

  • 级联故障:错误的中间结果被下游信任,从而破坏了最终输出。
  • 协同死锁或循环:智能体相互等待,或无限期地重新分派同一个子任务。
  • 共享状态丢失或过期:智能体基于过时的上下文采取行动,导致输出结果不一致。
  • 升级遗漏:智能体继续执行高风险任务,而不是移交给人类。

经验教训

  • 从能够运转的最简团队开始,只有在证明单个智能体确实无法应对时,才增加专业智能体。
  • 尽早投入建设智能体注册表、权责归属和共享状态契约;这些是使系统可治理的关键所在。
  • 端到端地评估整个 AI 员工队伍,而不仅仅是单个智能体,因为协同往往是出现问题的地方。
  • 从第一天起就设计好升级机制和爆炸半径限制,而不是在发生事故后才强行加入治理机制。

技术

Multi-agent orchestration (LangGraph)Agent registryShared memory / state storeHuman oversight & approvalsGuardrailsObservability (LangSmith / Langfuse)

示例

  • 研究与报告工作流,其中主管智能体将收集、综合和事实核查 QA 分派给不同的智能体。
  • 客户回复流水线,负责起草回复,但将合规敏感的案例路由到人工审批关卡。
  • 由智能体组成的运营后台团队,负责对工单进行分类、准备行动,并将异常情况升级上报给员工。

常见问题

这与单个 AI 智能体有什么不同?
单个智能体自身完成所有的推理和工具使用。而 AI 员工是在主管智能体领导下协同工作的多个智能体,主管智能体负责分解目标、分派给专业智能体、共享状态并治理整个团队;其难点在于协同、权责归属和爆炸半径,而不是单个智能体的能力。
智能体数量越多,系统就一定会越好吗?
不一定。每增加一个智能体都会引入交接、延迟和新的故障点。只有在更简单的团队架构明显无法完成工作时,才引入专职智能体,并衡量协调开销,以确保编排成本不会超过其带来的收益。
我们该如何衡量真正的生产力提升?
对照真实的人工基准进行端到端衡量:任务成功率、升级率、返工率以及单次完成任务的成本。单项任务的提速可能会掩盖下游的纠错和审核时间,因此只有在通过完整的端到端评估后,才能将这些提升计入收益。

参考文献