ARCH-004KI-WorkforceAktualisiert 2026-06-21 · Version 1.0

AI Workforce

Eine AI Workforce ist ein orchestriertes Team spezialisierter Agenten, die unter der Leitung eines Supervisors bei mehrstufigen Geschäftsprozessen zusammenarbeiten. Der Supervisor zerlegt ein Ziel, priorisiert und delegiert Teilaufgaben an spezialisierte Agenten (Recherche, Entwurf, QS), und diese teilen ihren Zustand über einen gemeinsamen Speicher. Agenten eskalieren an Menschen, wenn sie an ihre Grenzen stoßen, und jeder Schritt ist beobachtbar und gesteuert. Betrachten Sie dies wie das Management digitaler Mitarbeiter: Der Erfolg hängt weniger von einem einzelnen Agenten ab, sondern vielmehr von der Koordination, einer klaren Verantwortlichkeit über ein Agenten-Registry, menschlicher Aufsicht und der Bewertung des gesamten Teams anstelle einzelner Teile.

Evidenz: BranchenbeobachtungKonfidenz: MittelQuelle: BranchenbeobachtungQuelle: Paper

Schlüsselkonzepte

  • Ein Supervisor zerlegt Ziele und delegiert sie an spezialisierte Agenten, anstatt dass ein einzelner Agent alles erledigt.
  • Ein gemeinsamer Zustand (Shared State) und ein Agenten-Registry verleihen dem Team ein Gedächtnis, klare Verantwortlichkeiten und auffindbare Fähigkeiten.
  • Menschliche Aufsicht, Eskalation und Governance begrenzen den Schadensradius (Blast Radius), wenn Agenten fehlerhaft agieren.
  • Sie bewerten und messen die Workforce als System und nicht jeden Agenten isoliert.

Definition

Die AI-Workforce-Architektur ist ein gesteuertes Multi-Agenten-System, in dem ein Supervisor Ziele zerlegt und priorisierte Teilaufgaben an spezialisierte Agenten delegiert, die einen gemeinsamen Zustand teilen, an Menschen eskalieren und durchgängig (End-to-End) überwacht werden.

Architektur

Im Zentrum steht ein Supervisor (oder Orchestrator), der ein Geschäftsziel empfängt, es in einen Plan aus Teilaufgaben zerlegt, diese priorisiert und jede an den am besten geeigneten spezialisierten Agenten weiterleitet. Spezialisten – beispielsweise Agenten für Recherche, Entwurf, QS und Tool-Nutzung – sind in einem Agenten-Registry registriert. Dieses erfasst die Fähigkeiten, Eingaben, Ausgaben, Kosten und Verantwortlichen jedes Agenten, sodass der Supervisor sie finden und auswählen kann und Menschen die Verantwortung für deren Verhalten zuweisen können.

Agenten übergeben nicht alles über Prompts. Sie lesen und schreiben in einen gemeinsamen Speicher oder Zustandsspeicher (State Store), der den sich entwickelnden Aufgabenkontext, Zwischenergebnisse und Entscheidungen enthält. Dieser gemeinsame Zustand macht aus einer losen Sammlung von Agenten erst ein Team: Er wahrt die Kontinuität über Schritte hinweg, lässt Agenten auf der Arbeit der anderen aufbauen und bietet eine Single Source of Truth für Observability und Audits. Guardrails befinden sich zwischen Agenten und Tools oder Daten, um Aktionen einzuschränken, Ausgaben zu validieren und unsichere Operationen zu verhindern.

Das gesamte System wird von menschlicher Aufsicht und Governance umrahmt. Definierte Eskalationspfade ermöglichen es einem Agenten, an eine Person zu übergeben, wenn das Vertrauen (Confidence) gering ist oder eine Aufgabe ein hohes Risiko birgt. Approval Gates erfordern eine menschliche Freigabe vor irreversiblen Aktionen. Observability (Traces, Evaluierungen, Kosten und Latenz pro Agent und Job) macht das Verhalten des Teams nachvollziehbar. Da Fehler bei einem Agenten kaskadieren können, begrenzt die Architektur den Schadensradius (Blast Radius) bewusst durch Scoping, Timeouts und Circuit-Breaker.

Anfrage-Flow

  1. 1. Erfassung (Intake): Ein Geschäftsziel oder ein Job geht im System ein, und der Supervisor erfasst diesen mit Kontext, Priorität und Verantwortlichkeit.
  2. 2. Zerlegung und Priorisierung: Der Supervisor zerlegt das Ziel in geordnete Teilaufgaben und stuft diese unter Berücksichtigung von Abhängigkeiten und Dringlichkeit ein.
  3. 3. Delegation: Jede Teilaufgabe wird an einen spezialisierten Agenten weitergeleitet, der basierend auf Fähigkeiten und Kosten aus dem Agenten-Registry ausgewählt wird.
  4. 4. Ausführung mit gemeinsamem Zustand: Agenten arbeiten mit durch Guardrails geschützten Tools und lesen bzw. schreiben in den gemeinsamen Speicher, sodass nachfolgende Agenten auf früheren Ergebnissen aufbauen.
  5. 5. Eskalation oder Freigabe: Wenn das Vertrauen gering ist oder viel auf dem Spiel steht, eskaliert ein Agent an einen Menschen oder wartet an einem Approval Gate.
  6. 6. Zusammenführung, Verifizierung und Abschluss: Ein QS-Schritt prüft die kombinierte Ausgabe, der Supervisor schließt den Job ab, und Traces sowie Metriken werden zur Evaluierung ausgegeben.

Komponenten

Supervisor / Orchestrator, der plant und delegiertAgenten-Registry von Spezialisten mit Verantwortlichen und FähigkeitenSpezialisierte Agenten (Recherche, Entwurf, QS, Tool-Nutzung)Gemeinsamer Speicher / Zustandsspeicher (State Store) für den AufgabenkontextGuardrails für Tools, Daten und AusgabenMenschliche Aufsicht: Eskalationspfade und Approval GatesObservability und Evaluierung über die gesamte Workforce hinweg

Referenzszenario

Kontext
Ein mittelständisches Unternehmen möchte die Erstellung von kundenorientierten Richtlinien-Antworten automatisieren, die heute einen Recherche-Schritt, einen Entwurfs-Schritt und eine Compliance-Prüfung erfordern, bevor ein Mensch sie freigibt.
Szenario
Ein Ziel geht im System ein; der Supervisor zerlegt es in Teilaufgaben für Recherche, Entwurf und QS, delegiert diese jeweils an einen spezialisierten Agenten und leitet alle compliance-relevanten Aspekte vor der Veröffentlichung an ein menschliches Approval Gate weiter.
Technologie
LangGraph für die Multi-Agenten-Orchestrierung, ein Agenten-Registry zur Erkennung von Fähigkeiten und Verantwortlichkeiten, ein gemeinsamer Zustandsspeicher für den Aufgabenkontext, Guardrails für Retrieval und Tools sowie LangSmith oder Langfuse für Tracing und Evaluierung.
Last
Beispielhaftes Volumen von einigen tausend Jobs pro Woche, mit Spitzenwerten während der Geschäftszeiten und einem Long-Tail komplexer Jobs, die eine menschliche Eskalation erfordern.
Ergebnisse
Alle hier genannten Zahlen sind Richtwerte zur Instrumentierung und Messung in Ihrer eigenen Umgebung, keine Garantien: Versuchen Sie, den End-to-End-Erfolg von Jobs, die Eskalationsrate, die Nacharbeitsquote und die Kosten pro abgeschlossenem Job zu erfassen und diese mit einer menschlichen Baseline abzugleichen, bevor Sie Produktivitätssteigerungen geltend machen.

Vorteile

  • Spezialisierung sorgt dafür, dass jeder Agent einfacher aufgebaut, besser zu evaluieren und leichter zu verwalten ist als ein einzelner monolithischer Agent.
  • Ein Supervisor mit Priorisierungsfunktion bewältigt mehrstufige, von Abhängigkeiten geprägte Aufgaben, bei denen ein einzelner Agent Schwierigkeiten mit der Sequenzierung hätte.
  • Ein gemeinsamer Zustand und ein Registry machen das Team auditierbar, mit klaren Verantwortlichkeiten und auffindbaren Fähigkeiten.
  • Menschliche Aufsicht und Governance ermöglichen es Ihnen, Automatisierung schrittweise einzuführen und gleichzeitig Risiken zu begrenzen.

Risiken

  • Die Koordinationskosten steigen nicht-linear; mehr Agenten und Übergaben können zu zusätzlicher Latenz und einer Fehlerkumulation führen.
  • Ein Fehler in einem Agenten kann sich über das gesamte Team kaskadenartig ausbreiten und den Schadensradius des Ausfalls vergrößern.
  • Ohne ein Agenten-Registry und klare Verantwortlichkeiten wird das Verhalten intransparent und niemand übernimmt die Verantwortung.
  • Produktivitätsversprechen können illusorisch sein, wenn sie pro Aufgabe gemessen werden und nicht im Vergleich zu einer ehrlichen, durchgängigen menschlichen Baseline.

KPIs

End-to-End-Erfolgsquote von Jobs
Anteil der korrekt abgeschlossenen Jobs ohne menschliche Korrektur; die wichtigste Kennzahl dafür, ob das Team tatsächlich funktioniert.
Eskalationsrate
Anteil der an Menschen übergebenen Jobs; ein zu hoher Wert deutet auf eine schwache Automatisierung hin, ein zu niedriger Wert kann eine unsichere Überautomatisierung bedeuten.
Nacharbeits- / Korrekturquote
Wie oft Ausgaben zurückgesendet oder korrigiert werden; eine steigende Nacharbeitsquote signalisiert kaskadierende Fehler oder eine schwache QS.
Kosten pro abgeschlossenem Job
Gesamtkosten für Modell, Tools und menschliche Überprüfung pro fertiggestelltem Job; die tatsächliche Unit Economics hinter Produktivitätsversprechen.
Koordinations-Overhead
Zusätzliche Latenz und Token-Kosten durch Übergaben im Vergleich zu einer Einzel-Agenten-Baseline; beobachten Sie, wie dieser Wert mit der Teamgröße wächst.

Kosten & Skalierung

  • Skalieren Sie, indem Sie spezialisierte Agenten hinter dem Registry hinzufügen, aber betrachten Sie jede Hinzufügung als neue zu evaluierende Koordinationsfläche.
  • Teilen Sie die Arbeit so auf, dass unabhängige Teilaufgaben parallel ausgeführt werden, während die Konsistenz des gemeinsamen Zustands gewahrt bleibt.
  • Wenden Sie Timeouts, Retries mit Backoff und Circuit-Breaker an, damit ein langsamer oder ausfallender Agent nicht den gesamten Job blockiert.
  • Menschliche Aufsicht staffeln: Leichtere Überprüfung bei risikoarmen Jobs, obligatorische Approval Gates bei irreversiblen oder sensiblen Aufgaben.

Beobachtete Fehlermuster

  • Kaskadierender Fehler: Ein falsches Zwischenergebnis wird im weiteren Verlauf als vertrauenswürdig eingestuft und verfälscht die endgültige Ausgabe.
  • Koordinations-Deadlock oder Endlosschleifen: Agenten warten aufeinander oder delegieren dieselbe Teilaufgabe unendlich oft neu.
  • Verlorener oder veralteter gemeinsamer Zustand: Agenten agieren auf Basis eines veralteten Kontexts und erzeugen inkonsistente Ergebnisse.
  • Eskalationslücken: Ein Agent fährt mit einer risikoreichen Aufgabe fort, anstatt sie an einen Menschen zu übergeben.

Erkenntnisse

  • Beginnen Sie mit dem kleinstmöglichen funktionierenden Team und fügen Sie Spezialisten erst dann hinzu, wenn ein einzelner Agent nachweislich überfordert ist.
  • Investieren Sie frühzeitig in das Agenten-Registry, Verantwortlichkeiten und Verträge für den gemeinsamen Zustand (Shared-State Contracts); sie machen das System erst steuerbar.
  • Evaluieren Sie die gesamte Workforce durchgängig (End-to-End) und nicht nur einzelne Agenten, da Fehler meist bei der Koordination auftreten.
  • Konzipieren Sie Eskalationspfade und Grenzen für den Schadensradius vom ersten Tag an, anstatt Governance erst nach einem Vorfall hinzuzufügen.

Technologien

Multi-agent orchestration (LangGraph)Agent registryShared memory / state storeHuman oversight & approvalsGuardrailsObservability (LangSmith / Langfuse)

Beispiele

  • Ein Recherche- und Berichtsworkflow, bei dem ein Supervisor das Sammeln, Synthetisieren und die QS zur Faktenprüfung an separate Agenten delegiert.
  • Eine Pipeline für Kundenantworten, die Entwürfe erstellt, aber compliance-relevante Fälle an ein menschliches Approval Gate weiterleitet.
  • Ein Operations-Backoffice-Team aus Agenten, die Tickets triagieren, Aktionen vorbereiten und Ausnahmen an Mitarbeiter eskalieren.

FAQs

Wie unterscheidet sich dies von einem einzelnen KI-Agenten?
Ein einzelner Agent übernimmt das gesamte Reasoning und die Tool-Nutzung selbst. Eine AI Workforce besteht aus vielen koordinierten Agenten unter einem Supervisor, der Ziele zerlegt, an Spezialisten delegiert, den Zustand teilt und das gesamte Team steuert. Die eigentlichen Herausforderungen liegen in der Koordination, der Verantwortlichkeit und dem Schadensradius (Blast Radius) und weniger in den Fähigkeiten eines einzelnen Agenten.
Führen mehr Agenten immer zu einem besseren System?
Nein. Jeder zusätzliche Agent bringt Übergaben, Latenz und neue Fehlerquellen mit sich. Fügen Sie Spezialisten nur dann hinzu, wenn ein einfacheres Team die Arbeit nachweislich nicht bewältigen kann, und messen Sie den Koordinationsaufwand, damit die Kosten der Orchestrierung nicht deren Nutzen übersteigen.
Wie messen wir echte Produktivitätssteigerungen?
Messen Sie End-to-End im Vergleich zu einer ehrlichen menschlichen Baseline: Erfolg der Aufgabe, Eskalation, Nacharbeit und Kosten pro abgeschlossener Aufgabe. Beschleunigungen auf Task-Ebene können nachgelagerte Korrekturen und Review-Zeiten verschleiern. Berücksichtigen Sie daher nur Gewinne, die einer vollständigen End-to-End-Evaluierung standhalten.

Referenzen