ARCH-006OperationsAktualisiert 2026-09-10 · Version 1.0

Agentisches Immunsystem

Referenzarchitektur, um KI-Agenten im Unternehmen zu betreiben, ohne das Vertrauen auf einen einzelnen zu bündeln. Fünf Schichten – Identität, minimale Rechte, Eindämmung, Aufsicht und Wiederherstellung – gehen davon aus, dass irgendein Agent irgendwann falsch handelt oder unterwandert wird, und machen diesen Tag überlebbar statt katastrophal. Verteidigungseinheit ist der einzelne Lauf, nicht die Flotte.

Evidenz: BranchenbeobachtungKonfidenz: MittelQuelle: BranchenbeobachtungQuelle: Paper

Schlüsselkonzepte

  • Kompromittierung voraussetzen: Die Frage ist nicht, ob ein Agent falsch handelt, sondern wie weit er dann reicht.
  • Identität je Lauf: Jeder Lauf trägt sein eigenes kurzlebiges Credential, nie ein geteiltes Betriebskonto.
  • Eindämmung vor Verhinderung: Der Schadensradius wird entworfen, nicht erhofft – ein unterwanderter Lauf trifft eine Aufgabe, nicht den Bestand.
  • Wiederherstellung ist eine Entwurfsfläche: Nachverfolgen, Rückgängigmachen und Anhalten werden vorher gebaut, nicht im Vorfall improvisiert.

Definition

Das agentische Immunsystem ist eine geschichtete Laufzeitarchitektur, die KI-Agenten echtes Handeln auf Unternehmenssystemen erlaubt und zugleich begrenzt, was ein einzelner Lauf erreichen, einsehen oder beschädigen kann – über Identität je Lauf, auf die Aufgabe beschränkte Rechte, Eindämmung von Ausführung und Ausgang, risikobasierte menschliche Aufsicht und nachvollziehbare Wiederherstellung.

Architektur

Die Architektur dreht die übliche Frage um. Statt zu fragen, wie man einen Agenten vom Fehler abhält – was keine Leitplanke gegenüber einem schlussfolgernden System verlässlich schafft –, fragt sie, wie weit der Agent in dem Moment reicht, in dem er sich irrt. Jede Schicht ist eine Reichweitengrenze, und die Schichten sind unabhängig, damit der Ausfall einer nicht die übrigen öffnet.

Identität ist das Fundament. Jeder Lauf erhält ein kurzlebiges Credential, gebunden an die Aufgabe, den anfragenden Principal und die Werkzeuge, die er angemeldet hat. Agenten teilen sich kein Dienstkonto: Geht etwas schief, benennt die Spur einen Lauf und keine Flotte, und Entzug kostet ein Token statt einer Rotation über den ganzen Bestand.

Rechte gelten für die Aufgabe und verfallen mit ihr. Der Werkzeug-Broker gewährt genau die schmale Menge an Fähigkeiten, die der Lauf vorab angemeldet hat – dieses Ticket lesen, diesen Datensatz schreiben – und verweigert alles andere. Eine Prompt-Injektion, die das Modell zu mehr überredet, findet nichts zum Aufrufen.

Eindämmung setzt voraus, dass die beiden vorherigen Schichten fallen können. Ausgeführt wird in einer Sandbox ohne Umgebungs-Credentials; ausgehender Netzverkehr läuft über eine Allowlist, sodass Exfiltration kein Ziel hat; und was der Agent erzeugt, wird an der Grenze kodiert, damit seine Ausgabe nicht zur Anweisung des nächsten Systems wird.

Aufsicht ist der Ort, an dem ein Mensch die Verantwortung trägt – nach Risiko platziert, nicht als Voreinstellung: Unumkehrbare oder regulierte Aktionen halten zur Freigabe an, und Ergebnisse geringer Zuversicht eskalieren mit dem vollen Laufkontext. Alles zu gaten zerstört die Automatisierung und erzieht Prüfende zum Durchklicken.

Wiederherstellung schließt den Kreis. Jeder Lauf wird unter einer einzigen Korrelations-ID über Modelle, Werkzeuge und Wiederholungen hinweg verfolgt; Aktionen werden mit einem kompensierenden Gegenstück entworfen, wo das Zielsystem es zulässt; und ein Notaus stoppt eine Klasse von Läufen, ohne die Plattform mitzunehmen.

Anfrage-Flow

  1. 1. Anfrage: Eine Aufgabe trifft ein, mit anfragendem Principal und angemeldeten Werkzeugen und Datenbereichen.
  2. 2. Ausstellung: Der Broker prägt eine kurzlebige, laufgebundene Identität zu dieser Anmeldung.
  3. 3. Zulassung: Der Lauf startet in einer Sandbox, ohne Umgebungs-Credentials und mit Ausgangs-Allowlist.
  4. 4. Handlung: Jeder Werkzeugaufruf wird gegen den Bereich des Laufs autorisiert; alles darüber hinaus wird verweigert und protokolliert.
  5. 5. Gate: Unumkehrbare oder regulierte Aktionen halten zur menschlichen Freigabe an, mit angehängtem Kontext.
  6. 6. Ausgabe: Erzeugtes wird an der Grenze kodiert, damit es nachgelagert nicht als Anweisung ausgeführt wird.
  7. 7. Abschluss: Die Identität verfällt, die Spur wird unter ihrer Korrelations-ID versiegelt, kompensierende Aktionen bleiben verfügbar.

Komponenten

Identitäts-Broker je Lauf (kurzlebige, aufgabengebundene Credentials)Werkzeug-Broker mit angemeldeten FähigkeitsbereichenSandbox-AusführungsumgebungAusgangs-Allowlist und Datenabfluss-KontrollenGrenz-Kodierer für AusgabenRisikobasiertes menschliches Freigabe-GateKorrelierte Laufspur und AuditprotokollKompensierende Aktionen und Notaus

Referenzszenario

Kontext
Ein illustratives Unternehmen mit Dutzenden Agenten in Ticketing, Finanzen und internem Wissen, in dem jeder Agent Systeme der Aufzeichnung lesen und schreiben kann.
Szenario
Ein Retrieval-Schritt nimmt ein Dokument auf, das eine eingeschleuste Anweisung enthält, Kundendaten zu exportieren. Das Modell folgt, doch das Export-Werkzeug liegt außerhalb des angemeldeten Bereichs des Laufs und wird verweigert; der Versuch wird protokolliert, die Anomalieregel stoppt den Lauf, und die Korrelations-ID liefert der Reaktion die vollständige Kette in einer Abfrage.
Technologie
Credential-Broker je Lauf, Werkzeug-Broker mit Bereichen, Sandbox-Ausführung, Ausgangs-Allowlist, Grenzkodierung, risikobasiertes Freigabe-Gate und korrelierte Ablaufverfolgung.
Last
Dauerhafte Hintergrundautomatisierung mit Spitzen um Geschäftsprozesse; die seltene, folgenschwere Aktion ist ein kleiner Anteil der Aufrufe und trägt das Risiko.
Ergebnisse
Referenzziel, keine Messung: Ein unterwanderter Lauf bleibt auf seinen angemeldeten Bereich begrenzt, jede Verweigerung ist einem Lauf zurechenbar, und jede ausgeführte Aktion lässt sich verfolgen und – wo das Zielsystem es erlaubt – kompensieren.

Vorteile

  • Ein falscher oder unterwanderter Agent kostet eine Aufgabe, nicht den Bestand.
  • Vorfälle sind einem Lauf zurechenbar statt einem geteilten Konto: Die Reaktion ist gezielt und der Entzug billig.
  • Prompt-Injektion verliert den größten Teil ihres Werts: Das Modell zu überreden verschafft ihm keine Fähigkeit, die es nie hatte.
  • Der Aufsichtsaufwand konzentriert sich auf die wirklich unumkehrbaren Aktionen, und die Freigabe behält dadurch ihre Bedeutung.

Risiken

  • Angemeldete Bereiche driften von dem ab, was Agenten wirklich brauchen, und Teams weiten sie aus, bis minimale Rechte nur noch nominell sind.
  • Zu viel zu gaten erzieht Prüfende zum Freigeben ohne Lesen – schlimmer als gar kein Gate.
  • Sandbox und Broker fügen Latenz und Betriebsfläche hinzu, die kleine Installationen womöglich nicht rechtfertigen.
  • Manche externen Wirkungen lassen sich nicht kompensieren: Eine gesendete E-Mail oder eine bezahlte Rechnung nimmt man nicht zurück.

KPIs

Anteil Läufe mit eigener, kurzlebiger Identität
Die tragende Kontrolle. Alles unter 100 % heißt, dass ein Pfad noch ein geteiltes Credential verwendet.
Verweigerte Werkzeugversuche außerhalb des Bereichs
Je Lauf gezählt. Ein Anstieg sagt etwas über die Umgebung, nicht zwingend über einen Entwurfsfehler.
Schadensradius je Lauf
Wie viele Systeme und Datensätze ein einzelner, vollständig unterwanderter Lauf erreichen könnte. Genau die Zahl, die diese Architektur schrumpfen soll.
Gate-Quote und Freigabelatenz
Beides zählt: Eine zu hohe Quote zerstört die Automatisierung, eine zu hohe Latenz bringt Teams dazu, das Gate abzuschalten.
Vollständigkeit der Spur
Anteil der Läufe, die sich unter einer Korrelations-ID durchgängig rekonstruieren lassen, samt Wiederholungen und Modellwechseln.
Zeit bis zum Entzug
Von der Erkennung bis zum Verschwinden der Fähigkeit eines Laufs. Mit kurzlebigen Credentials sollte das eher der Ablaufzeit gleichen als einer Rotation.

Kosten & Skalierung

  • Identitäts- und Werkzeug-Broker liegen im heißen Pfad jedes Aufrufs und setzen damit die Obergrenze; sie sind zustandslos und skalieren horizontal, aber ihre Latenz wird bei jedem Werkzeugeinsatz bezahlt.
  • Der Sandbox-Start dominiert die Kosten kurzer Läufe; ein Pool warmer Sandboxes tauscht Isolationstiefe gegen Latenz und sollte eine ausdrückliche Entscheidung sein.
  • Menschliche Freigabe skaliert nicht linear und ist die eigentliche Grenze: Die gegatete Menge muss klein bleiben, während die Flotte wächst, sonst wird die Warteschlange zum Ausfall.
  • Spurspeicher wächst mit Läufen mal Werkzeugaufrufen; Sampling taugt für Observability, nicht für Audit – die beiden Aufbewahrungsrichtlinien gehören getrennt.

Beobachtete Fehlermuster

  • Ein geteiltes Dienst-Credential überlebt irgendwo im Stack und hebelt die Identität je Lauf still aus.
  • Die Ausgangs-Allowlist wird über ein erlaubtes Ziel umgangen, das die Daten selbst weiterleitet.
  • Spuren brechen bei einer Wiederholung oder einem Modellwechsel, und die Vorfallskette lässt sich nicht mehr rekonstruieren.
  • Die Freigabe-Warteschlange staut sich, und das Gate wird „vorübergehend“ abgeschaltet, um sie zu leeren.
  • Werkzeugausgabe wird im nächsten Schritt als vertrauenswürdige Eingabe behandelt – Eindämmung schrumpft auf eine einzige, undichte Grenze.

Erkenntnisse

  • Entwerfe den Schadensradius vor der Fähigkeit: Wie weit ein Agent reichen darf ist die schwerere Frage als was er tun darf, und sie zuerst zu beantworten macht den Rest handhabbar.
  • Identität je Lauf ist die tragende Schicht; ohne sie richtet sich jede andere Kontrolle gegen ein Subjekt, das man nicht benennen kann.
  • Ein Gate, das bei allem auslöst, löst bei nichts aus – menschliche Freigabe bleibt dem Unumkehrbaren vorbehalten.
  • Nimm an, das Modell wird überredet, und entwirf so, dass Überreden nicht Autorisieren ist.
  • Wiederherstellung wird gebaut, solange das System ruhig ist; niemand entwirft eine kompensierende Aktion mitten im Vorfall.

Technologien

Short-lived workload identity (OIDC / SPIFFE-style)Capability-scoped tool broker (MCP or equivalent)Sandboxed execution (container or microVM)Egress allowlist / forward proxyOutput encoding at the trust boundaryDistributed tracing with a run correlation idPolicy engine for risk-based approval

Beispiele

  • Eine eingeschleuste Anweisung in einem abgerufenen Dokument verlangt einen Datenexport; das Werkzeug liegt außerhalb des Laufbereichs, der Aufruf wird verweigert und protokolliert.
  • Ein Finanzagent entwirft eine Zahlung, und ein Mensch gibt sie vor der Ausführung frei – die Laufspur hängt an der Freigabe.
  • Eine fehlverhaltende Agentenklasse wird per Notaus gestoppt, während der Rest der Flotte weiterläuft.
  • Ein Vorfall wird aus einer einzigen Korrelations-ID rekonstruiert, die drei Modelle, neun Werkzeugaufrufe und zwei Wiederholungen umfasst.

FAQs

Warum ein Immunsystem und keine Firewall?
Eine Firewall setzt eine Grenze zwischen innen und außen voraus. Ein Unternehmen, das Agenten betreibt, hat diese Grenze nicht: Der Agent ist bereits innen und handelt mit echten Credentials. Ein Immunsystem hält Eindringen für normal und investiert in Erkennung, Eindämmung und Reparatur statt in einen Perimeter.
Ist das nicht minimale Rechte mit Zusatzschritten?
Minimale Rechte sind eine der fünf Schichten und die bekannteste. Die These der Architektur ist, dass sie allein nicht genügen: Ohne Identität je Lauf lassen sich Rechte keinem Subjekt zuschneiden, und ohne Eindämmung und Wiederherstellung hat ein korrekt beschnittener Lauf, der dennoch schiefgeht, weder Grenze noch Rückweg.
Stoppt das Prompt-Injektion?
Nein, und irgendeine Kontrolle so zu behandeln, als stoppe sie das, ist genau der Fehler. Es macht Injektion billig überlebbar: Das Modell zu einer Aktion zu überreden ist nicht dasselbe, wie dass diese Aktion autorisiert wäre – und der verweigerte Versuch ist selbst ein Signal.
Was ist die minimal tragfähige Fassung?
Identität je Lauf und aufgabenbeschränkter Werkzeugzugriff. Diese beiden liefern Zurechenbarkeit und eine Grenze. Eindämmung, Gate und kompensierende Aktionen wiegen umso schwerer, je unumkehrbarer die Aktionen werden.
Wie verhält sich das zu den Governance-Rahmenwerken?
Es ist deren Ausdruck zur Laufzeit. NIST AI RMF und ISO 42001 verlangen Verantwortlichkeit und Nachvollziehbarkeit; OWASP LLM Top 10 und MITRE ATLAS beschreiben die Angriffe. In dieser Architektur werden diese Pflichten zu Identitäten, Bereichen, Sandboxes und Spuren.

Referenzen