GovernanceAktualisiert 2026-06-21 · Version 1.0

Was ist Prompt Injection?

Prompt Injection ist ein Angriff, bei dem bösartige Anweisungen, die in der Eingabe eines Sprachmodells verborgen sind, dessen Verhalten kapern – was dazu führt, dass es seine Regeln ignoriert, Daten preisgibt oder Tools missbraucht. Es steht an der Spitze der OWASP Top 10 für LLM-Anwendungen. Die Ursache liegt darin, dass Modelle vertrauenswürdige Anweisungen nicht zuverlässig von nicht vertrauenswürdigen Inhalten trennen können. Jeder Text, den ein Agent liest – eine Webseite, ein Dokument, ein Tool-Ergebnis –, kann daher einen Angriff enthalten.

Evidenz: BranchenbeobachtungKonfidenz: HochQuelle: BranchenbeobachtungQuelle: Paper

Definition

Prompt Injection ist ein Sicherheitsangriff, bei dem gegnerische Anweisungen, die in nicht vertrauenswürdige Eingaben eingebettet sind, ein Sprachmodell dazu bringen, von seinem beabsichtigten Verhalten abzuweichen, Sicherheitsvorkehrungen zu umgehen oder unbeabsichtigte Aktionen auszuführen.

Wichtigste Erkenntnisse

  • Nicht vertrauenswürdiger Text, den ein Modell liest, kann versteckte Anweisungen enthalten.
  • Es ist das Risiko Nummer 1 in den OWASP Top 10 für LLM-Anwendungen.
  • Indirekte Injection verbirgt Payloads in Dokumenten, Seiten oder Tool-Ausgaben.
  • Das Risiko wächst mit dem Tool-Zugriff – eine Injection kann echte Aktionen auslösen.
  • Es gibt keine Universallösung; die Verteidigung ist mehrschichtig (Least Privilege, Isolation, menschliche Freigabe).

Kontext

Modelle folgen Anweisungen in natürlicher Sprache und können vertrauenswürdige Systemanweisungen nicht zuverlässig von nicht vertrauenswürdigen Benutzer- oder Dokumenteninhalten unterscheiden. Ein Angreifer nutzt dies aus, indem er Anweisungen wie „Ignoriere vorherige Anweisungen und...“ dort platziert, wo das Modell sie liest.

Direkte Injection geht vom Benutzer aus; indirekte (und gefährlichere) Injection verbirgt sich in Inhalten, die der Agent abruft – einer Webseite, einer E-Mail, einer Datei oder einem MCP-Tool-Ergebnis. Da Agenten Zugriff auf Tools erhalten, kann eine erfolgreiche Injection Daten exfiltrieren oder schädliche Aktionen ausführen.

Architektur

Die Verteidigung ist mehrschichtig und besteht nicht aus einer einzelnen Kontrollmaßnahme: Tool-Berechtigungen nach dem Prinzip der minimalen Rechtevergabe (Least Privilege), Isolierung und klare Abgrenzung von nicht vertrauenswürdigen Inhalten, Validierung von Ausgaben und Aktionen, Allow-Lists für sensible Operationen und Human-in-the-Loop-Freigaben für folgenschwere Aktionen.

Behandeln Sie alle Tool- und Retrieval-Ausgaben als nicht vertrauenswürdige Eingaben. Überwachen und protokollieren Sie die Aktionen des Agenten (Observability), damit Injection-Versuche erkennbar sind, und führen Sie regelmäßig Red-Teaming für das System durch.

Komponenten

Grenze für nicht vertrauenswürdige EingabenBerechtigungen nach dem Prinzip der minimalen Rechtevergabe (Least Privilege)Inhaltsisolierung / -abgrenzungValidierung von Ausgaben und AktionenMenschliche Freigabe für folgenschwere AktionenMonitoring & Red-Teaming

Risiken

  • Datenexfiltration von sensiblem Kontext oder Anmeldedaten.
  • Unbefugte Tool-Aktionen in verbundenen Systemen.
  • Umgehung von Sicherheitsrichtlinien und Guardrails.
  • Indirekte Angriffe über Dokumente, Webseiten oder Tool-Ergebnisse.

Tools & Technologien

Bibliotheken für Input/Output-GuardrailsBerechtigungs- und Sandboxing-EbenenAllow-Lists für Tool-AktionenMonitoring / ObservabilityRed-Teaming-Frameworks

Beispiele

  • Eine Webseite, die der Agent liest, enthält versteckten Text, der ihn anweist, private Daten per E-Mail zu senden.
  • Ein Dokument weist ein Zusammenfassungstool an, seine Regeln zu ignorieren und einen schädlichen Link auszugeben.
  • Ein Tool-Ergebnis versucht, einen Agenten dazu zu bringen, ein anderes Tool aufzurufen, das er nicht aufrufen sollte.

FAQs

Warum können Modelle injizierte Anweisungen nicht einfach ignorieren?
Weil sie vertrauenswürdige Anweisungen nicht zuverlässig von nicht vertrauenswürdigen Inhalten unterscheiden können – beides kommt als Text an. Diese Mehrdeutigkeit ist die Kernschwachstelle.
Was ist indirekte Prompt Injection?
Wenn die bösartigen Anweisungen in externen Inhalten verborgen sind, die das Modell abruft – einer Seite, Datei, E-Mail oder Tool-Ausgabe –, anstatt vom Benutzer eingegeben zu werden. Dies ist oft gefährlicher.
Kann Prompt Injection vollständig verhindert werden?
Heutzutage nicht durch eine einzelne Maßnahme. Sie reduzieren das Risiko durch mehrschichtige Verteidigung: Least Privilege, Inhaltsisolierung, Validierung, Monitoring und menschliche Freigabe für sensible Aktionen.
Wie erhöht die Nutzung von Tools das Risiko?
Ohne Tools führt eine Injection meist nur zu schlechtem Text. Mit Tools kann eine injizierte Anweisung echte Aktionen ausführen – Daten senden, Änderungen vornehmen –, weshalb Berechtigungen und Freigaben umso wichtiger sind.

Referenzen