Agentic Control Matrix

Die Agentic Control Matrix

Achtzehn Controls, die die Anforderungen des EU AI Act, der ISO/IEC 42001, des NIST AI RMF, der OWASP LLM Top 10 und von MITRE ATLAS auf die Harness-Komponenten abbilden, die sie implementieren – jeweils mit dem Test, der entscheidet, ob Sie sie tatsächlich implementiert haben.

Version 1.2 · Aktualisiert 2026-08-27 · 18 Controls

JSONCSVGleiche Quelle, drei Formate. CC BY 4.0 — zitieren und verwenden.

Zugeordnete Frameworks

Zitiert nach: Artikel

18 Controls zitieren es

eur-lex.europa.eu

Zitiert nach: Anhang A Klauselgruppe

18 Controls zitieren es

www.iso.org

Zitiert nach: Kernfunktion

18 Controls zitieren es

www.nist.gov

Zitiert nach: Eintrag

18 Controls zitieren es

genai.owasp.org
MITRE ATLASframework

Zitiert nach: Taktik

16 Controls zitieren es

atlas.mitre.org

Leseanleitung

Jede Zeile ist ein Control: was es erfordert, welchen Frameworks es entspricht, welche Patterns es implementieren und wie man herausfindet, ob man es hat. Der Test ist der entscheidende Punkt – ein Control, bei dem Sie nie versucht haben, es fehlschlagen zu lassen, ist ein Control, über das Sie lediglich eine Meinung haben.

Die Granularität der Zuordnung unterscheidet sich je nach Quelle und wird pro Framework deklariert, da die Quellen nicht gleichermaßen präzise sind. Eine NIST-Unterkategorie so zu zitieren, als wäre sie eine Artikelnummer, würde zwar präziser wirken, wäre aber weniger wahrheitsgetreu.

Diese Zuordnungen sind interpretativ. Sie spiegeln das Verständnis eines einzelnen Engineers wider, wie eine Anforderung in der Architektur eines Agenten ankommt, und wurden veröffentlicht, damit darüber diskutiert und Korrekturen vorgenommen werden können. Nichts hier stellt eine Rechtsberatung dar und nichts hier zertifiziert irgendetwas.

Alles auf dieser Seite wird aus einer einzigen JSON-Datei generiert, und jede Referenz wird bei jedem Build mit dem Korpus abgeglichen – ein Control kann also kein Pattern, keine Knowledge Unit und kein Framework zitieren, das nicht existiert.

Die zweite Achse

Die Gruppen geben an, wo ein Control wirkt. Sie sagen nicht aus, wie es das Verhalten reguliert, und zwei Controls in derselben Gruppe können auf völlig unterschiedliche Weise funktionieren. Daher deklariert jedes Control zwei weitere Dinge: wann es wirkt und was über sein Urteil entscheidet.

Feedforward wirkt auf den Input – was existieren darf, was aufgerufen werden darf, was erreicht werden darf – und misst niemals das Ergebnis. Feedback misst etwas, das das System tatsächlich getan hat, und reagiert auf diese Messung. Der Zeitpunkt bezieht sich auf die Aktion, die das Control schützt: Das Codieren der Ausgabe eines Modells, bevor sie eine Shell erreicht, ist Feedforward für die Shell, unabhängig davon, was es für das Modell ist.

Deterministisch bedeutet, dass das Urteil auf einer Regel basiert, die nicht von der Interpretation einer Person abhängt – dieselbe Situation wird zweimal auf dieselbe Weise entschieden. Inferenziell bedeutet, dass es auf einer Beurteilung basiert, sei es durch ein Modell oder eine Person, wodurch dieselbe Situation auf zwei verschiedene Arten entschieden werden kann.

Keine der beiden Achsen hat eine eindeutig bessere Seite. Ein deterministisches Control kann einen Fall, für den es nicht geschrieben wurde, nicht abwägen, ein inferenzielles hingegen schon. Aber ein Risiko, dessen einziges Control sowohl inferenziell als auch Feedback-basiert ist, hat nichts, was es verhindert, und nichts, was zweimal identisch entscheidet – und das ist eine Tatsache über das Design, keine Meinung darüber.

Feedforwarddeterministisch8 Controls
Feedforwardinferenziell2 Controls
Feedbackdeterministisch3 Controls
Feedbackinferenziell5 Controls

Was die Verteilung aussagt

Aus den Controls berechnet, nicht von Hand geschrieben: Diese Gruppen nehmen einen einzelnen Wert auf einer Achse an. Einiges davon ist definitionsgemäß – Nachweise liegen konstruktionsbedingt nach dem Ereignis vor. Einiges davon ist das Ergebnis.

  • Berechtigungen und ReichweiteWirktFeedforward3 Controls
  • Egress und ExpositionEntschieden durchdeterministisch3 Controls
  • Menschliche AufsichtEntschieden durchinferenziell2 Controls
  • NachweiseWirktFeedback2 Controls

Was jedes Control beenden würde

Ein Harness ist nicht monoton gut. Eine Regel, die geschrieben wurde, um eine Einschränkung zu kompensieren, die das nächste Modell nicht hat, verbraucht weiterhin Token, um ihm etwas beizubringen, das es bereits weiß. Ein Kontextblock, der mitgeschleppt wird, seit das Kontextfenster knapp war, wird immer noch mitgeschleppt. Eine Tool-Oberfläche, die für ein älteres Modell verengt wurde, schränkt immer noch ein, was ein besseres Modell versuchen kann. Nichts davon macht sich von selbst bemerkbar, da eine Harness-Komponente kein Ablaufdatum hat, es sei denn, jemand hat eines definiert.

Daher deklariert jedes Control, was es über das Modell annimmt und unter welchen Bedingungen es außer Dienst gestellt werden sollte. Die unten stehenden Zahlen leiten sich aus diesen Bedingungen ab und werden nicht willkürlich festgelegt – und sie weisen in beide Richtungen: Ein großer Teil dieser Matrix läuft keineswegs aufgrund von Fähigkeiten ab. Ein nicht validierter Origin wird nicht dadurch sicher, dass sich das Modell verbessert hat.

Die unangenehme Zahl ist die zweite. Eine Außerdienststellungsbedingung, gegen die noch nie gemessen wurde, ist eine Hypothese mit gutem Haarschnitt, und das Feld wird in jeder Zeile auf null gesetzt, anstatt weggelassen zu werden, sodass die Lücke offengelegt statt versteckt wird.

eine Zahl beendet es4 Controls
die Plattform absorbiert es7 Controls
nicht aufgrund von Fähigkeiten7 Controls

18/18

Nie validiert

Controls, deren Außerdienststellungsbedingung noch nie gegen eine namentlich genannte Modellgeneration gemessen wurde.

0/18

Beeinflusst keine Metrik

Controls, die keine Metrik auf der Scorecard beeinflussen, sodass ihr Wert an keiner Zahl abgelesen werden kann.

Berechtigungen und Reichweite

ACM-01

Eingegrenzter Tool-Katalog

Feedforwardinferenzielldie Plattform absorbiert es

Jedes Tool, das der Agent aufrufen kann, ist aufgelistet, zusammen mit seinem Scope, der Information, ob es Schreibrechte besitzt, und was ein Angreifer durch seinen Aufruf gewinnt. Ein Tool, das niemand dokumentiert hat, ist eine Berechtigung, die niemand überprüft hat.

Warum dieser Quadrant: Es schränkt ein, was vor der Ausführung existieren darf, aber nichts erzwingt seine Vollständigkeit: Ein Katalog ist nur so gut wie die Sorgfalt der Person, die ihn erstellt hat.

Entspricht

  • EU AI Act: Art. 9, Art. 14, Art. 26
  • ISO/IEC 42001: A.6 AI system life cycle, A.9 Use of AI systems
  • NIST AI Risk Management Framework 1.0: GOVERN, MAP
  • OWASP Top 10 for LLM Applications: LLM06 Excessive Agency
  • MITRE ATLAS: Initial Access, Privilege Escalation

Testmethode

Erstellen Sie den Katalog. Jeder Eintrag hat einen schriftlich festgelegten Scope und einen benannten Besitzer, und kein vom Agenten aufrufbares Tool fehlt darin.

Nimmt an

Dass niemand die gesamte Tool-Oberfläche im Kopf behalten kann und dass sich diese Oberfläche schneller verändert als das Gedächtnis.

Außer Dienst stellen, wenn

Die Runtime kann jedes aufrufbare Tool mit seinem Scope und seinem Besitzer bei Bedarf auflisten. Ab diesem Zeitpunkt ist ein manuell gepflegtes Dokument nur noch eine Kopie einer Tatsache, die der Plattform bereits bekannt ist.

Sollte beeinflussencontain

ACM-02

Anmeldedaten pro Tool mit minimalem Scope

Feedforwarddeterministischdie Plattform absorbiert es

Jedes Tool besitzt eigene Anmeldedaten, die mit dem engstmöglichen Scope ausgestellt wurden, den das Upstream-System unterstützt. Ein Read-only-Tool, das durch ein Admin-Token abgesichert ist, ist nur einen Bug davon entfernt, ein Schreib-Tool zu sein.

Warum dieser Quadrant: Der Scope wird upstream auf der Eingangsseite erzwungen: Ein Aufruf außerhalb dieses Scopes schlägt jedes Mal auf dieselbe Weise fehl, unabhängig von der Absicht des Modells.

Entspricht

  • EU AI Act: Art. 15, Art. 26
  • ISO/IEC 42001: A.4 Resources for AI systems, A.6 AI system life cycle
  • NIST AI Risk Management Framework 1.0: GOVERN, MANAGE
  • OWASP Top 10 for LLM Applications: LLM06 Excessive Agency, LLM02 Sensitive Information Disclosure
  • MITRE ATLAS: Credential Access, Privilege Escalation

Testmethode

Zeigen Sie für jedes Tool die Anmeldedaten und deren serverseitigen Scope. Keine zwei Tools teilen sich Anmeldedaten, deren Reichweite die Anforderungen des jeweiligen Tools übersteigt.

Nimmt an

Dass Upstream-Systeme Anmeldedaten ausstellen, die enger gefasst sind als das gesamte Konto, und dass ein kompromittiertes Tool ein plausibles Szenario darstellt.

Außer Dienst stellen, wenn

Tool-Aufrufe übertragen eine Autorisierung pro Aufruf und Benutzer, die vom Upstream-System ausgewertet wird, sodass keine langlebigen Anmeldedaten mit übermäßigen Rechten verbleiben.

Sollte beeinflussencontain

ACM-03

Parameter-Allowlists

Feedforwarddeterministischdie Plattform absorbiert es

Die Ziele, die ein Tool ansprechen darf – Pfade, Repositories, Tabellen, Konten, Empfänger –, sind serverseitig eingeschränkt, sodass ein gekaperter Agent ein legitimes Tool nicht auf ein illegitimes Ziel umleiten kann.

Warum dieser Quadrant: Es prüft das Argument vor der Ausführung des Aufrufs und lehnt diesen regelbasiert statt nach Ermessen ab.

Entspricht

  • EU AI Act: Art. 15
  • ISO/IEC 42001: A.6 AI system life cycle
  • NIST AI Risk Management Framework 1.0: MANAGE
  • OWASP Top 10 for LLM Applications: LLM01 Prompt Injection, LLM06 Excessive Agency
  • MITRE ATLAS: Execution, Impact

Testmethode

Rufen Sie jedes schreibfähige Tool mit einem Ziel außerhalb des Scopes auf. Der Aufruf wird durch die eigene Grenze des Tools abgelehnt, nicht durch eine Weigerung des Modells.

Nimmt an

Dass das Modell dazu verleitet werden kann, ein legitimes Tool auf ein illegitimes Ziel zu richten, und dass das Upstream-System dies nicht verhindert.

Außer Dienst stellen, wenn

Das Upstream-System erzwingt dieselbe Einschränkung durch sein eigenes Autorisierungsmodell, wodurch die Allowlist zu einem Duplikat wird, das vom eigentlichen Modell abweichen kann.

Sollte beeinflussencontain

Egress und Exposition

ACM-04

Default-Deny-Egress

Feedforwarddeterministischnicht aufgrund von Fähigkeiten

Ausgehender Datenverkehr erreicht nur explizit benannte Ziele; alles andere wird abgelehnt. Da jeder Exfiltrationspfad in einer ausgehenden Anfrage endet, ist dies die Sicherheitsmaßnahme, die auch dann noch greift, wenn das Modell bereits manipuliert wurde.

Warum dieser Quadrant: Das Ziel wird überprüft, bevor die Anfrage gesendet wird; es wird kein Ergebnis gemessen und es ist keine Beurteilung erforderlich.

Entspricht

  • EU AI Act: Art. 15
  • ISO/IEC 42001: A.6 AI system life cycle, A.7 Data for AI systems
  • NIST AI Risk Management Framework 1.0: MANAGE
  • OWASP Top 10 for LLM Applications: LLM02 Sensitive Information Disclosure, LLM01 Prompt Injection
  • MITRE ATLAS: Exfiltration, Collection

Testmethode

Fordern Sie aus der Umgebung des Agenten heraus einen Host an, der nicht auf der Liste steht. Dies schlägt auf der Netzwerk- oder Proxy-Ebene fehl, und die Ablehnung wird protokolliert.

Nimmt an

Dass jeder Exfiltrationspfad in einer ausgehenden Anfrage endet und dass die Menge der legitimen Ziele im Voraus bekannt ist.

Außer Dienst stellen, wenn

Nicht aus Kapazitätsgründen. Deaktivieren Sie es, wenn der Agent nichts Wertvolles zu exfiltrieren hat – was eine Aussage über die Daten und nicht über das Modell ist.

Sollte beeinflussencontain

ACM-05

Verweigerter ausgehender Datenverkehr ist eine Warnung, kein Fehler

Feedbackdeterministischdie Plattform absorbiert es

Abgelehnte ausgehende Anfragen werden als Sicherheitssignal protokolliert und an eine Person weitergeleitet. Eine Verweigerung ist eines der wenigen eindeutigen Angriffssignale, die ein Agenten-Stack erzeugt, und sie ist wertlos, wenn sie im selben Topf wie ein Timeout landet.

Warum dieser Quadrant: Es reagiert auf etwas, das bereits geschehen ist – eine Ablehnung – und wird regelbasiert bei jeder einzelnen ausgelöst.

Entspricht

  • EU AI Act: Art. 12, Art. 72
  • ISO/IEC 42001: A.6 AI system life cycle, Clause 9 Performance evaluation
  • NIST AI Risk Management Framework 1.0: MEASURE, MANAGE
  • OWASP Top 10 for LLM Applications: LLM02 Sensitive Information Disclosure
  • MITRE ATLAS: Exfiltration

Testmethode

Lösen Sie eine Verweigerung aus. Sie wird als separates, alarmierbares Ereignis mit dem Ziel und dem aufrufenden Agenten angezeigt, nicht als generischer Netzwerkfehler.

Nimmt an

Dass eine abgelehnte ausgehende Anfrage selten genug ist, um ein Signal und kein Rauschen zu sein.

Außer Dienst stellen, wenn

Die Plattform stellt Verweigerungen selbstständig als Sicherheitsereignisse dar, oder Verweigerungen werden zur Routine – was bedeutet, dass die Allowlist falsch ist, nicht die Warnung.

Sollte beeinflussenrecon

ACM-16

Transport- und Ursprungsvalidierung an exponierten Endpunkten

Feedforwarddeterministischnicht aufgrund von Fähigkeiten

Ein von außen erreichbarer Agenten-Endpunkt validiert seinen Transport, bevor er Arbeit verrichtet: Der Ursprung (Origin) wird mit einer Allowlist abgeglichen, vom Browser initiierte Cross-Site-Aufrufe werden abgelehnt und für jeden Aufrufer wird ein Rate-Limiting mit einem echten 429-Statuscode erzwungen.

Warum dieser Quadrant: Die Anfrage wird anhand ihres Origin-Headers beurteilt, bevor ein Handler ausgeführt wird; derselbe Aufruf erhält jedes Mal dieselbe Antwort.

Entspricht

  • EU AI Act: Art. 15
  • ISO/IEC 42001: A.6 AI system life cycle
  • NIST AI Risk Management Framework 1.0: MANAGE
  • OWASP Top 10 for LLM Applications: LLM10 Unbounded Consumption, LLM06 Excessive Agency
  • MITRE ATLAS: Initial Access, AI Model Access

Testmethode

Rufen Sie den Endpunkt mit einer fremden Origin und ohne Origin auf. Ersteres wird abgelehnt, bevor ein Handler ausgeführt wird; Letzteres wird bedient und auf das Limit des Aufrufers angerechnet.

Nimmt an

Dass der Endpunkt von außen erreichbar ist und dass Browser durch die Seite eines Dritten darauf verwiesen werden.

Außer Dienst stellen, wenn

Der Endpunkt ist nicht mehr von außen erreichbar. Ein besseres Modell macht eine nicht validierte Origin nicht sicher.

Sollte beeinflussencontain

Ausführung

ACM-06

Ephemere, anmeldedatenfreie Ausführung

Feedforwarddeterministischdie Plattform absorbiert es

Alles, was der Agent generiert oder aufruft, läuft in einer Umgebung, die pro Aufgabe erstellt und danach zerstört wird und keine Ambient Credentials enthält. Persistenz ist der Weg, wie aus einer einmaligen Kompromittierung ein dauerhafter Zugang wird.

Warum dieser Quadrant: Die Umgebung wird vor dem Start der Aufgabe ohne die Anmeldedaten erstellt; es gibt nichts zu messen und nichts zu entscheiden.

Entspricht

  • EU AI Act: Art. 15
  • ISO/IEC 42001: A.6 AI system life cycle
  • NIST AI Risk Management Framework 1.0: MANAGE
  • OWASP Top 10 for LLM Applications: LLM05 Improper Output Handling, LLM03 Supply Chain
  • MITRE ATLAS: Execution, Persistence

Testmethode

Listen Sie innerhalb einer aktiven Aufgabe die Umgebung auf. Es sind keine Anmeldedaten vorhanden, die die Aufgabe nicht benötigt hat, und die Umgebung überdauert die Aufgabe nicht.

Nimmt an

Dass die Kompromittierung einer Aufgabe nicht auf die nächste übergehen darf und dass die Einrichtungskosten niedriger sind als die Kosten der Persistenz.

Außer Dienst stellen, wenn

Ausführungsumgebungen sind konstruktionsbedingt pro Aufruf und anmeldedatenfrei, sodass „ephemer“ nichts mehr ist, was man einfach abschalten kann.

Sollte beeinflussencontain

ACM-07

Ressourcenlimits und Timeouts

Feedbackdeterministischnicht aufgrund von Fähigkeiten

CPU, Arbeitsspeicher, Festplatte, tatsächliche Laufzeit und Anzahl der Aufrufe werden durch den Host begrenzt. Unkontrollierter Verbrauch ist das Fehlerszenario, das zuerst und am häufigsten auftritt, meist ganz ohne Beteiligung eines Angreifers.

Warum dieser Quadrant: Ein Limit ist eine Feedbackschleife im engeren Sinne: Es misst den Verbrauch während des laufenden Betriebs und reagiert, wenn ein Schwellenwert überschritten wird.

Entspricht

  • EU AI Act: Art. 15
  • ISO/IEC 42001: A.4 Resources for AI systems, Clause 8 Operation
  • NIST AI Risk Management Framework 1.0: MEASURE, MANAGE
  • OWASP Top 10 for LLM Applications: LLM10 Unbounded Consumption
  • MITRE ATLAS: Impact

Testmethode

Führen Sie eine Aufgabe aus, die so konzipiert ist, dass sie nicht endet. Sie wird durch ein Kontingent gestoppt, der Stopp wird aufgezeichnet, und die Kosten des Versuchs sind begrenzt und bekannt.

Nimmt an

Dass ein Agent unbegrenzt Ressourcen verbraucht, wenn ihn nichts daran hindert, unabhängig davon, ob ein Angreifer im Spiel ist oder nicht.

Außer Dienst stellen, wenn

Nicht aus Kapazitätsgründen. Unkontrollierter Verbrauch ist eine Eigenschaft von Schleifen, und bessere Modelle versuchen eher längere als kürzere Aufgaben.

Sollte beeinflussentvtcvotvo

ACM-17

Reversibilität und eine Stopp-Steuerung

Feedbackinferenzielleine Zahl beendet es

Jede Aktion, die der Agent ausführen kann, ist entweder reversibel oder durch ein Gate geschützt, und eine Person kann den Agenten mitten im Durchlauf stoppen, ohne das gesamte System anzuhalten. Autonomie ohne Ausschalter ist keine Autonomie, sondern ein Risiko.

Warum dieser Quadrant: Jemand muss zusehen und entscheiden, dass dieser Durchlauf beendet werden soll; der Mechanismus ist deterministisch, der Auslöser ist es nicht.

Entspricht

  • EU AI Act: Art. 14, Art. 15, Art. 26
  • ISO/IEC 42001: Clause 8 Operation, Clause 10 Improvement
  • NIST AI Risk Management Framework 1.0: MANAGE
  • OWASP Top 10 for LLM Applications: LLM06 Excessive Agency
  • MITRE ATLAS: Impact

Testmethode

Stoppen Sie einen laufenden Agenten. Er hält innerhalb der angegebenen Zeit an, hinterlässt keine halb angewendeten Änderungen und der Stopp wird mit der Angabe erfasst, wer ihn ausgelöst hat.

Nimmt an

Dass ein Durchlauf auf eine Weise schiefgehen kann, die ein Mensch bemerkt, bevor das Harness es tut.

Außer Dienst stellen, wenn

Die Verifizierungslücke erreicht Null und die Wiederherstellungsrate ist ohne sie gleichwertig – was bedeutet, dass das Harness seine eigenen Fehler mindestens so schnell bemerkt wie die zusehende Person. Nichts in diesem Korpus misst das heute.

Sollte beeinflussencontainrecov

Menschliche Aufsicht

ACM-08

Freigabeschranke für folgenschwere Aktionen

Feedforwardinferenzielleine Zahl beendet es

Aktionen, die unumkehrbar, reguliert oder teuer sind, werden gestoppt, bis eine Person mit ausreichend Kontext diese genehmigen, bearbeiten oder ablehnen kann. Schranken sollten risikobasiert und nicht standardmäßig eingerichtet werden – zu viele Schranken führen zu blindem Abnicken, was schlimmer ist als gar keine Schranke, da es nur so aussieht wie eine.

Warum dieser Quadrant: Es stoppt die Aktion, bevor sie ausgeführt wird, aber der Grund für den Stopp ist die Entscheidung einer Person, und derselbe Fall kann auf zwei verschiedene Arten entschieden werden.

Entspricht

  • EU AI Act: Art. 14, Art. 26
  • ISO/IEC 42001: A.9 Use of AI systems, A.5 Assessing impacts of AI systems
  • NIST AI Risk Management Framework 1.0: GOVERN, MANAGE
  • OWASP Top 10 for LLM Applications: LLM06 Excessive Agency
  • MITRE ATLAS: Impact

Testmethode

Listen Sie die beschränkten Aktionen und das Risikokriterium auf, das zu ihrer Einstufung geführt hat. Versuchen Sie eine davon; sie wird ausgesetzt, weitergeleitet und die Entscheidung wird zusammen mit der Identität der entscheidenden Person aufgezeichnet.

Nimmt an

Dass die Beurteilung des Modells bei folgenschweren Aktionen schlechter ist als die einer Person und dass eine Person mit dem entsprechenden Kontext bessere Entscheidungen trifft als eine Regel.

Außer Dienst stellen, wenn

Die Verifizierungslücke bei den beschränkten Aktionstypen erreicht bei einer ausreichend großen, vertrauenswürdigen Aufgabenmenge null. Ab diesem Punkt erkauft man sich mit der Schranke nur noch blindes Abnicken auf Kosten der Latenz.

Sollte beeinflussenvgaphir

ACM-09

Eskalationspfad mit namentlich genanntem Verantwortlichen

Feedbackinferenzielleine Zahl beendet es

Wenn der Agent unsicher, blockiert oder außerhalb der Richtlinien ist, gibt es einen definierten Pfad zu einer Person, und diese Person wird namentlich genannt. Ein Eskalationspfad ohne Verantwortlichen ist lediglich eine Warteschlange.

Warum dieser Quadrant: Es wird bei einem Zustand ausgelöst, den der Durchlauf bereits erreicht hat – unsicher, blockiert, außerhalb der Richtlinien – und was als Nächstes geschieht, ist eine Ermessensentscheidung.

Entspricht

  • EU AI Act: Art. 14
  • ISO/IEC 42001: A.9 Use of AI systems
  • NIST AI Risk Management Framework 1.0: GOVERN, MANAGE
  • OWASP Top 10 for LLM Applications: LLM09 Misinformation

Testmethode

Erzwingen Sie eine Eskalation. Sie erreicht eine namentlich genannte Person innerhalb der angegebenen Zeit, und die Übergabe enthält den erforderlichen Kontext, um ohne erneute Herleitung handeln zu können.

Nimmt an

Dass der Agent erkennen kann, wenn er blockiert ist oder außerhalb der Richtlinien agiert, und dass eine Person diese Blockade aufheben kann.

Außer Dienst stellen, wenn

Die Wiederherstellungsrate mit und ohne Eskalationspfad ist gleichwertig, gemessen an den tatsächlich auftretenden Fehlern und nicht an den erwarteten.

Sollte beeinflussenrecovhir

Nachweise

ACM-10

Korrelierter Trace jeder Entscheidung und jedes Tool-Aufrufs

Feedbackdeterministischnicht aufgrund von Fähigkeiten

Jeder Durchlauf erzeugt ein unveränderliches, korreliertes Protokoll: Eingaben, Modell und Version, Tool-Aufrufe mit Argumenten und Ergebnissen sowie die endgültige Aktion. Genug, um das Geschehene zu rekonstruieren, und nichts, was das Protokoll selbst zu einer Sicherheitslücke macht.

Warum dieser Quadrant: Reine Messung im Nachhinein: Sie ändert nichts an dem aufgezeichneten Durchlauf und erfolgt regelbasiert.

Entspricht

  • EU AI Act: Art. 12, Art. 19, Art. 72
  • ISO/IEC 42001: Clause 9 Performance evaluation, A.6 AI system life cycle
  • NIST AI Risk Management Framework 1.0: MEASURE, MANAGE
  • OWASP Top 10 for LLM Applications: LLM02 Sensitive Information Disclosure
  • MITRE ATLAS: Discovery, Collection

Testmethode

Wählen Sie zufällig einen vergangenen Durchlauf aus und rekonstruieren Sie ihn vollständig allein anhand des Protokolls. Bestätigen Sie anschließend, dass das Protokoll keine Geheimnisse oder unnötigen personenbezogenen Rohdaten enthält.

Nimmt an

Dass später etwas von jemandem rekonstruiert werden muss, der nicht anwesend war.

Außer Dienst stellen, wenn

Nicht aus Kapazitätsgründen. Dies ist die Kontrollmaßnahme, auf der jede andere Messung basiert; ihre Entfernung nimmt uns die Möglichkeit zu wissen, ob die Entfernung von irgendetwas anderem eine gute Idee war.

Sollte beeinflussenrecon

ACM-11

Evaluierungssuite als Freigabeschranke für Änderungen

Feedbackinferenziellnicht aufgrund von Fähigkeiten

Bei jeder Änderung wird eine kuratierte Auswahl an Testfällen ausgeführt, und eine Regression blockiert die Veröffentlichung. Ohne sie ist „es scheint zu funktionieren“ das einzige Qualitätsargument, und nichts unterscheidet einen Fix von einer Änderung.

Warum dieser Quadrant: Es misst Ergebnisse, die das System bereits erzeugt hat, und was als Regression bei agentischen Ausgaben gilt, ist eine Ermessensentscheidung – die Suite deckt die Fälle ab, die ausgewählt wurden.

Entspricht

  • EU AI Act: Art. 9, Art. 15, Art. 17
  • ISO/IEC 42001: A.6 AI system life cycle, Clause 9 Performance evaluation
  • NIST AI Risk Management Framework 1.0: MEASURE
  • OWASP Top 10 for LLM Applications: LLM09 Misinformation

Testmethode

Führen Sie eine bekannte Regression ein. Die Suite fängt sie ab und die Änderung wird nicht ausgeliefert. Eine Suite, die man nie fehlschlagen sieht, ist eine Suite, die nie verifiziert wurde.

Nimmt an

Dass Änderungen das Verhalten auf unvorhersehbare Weise verschlechtern und dass eine kuratierte Auswahl mehr davon erfasst als eine bloße Einschätzung.

Außer Dienst stellen, wenn

Nicht als Kategorie. Einzelne Fälle werden ständig ausgemustert: Ein Fall, bei dem seit zwei Jahren keine Änderung mehr fehlgeschlagen ist, misst die Vergangenheit, und ihn zu behalten führt nur dazu, dass Suiten teurer werden, ohne besser zu werden.

Sollte beeinflussencatchdband

Lebenszyklus und Inputs

ACM-12

Nicht vertrauenswürdige Inhalte werden isoliert und gekennzeichnet

Feedforwarddeterministischeine Zahl beendet es

Abgerufene Dokumente, Tool-Ergebnisse und Ausgaben von Drittanbietern werden als Daten abgegrenzt und niemals mit dem Anweisungskanal zusammengeführt. Das Modell kann sie nicht zuverlässig voneinander unterscheiden, daher muss das Harness dies tun.

Warum dieser Quadrant: Die Abgrenzung erfolgt bei der Eingabe, bevor das Modell sie liest, und sie gilt für jedes Dokument, ohne zu fragen, was sich darin befindet.

Entspricht

  • EU AI Act: Art. 15
  • ISO/IEC 42001: A.6 AI system life cycle, A.7 Data for AI systems
  • NIST AI Risk Management Framework 1.0: MAP, MANAGE
  • OWASP Top 10 for LLM Applications: LLM01 Prompt Injection
  • MITRE ATLAS: Initial Access, AI Attack Staging

Testmethode

Platzieren Sie eine Anweisung in einem Dokument, das der Agent abruft. Der Agent darf sie lesen, er darf jedoch nicht danach handeln, und der Versuch muss im Nachhinein sichtbar sein.

Nimmt an

Dass das Modell innerhalb seines eigenen Kontextfensters Anweisungen nicht zuverlässig von Daten unterscheiden kann.

Außer Dienst stellen, wenn

Die Injection-Fälle in der Evaluierungssuite sind nach Entfernung dieser Kontrollmaßnahme nicht mehr erfolgreich – gemessen, nicht bloß angekündigt. Das würde bedeuten, dass die Trennung unterhalb des Prompts und nicht innerhalb des Prompts erzwungen wird.

Sollte beeinflussenvyr

ACM-13

Modellausgabe wird als nicht vertrauenswürdige Eingabe behandelt

Feedforwarddeterministischnicht aufgrund von Fähigkeiten

Alles, was das Modell ausgibt und was einen Renderer, eine Shell, eine Abfrage oder ein anderes System erreicht, wird genau so codiert und validiert, wie es bei der Eingabe eines Fremden der Fall wäre.

Warum dieser Quadrant: Der Zeitpunkt bezieht sich auf die zu schützende Aktion: Die Codierung wirkt auf die Eingabe der Senke, bevor die Senke etwas damit tut.

Entspricht

  • EU AI Act: Art. 15, Art. 50
  • ISO/IEC 42001: A.8 Information for interested parties
  • NIST AI Risk Management Framework 1.0: MEASURE, MANAGE
  • OWASP Top 10 for LLM Applications: LLM05 Improper Output Handling, LLM07 System Prompt Leakage
  • MITRE ATLAS: Defense Evasion

Testmethode

Lassen Sie das Modell ein Payload für jede Ihrer nachgelagerten Senken ausgeben. Jedes Payload wird an der Grenze neutralisiert, bevor es dort ankommt.

Nimmt an

Dass nachgelagerte Senken dem vertrauen, was sie erreicht, und dass das Modell alles ausgibt, wozu es verleitet wurde.

Außer Dienst stellen, wenn

Nicht aus Modellgründen. Dies ist eine Eigenschaft der Senke, nicht des Erzeugers: Dieselbe Codierung wäre erforderlich, wenn eine Person die Zeichenfolge eingegeben hätte.

Sollte beeinflussenvyr

ACM-14

Speicherintegrität und -ablauf

Feedbackinferenzielldie Plattform absorbiert es

Was der Agent in den persistenten Speicher schreibt, ist zugeordnet, überprüfbar und kann ablaufen. Der Speicher ist das, was einen einmaligen Angriff in einen Angriff verwandelt, der bei zukünftigen, nicht damit zusammenhängenden Aufgaben erneut ausgelöst wird.

Warum dieser Quadrant: Es greift bei dem, was bereits geschrieben wurde, und die Entscheidung, dass eine gespeicherte Tatsache falsch ist, ist eine Ermessensentscheidung, die keine Regel für Sie übernimmt.

Entspricht

  • EU AI Act: Art. 10, Art. 15
  • ISO/IEC 42001: A.7 Data for AI systems
  • NIST AI Risk Management Framework 1.0: MAP, MANAGE
  • OWASP Top 10 for LLM Applications: LLM04 Data and Model Poisoning, LLM08 Vector and Embedding Weaknesses
  • MITRE ATLAS: Persistence, AI Attack Staging

Testmethode

Schreiben Sie eine falsche Tatsache über eine normale Interaktion. Zeigen Sie auf, woher sie stammt, wer sie entfernen kann und wann sie von selbst ablaufen würde.

Nimmt an

Dass geschriebener Speicher über Aufgaben hinweg bestehen bleibt und dass eine einmal geschriebene falsche Tatsache viele Male gelesen wird.

Außer Dienst stellen, wenn

Das Speichersystem ordnet Schreibvorgänge selbstständig zu und lässt sie ablaufen, sodass Integrität keine Disziplin mehr ist, die das Harness von außen erzwingen muss.

Sollte beeinflussenvgap

ACM-15

Provenienz für Modelle, Prompts und Server

Feedforwarddeterministischnicht aufgrund von Fähigkeiten

Modelle, System-Prompts, MCP-Server, Pakete und Datensätze sind festgeschrieben (pinned), werden bei Änderungen überprüft und sind bis zu einer Quelle rückverfolgbar. Eine Abhängigkeit, die eine Tool-Beschreibung umschreiben kann, kann auch das Verhalten des Agenten umschreiben.

Warum dieser Quadrant: Ein Pin wird überprüft, bevor die Abhängigkeit verwendet wird, und eine geänderte Tool-Beschreibung ist ein Diff, keine Meinung.

Entspricht

  • EU AI Act: Art. 10, Art. 11, Art. 25
  • ISO/IEC 42001: A.10 Third-party and customer relationships, A.6 AI system life cycle
  • NIST AI Risk Management Framework 1.0: GOVERN, MAP
  • OWASP Top 10 for LLM Applications: LLM03 Supply Chain, LLM04 Data and Model Poisoning
  • MITRE ATLAS: Resource Development, Initial Access

Testmethode

Nennen Sie für jede externe Abhängigkeit die festgeschriebene Version und wer die letzte Änderung überprüft hat. Ändern Sie eine Tool-Beschreibung upstream; die Änderung wird erkannt, bevor sie die Produktion erreicht.

Nimmt an

Dass sich eine Abhängigkeit unbemerkt ändern kann und dass diese Änderung das Verhalten beeinflussen kann, ohne Ihren Code zu ändern.

Außer Dienst stellen, wenn

Nicht aus Kapazitätsgründen. Erst dies verleiht dem Determinismus-Bereich eine Bedeutung: Ohne Pinning messen wiederholte Durchläufe lediglich den Release-Zyklus des Anbieters.

Sollte beeinflussendband

ACM-18

Ein Bedrohungsmodell, das gepflegt und getestet wird

Feedbackinferenzielldie Plattform absorbiert es

Die Angriffsflächen sind jeweils mit einer Kontrollmaßnahme und einem Verantwortlichen dokumentiert, akzeptierte Risiken werden als solche benannt und das Dokument wird immer dann überarbeitet, wenn sich ein Tool, eine Datenquelle oder eine Autonomiestufe ändert.

Warum dieser Quadrant: Sein Test vergleicht zwei Daten, aber was im Dokument steht, ist eine Ermessensentscheidung, und es wird als Reaktion auf bereits vorgenommene Änderungen überarbeitet.

Entspricht

  • EU AI Act: Art. 9, Art. 72
  • ISO/IEC 42001: A.5 Assessing impacts of AI systems, Clause 10 Improvement
  • NIST AI Risk Management Framework 1.0: MAP, GOVERN
  • OWASP Top 10 for LLM Applications: LLM01 Prompt Injection, LLM06 Excessive Agency
  • MITRE ATLAS: Reconnaissance, AI Attack Staging

Testmethode

Zeigen Sie das aktuelle Bedrohungsmodell und das Datum der letzten Änderung am Tool-Katalog. Wenn der Katalog neuer ist als das Modell, ist das Modell veraltet und diese Kontrollmaßnahme schlägt fehl.

Nimmt an

Dass sich die Angriffsfläche ändert, wenn sich Tools, Datenquellen oder Autonomiestufen ändern, und dass dies niemand bemerkt, wenn nicht jemand dafür verantwortlich gemacht wird.

Außer Dienst stellen, wenn

Das Bedrohungsmodell wird aus dem Tool-Katalog und der Autonomiekonfiguration generiert, sodass es nicht hinterherhinken kann. Zu diesem Zeitpunkt wurde diese Kontrollmaßnahme ersetzt, nicht abgeschafft.

Sollte beeinflussencontain