SANTISMM Labs · Harness Engineering

Agentic Control Sandbox

Konfigurieren Sie einen Agenten, wählen Sie eine Bedrohung aus und schalten Sie die achtzehn Kontrollen ein und aus. Alles auf dem Bildschirm wird aus der Taxonomie und der Kontrollmatrix abgeleitet – einschließlich der Zahl, die Ihnen dieses Labor bewusst vorenthält.

Matrix v1.2 · Taxonomie v1.1EU AI Act · ISO/IEC 42001 · NIST AI RMF · OWASP LLM Top 10 · MITRE ATLAS

Die meisten Demos zur Agenten-Sicherheit enden mit einer beruhigenden Zahl: einer Resilienz-Marge, einem Schutz-Score oder einer Anzeige, die grün wird, wenn man genügend Funktionen einschaltet. Diese hier tut das nicht, und dieses Weglassen ist der entscheidende Punkt. Die achtzehn Kontrollen sind real und ihre Framework-Zuordnungen sind real, aber keine einzige davon wurde jemals an einer Modellgenerierung gemessen – ein Wert für das Restrisiko würde also einen Koeffizienten erfordern, den es gar nicht gibt. Was Sie stattdessen erhalten, ist die Abdeckung: welche Quadranten Sie ausgefüllt haben, welche Sie leer gelassen haben und welche Bedrohungszuordnungen Sie berührt haben. Die Abdeckung ist eine Tatsache über Ihre Auswahl. Das Restrisiko wäre eine Behauptung über die Welt.

01Der Agent

Claude CodeGAA3·T2·D1·M2·L1·I1

Warum es hier klassifiziert ist: Terminal-nativ. Bearbeitet direkt vor Ort (in-place), liefert PRs über Git.

AAutonomie

Wer löst die Aktion aus?

Delegiert: führt die gesamte Aufgabe aus, der Mensch überprüft

TZeitlicher Horizont

Wie lange lebt es?

Task: Minuten bis Stunden, stirbt bei Erledigung

DDomänenbreite

Was deckt es ab?

Vertikal: eine Domäne (Coding, CX, Recht…)

MSpeicher & Identität

Woran erinnert es sich und wie verändert es sich?

Benutzer-/Projektspeicher (erinnert sich, verändert sich nicht)

LModellkopplung

An ein Labor gebunden?

Mono-Modell, an den Anbieter gebunden

IOperative Identität

Mit welchen Anmeldedaten agiert es?

Anmeldedaten des Benutzers (im Audit nicht unterscheidbar)

02Die Bedrohung

Direkt von den Controls abgelesen: Jeder Eintrag unten ist ein OWASP LLM Top 10-Punkt, den mindestens ein Control zu adressieren beansprucht. Die Zahl gibt an, wie viele es beanspruchen.

03Die Abwehrmaßnahmen

0/18

Berechtigungen und Reichweite

  • Feedforwardinferenziell
  • Feedforwarddeterministisch
  • Feedforwarddeterministisch

Egress und Exposition

  • Feedforwarddeterministisch
  • Feedbackdeterministisch
  • Feedforwarddeterministisch

Ausführung

  • Feedforwarddeterministisch
  • Feedbackdeterministisch
  • Feedbackinferenziell

Menschliche Aufsicht

  • Feedforwardinferenziell
  • Feedbackinferenziell

Nachweise

  • Feedbackdeterministisch
  • Feedbackinferenziell

Lebenszyklus und Inputs

  • Feedforwarddeterministisch
  • Feedforwarddeterministisch
  • Feedbackinferenziell
  • Feedforwarddeterministisch
  • Feedbackinferenziell