Harness Maturity Model

Das Harness Maturity Model

Sieben Stufen, von prompt-basiert bis adaptiv. Jede Stufe über der Basisstufe enthält Kriterien, die man erfüllen oder verfehlen kann, da eine in Adjektiven beschriebene Stufe niemanden einordnet. Es ist kumulativ: Sie erreichen eine Stufe nur, wenn jedes Kriterium auf dieser und den darunter liegenden Stufen erfüllt ist.

Version 1.0 · Aktualisiert 2026-08-27 · 7 Stufen · 18 Kriterien

JSONMaschinenlesbar

Wie man es liest

Kumulativ, kein Menü. Ein Harness erreicht Stufe 4, wenn alles auf den Stufen 1, 2, 3 und 4 erfüllt ist – nicht, wenn es lediglich über eine Evaluierungssuite verfügt. Ohne diese Regel wählt jeder nur die Sprossen aus, die er bereits hat, und das Modell ordnet niemanden mehr ein.

Jedes Kriterium ist eine Aktion mit einem Ergebnis. Wenn Sie es nicht ausführen und eine Antwort erhalten können, gehört es nicht hierher. Die Formulierung hat bewusst dieselbe Struktur wie die Tests der Control-Matrix, da es sich um dieselbe Art von Dingen handelt.

Jede Stufe gibt auch an, was fehlerhaft bleibt, wenn Sie dort aufhören. Diese Hälfte ist die ehrliche: Stufen sind keine Tugenden, sondern Kompromisse, die jemand bewusst eingegangen ist.

Dies ist eine Selbsteinschätzung, was die schwächste Form der Bewertung überhaupt ist. Das Modell wird veröffentlicht, damit über die Kriterien diskutiert werden kann, und die dahinter stehende Behauptung legt fest, was die Reihenfolge widerlegen würde.

cumulativetheoreticallow

Die Behauptung, auf der dies beruht: HE-CLAIM-006abrufbar über MCP mit get_claim.

Level 0

Prompt-gesteuert

prompted

Eine Person steuert jeden Durchlauf. Das Modell wird manuell aufgerufen, die Prompts befinden sich in Chatfenstern und in den Notizen von jemandem, und nichts von einem Durchlauf bleibt danach erhalten.

Die Basis. Sie hat keine eigenen Kriterien: Hier befindet sich ein Harness, wenn Level 1 fehlschlägt.

Was ungelöst bleibt, wenn Sie hier aufhören

Nichts ist wiederholbar, also kann auch nichts verbessert werden. Zwei Personen, die dasselbe anfordern, bauen zwei verschiedene Systeme, und keiner von beiden kann sagen, warum seines funktioniert.

Level 1

Skriptbasiert

scripted

Die Aufrufe befinden sich im Code und die Prompts sind versionierte Artefakte. Ein Durchlauf kann aus dem Repository reproduziert werden, anstatt aus dem Gedächtnis von jemandem.

Kriterien

  1. Nehmen Sie einen Durchlauf aus dem letzten Monat und reproduzieren Sie ihn. Der Prompt, das Modell und die Parameter stammen alle aus der Versionskontrolle.

    Abgelesen vonACM-15

  2. Ändern Sie einen Prompt. Die Änderung erscheint als Diff mit einem Autor und einem Datum, und die vorherige Version ist weiterhin abrufbar.

    Abgelesen vonACM-15

  3. Fragen Sie ab, welche Modellversion für einen bestimmten Durchlauf verwendet wurde. Die Antwort stammt aus einer Aufzeichnung, nicht aus einer Annahme darüber, was in dieser Woche aktuell war.

    Abgelesen vonACM-10ACM-15

Was ungelöst bleibt, wenn Sie hier aufhören

Der Agent kann immer noch auf nichts einwirken, daher sind seine Kosten durch seine Nutzlosigkeit begrenzt. Hier aufzuhören ist eine vertretbare Entscheidung; das, was Sie haben, als Agenten zu bezeichnen, ist es nicht.

Level 2

Tool-gestützt

tooled

Der Agent agiert auf realen Systemen über eine deklarierte Tool-Oberfläche: Jedes Tool ist aufgelistet, im Scope definiert, hat einen Verantwortlichen und wird serverseitig abgelehnt, wenn es auf ein unzulässiges Ziel gerichtet wird.

Kriterien

  1. Legen Sie den Tool-Katalog vor. Jedes Tool, das der Agent aufrufen kann, ist darin enthalten, mit einem schriftlich definierten Scope, der Angabe, ob es Schreibrechte besitzt, und einem benannten Verantwortlichen.

    Abgelesen vonACM-01

  2. Zeigen Sie für jedes Tool seine Anmeldedaten und deren serverseitigen Scope. Keine zwei Tools teilen sich Anmeldedaten, deren Reichweite die Anforderungen eines der beiden Tools übersteigt.

    Abgelesen vonACM-02

  3. Rufen Sie ein schreibfähiges Tool mit einem Ziel außerhalb des Scopes auf. Der Aufruf wird durch die eigene Grenze des Tools abgelehnt, nicht durch die Verweigerung des Modells.

    Abgelesen vonACM-03Gemessen ancontain

Was ungelöst bleibt, wenn Sie hier aufhören

Der Agent kann nun Schaden anrichten, und noch begrenzt nichts das Ausmaß. Jeder Vorfall ab diesem Zeitpunkt ist ein Vorfall in einem System, auf das es ankommt.

Level 3

Eingegrenzt

bounded

Das Harness erzwingt Grenzen, ohne das Modell um deren Einhaltung zu bitten: Egress ist standardmäßig blockiert (Default-Deny), der Verbrauch wird durch den Host gedeckelt und nicht vertrauenswürdige Inhalte werden als Daten und nicht als Anweisungen behandelt.

Kriterien

  1. Fordern Sie aus der Umgebung des Agenten heraus einen Host an, der nicht auf der Liste steht. Dies schlägt auf der Netzwerk- oder Proxy-Ebene fehl, und die Ablehnung geht als Sicherheitssignal ein, nicht als Timeout.

    Abgelesen vonACM-04ACM-05

  2. Führen Sie einen Task aus, der so konzipiert ist, dass er nicht endet. Ein Kontingent (Quota) stoppt ihn, der Stopp wird protokolliert und die Kosten des Versuchs waren begrenzt und bereits vor dem Start bekannt.

    Abgelesen vonACM-07

  3. Platzieren Sie eine Anweisung in einem Dokument, das der Agent abruft. Er darf sie lesen; er darf sie jedoch nicht ausführen, und der Versuch muss im Nachhinein sichtbar sein.

    Abgelesen vonACM-12ACM-13

Was ungelöst bleibt, wenn Sie hier aufhören

Der Schadensradius (Blast Radius) ist begrenzt, die Qualität jedoch nicht. Das System fällt sicher aus (Fail-Safe), aber niemand kann sagen, ob es überhaupt funktioniert.

Level 4

Evaluiert

evaluated

Änderungen werden durch eine Testsuite abgesichert, deren Fehlschlagen bereits beobachtet wurde. Regressionen blockieren das Release, die Wiederholbarkeit ist eine messbare Kennzahl und die Lücke zwischen den Behauptungen des Agenten und den Erkenntnissen eines Verifizierers wird gemessen.

Kriterien

  1. Führen Sie eine bekannte Regression ein. Die Suite fängt sie ab und die Änderung wird nicht ausgeliefert. Eine Suite, die man noch nie hat fehlschlagen sehen, hat eine unbekannte Erkennungsrate, keine perfekte.

    Abgelesen vonACM-11Gemessen ancatch

  2. Führen Sie das Evaluationsset fünfmal ohne Änderungen aus und geben Sie an, wie viele Fälle jedes Mal dasselbe Ergebnis erzielt haben. Die Zahl existiert und jemand kennt sie.

    Abgelesen vonACM-11Gemessen andband

  3. Vergleichen Sie die Behauptungen des Agenten für eine Reihe von Durchläufen mit den Erkenntnissen eines unabhängigen Verifizierers. Die Differenz ist eine Zahl und es wird nicht davon ausgegangen, dass sie Null ist.

    Abgelesen vonACM-10ACM-11Gemessen anvgap

Was ungelöst bleibt, wenn Sie hier aufhören

Die Qualität wird gemessen, die Verantwortlichkeit jedoch nicht. Wenn etwas schiefgeht, können Sie zwar beweisen, dass eine Regression vorliegt, aber nicht, wer sie durchgelassen hat.

Level 5

Gesteuert

governed

Befugnisse, Nachweise und Eskalationen haben feste Verantwortliche. Ein Durchlauf kann von jemandem rekonstruiert werden, der nicht dabei war, Gates existieren, weil ein Risikokriterium sie dort platziert hat, und das Bedrohungsmodell ist aktueller als der Tool-Katalog.

Kriterien

  1. Wählen Sie zufällig einen vergangenen Durchlauf aus und rekonstruieren Sie ihn lückenlos allein anhand des Logs, ohne dass der ursprüngliche Operator anwesend sein muss. Bestätigen Sie anschließend, dass das Log keine Geheimnisse enthält, die es nicht benötigt hätte.

    Abgelesen vonACM-10Gemessen anrecon

  2. Listen Sie die durch Gates geschützten Aktionen und das Risikokriterium auf, das sie dorthin geführt hat. Erzwingen Sie eine Eskalation; diese erreicht eine namentlich genannte Person innerhalb der angegebenen Zeit und enthält den für das Handeln erforderlichen Kontext.

    Abgelesen vonACM-08ACM-09Gemessen anhir

  3. Zeigen Sie das aktuelle Bedrohungsmodell und das Datum der letzten Änderung am Tool-Katalog. Wenn der Katalog neuer ist, schlägt dieses Kriterium fehl und die Stufe wird nicht gehalten.

    Abgelesen vonACM-18

Was ungelöst bleibt, wenn Sie hier aufhören

Alles ist vorhanden und nichts läuft ab. Das Harness wird auch im nächsten Jahr noch die Ausgleichsmaßnahmen erzwingen, die ein Modell im letzten Jahr benötigt hat.

Level 6

Adaptiv

adaptive

Das Harness verändert sich auf der Grundlage von Nachweisen, bis hin zu seiner eigenen Entfernung. Komponenten tragen das Modell, gegen das sie validiert wurden, sowie die Bedingung für ihre Ausmusterung in sich, und es wurde tatsächlich bereits etwas ausgemustert.

Kriterien

  1. Nennen Sie ein Control, eine Prompt-Regel oder einen Kontextblock, das bzw. der in den letzten zwei Quartalen entfernt wurde, und zeigen Sie die Messung, die die Entfernung gerechtfertigt hat. „Wir haben es ohne versucht und es schien in Ordnung zu sein“ ist keine Messung.

    Gemessen ancvo

  2. Geben Sie für eine noch vorhandene Komponente das Modell an, an dem sie validiert wurde, sowie die Bedingung, unter der sie ausgemustert werden würde. Beides muss schriftlich festgehalten sein, nicht bloß in Erinnerung.

    Abgelesen vonACM-15

  3. Zeigen Sie die Kosten pro korrekt verifiziertem Ergebnis für denselben Aufgabensatz über zwei Modellgenerationen hinweg, jeweils mit dem Harness, das diese Generation tatsächlich benötigt hat.

    Gemessen ancvotvo

Was ungelöst bleibt, wenn Sie hier aufhören

Nichts hier ist stabil, und genau das ist der Punkt. Ein Harness, das sich auf der Grundlage von Nachweisen ändert, benötigt verlässliche Nachweise, und jede Metrik auf der Scorecard kann von denjenigen manipuliert werden, die daran gemessen werden.