Harness Scorecard

Die Harness Scorecard

Eine Formel und elf Metriken, damit zwei Harnesses durch etwas anderes als Adjektive verglichen werden können. Die primäre Einheit sind die Kosten pro korrekt verifiziertem Ergebnis – nicht erfolgreiche Durchläufe, was eine Selbsteinschätzung ist und das Einzige, was ein defekter Harness immer noch gut produzieren kann.

Version 1.0 · Aktualisiert 2026-08-27 · 11 Metriken

JSONMaschinenlesbar

Die Einheit

CVO = total cost of the run set / outcomes that passed independent verification

Zähler
Alle dem Run-Set zuzuordnenden Kosten: Inferenz, Tools, Infrastruktur und die menschliche Arbeitszeit für Freigaben, Korrekturen oder Eskalationen. Fehlgeschlagene und abgebrochene Versuche stehen im Zähler. Sie kosten Geld und sie haben stattgefunden.
Nenner
Nur Ergebnisse, die eine Prüfung bestanden haben, die keine gemeinsamen Fehlerquellen (Failure Modes) mit dem Agenten teilt, der sie erzeugt hat. Abgeschlossene Runs zählen nicht. Runs, die der Agent als erfolgreich deklariert hat, zählen nicht.
Was einen Verifizierer unabhängig macht
Ein Verifizierer ist unabhängig, wenn er bei Eingaben fehlschlagen kann, bei denen der Erzeuger erfolgreich ist. Eine Regel, ein Test, ein zweites System oder eine Person sind alle dafür geeignet. Dasselbe Modell, das aufgefordert wird, seine eigene Ausgabe zu bewerten, ist es nicht: Es erbt die blinden Flecken, die den Fehler verursacht haben.
Warum nicht erfolgreiche Durchläufe
Erfolgreiche Runs sind eine Selbsteinschätzung, und das ist die Zahl, die jeder Anbieter bereits veröffentlicht. Sie zählt das Beenden des Agenten, was das Einzige ist, worin ein defektes Harness immer noch gut ist. Die Kosten pro korrekt verifiziertem Ergebnis ändern sich erst, wenn eine Instanz außerhalb des Agenten bestätigt, dass die Arbeit erledigt ist.

HSC-01 · Kosten pro korrekt verifiziertem Ergebnis

Was dies ist und was es nicht ist

Dies ist ein Vorschlag, kein gemessenes Ergebnis. Nichts hier wurde an einem realen System getestet, kein Schwellenwert ist kalibriert, und die elf Metriken wurden eher durch Argumentation ausgewählt als durch die Erkenntnis, welche von ihnen tatsächlich etwas vorhersagen. Die Datei sagt dies auch in ihrem eigenen Evidenzblock: theoretisch, geringes Vertrauen.

Es wird veröffentlicht, damit man sich damit auseinandersetzen kann. Die Behauptung, auf der es beruht, legt fest, was es widerlegen würde, und an dem Tag, an dem eine Messung ihm widerspricht, gewinnt die Messung.

theoreticallow

Die Behauptung, auf der dies beruht: HE-CLAIM-005abrufbar über MCP mit get_claim.

Die Metriken

Ergebnis

HSC-01

Kosten pro korrekt verifiziertem Ergebnis

currency/outcomeBesser, wenn niedriger

Alle einem Run-Set zuzuordnenden Kosten – Inferenz, Tools, Infrastruktur und die menschliche Arbeitszeit für Freigaben, Korrekturen oder Eskalationen – geteilt durch die Anzahl der Ergebnisse, die eine unabhängige Prüfung bestanden haben.

Wie man es misst

Legen Sie das Aufgabenset und den Verifizierer fest, bevor Sie etwas ausführen. Summieren Sie die Kosten des gesamten Sets, einschließlich fehlgeschlagener Versuche. Teilen Sie durch die vom Verifizierer freigegebenen Ergebnisse, nicht durch die abgeschlossenen Runs.

Wie man es manipuliert

Grenzen Sie ein, was als Ergebnis zählt, oder lassen Sie den Bericht des Agenten selbst als Verifizierung gelten. Beides verringert die Ehrlichkeit des Nenners, anstatt die Kosten des Zählers zu senken.

Abgelesen vonACM-11

HSC-02

Verifizierte Yield-Rate

percentBesser, wenn höher

Der Anteil der versuchten Aufgaben, die ein Ergebnis liefern, das eine unabhängige Verifizierung besteht.

Wie man es misst

Versuche im Nenner, verifizierte Ergebnisse im Zähler. Ein wegen eines Timeouts abgebrochener Versuch ist immer noch ein Versuch, und ein Run, den der Agent aufgegeben hat, ist ebenfalls ein Versuch.

Wie man es manipuliert

Versuchen Sie nur die Aufgaben, die das Harness bereits bewältigen kann. Eine Yield-Rate ohne definiertes Aufgabenset ist eine Aussage über das Aufgabenset, nicht über das Harness.

Abgelesen vonACM-11

HSC-03

Verifizierungslücke

percentage pointsBesser, wenn niedriger

Die selbstberichtete Erfolgsquote minus der unabhängig verifizierten Erfolgsquote in Prozentpunkten. Sie misst, ob das Harness erkennen kann, ob es erfolgreich war.

Wie man es misst

Erfassen Sie für jeden Run, was der Agent behauptet hat und was der Verifizierer festgestellt hat, und subtrahieren Sie dies dann. Geben Sie das Vorzeichen an: Ein Harness, das zu wenig meldet, hat ein anderes Problem als eines, das zu viel meldet, kein kleineres.

Wie man es manipuliert

Fragen Sie den Agenten nicht mehr nach einer Selbsteinschätzung. Die Lücke verschwindet und damit auch das einzige Signal dafür, dass das Harness Erfolg nicht von Misserfolg unterscheiden kann.

Abgelesen vonACM-10ACM-11

Kosten und Aufwand

HSC-04

Token pro verifiziertem Ergebnis

tokens/outcomeBesser, wenn niedriger

Modell-Token, Input und Output, über alle Versuche hinweg, geteilt durch die verifizierten Ergebnisse. Die Kostenkennzahl, die sich nicht ändert, wenn ein Anbieter seine Preisliste anpasst.

Wie man es misst

Zählen Sie die Token für das gesamte Run-Set – einschließlich Wiederholungen und abgebrochener Versuche. Geben Sie das Modell und seine Version mit an; ohne diese lässt sich mit der Zahl nichts vergleichen.

Wie man es manipuliert

Verlagern Sie Arbeit aus dem Modell in ein nicht gezähltes Tool oder eine längere menschliche Überprüfung. Die Token sinken, die tatsächlichen Kosten jedoch nicht.

Abgelesen vonACM-07

HSC-05

Menschliche Eingriffe pro verifiziertem Ergebnis

interventions/outcomeBesser, wenn niedriger

Freigaben, Eskalationen und manuelle Korrekturen pro verifiziertem Ergebnis. Nicht, ob eine Person in den Prozess eingebunden ist, sondern wie oft der Prozess einen Eingriff erfordert.

Wie man es misst

Zählen Sie jedes Ereignis, das eine menschliche Aktion erforderte, bevor das Ergebnis gültig war. Reine Formsache-Freigaben zählen mit: Gemessen wird die Beanspruchung der Personen, nicht die Qualität ihrer Aufmerksamkeit.

Wie man es manipuliert

Entfernen Sie die Kontrollpunkte (Gates). Die Quote sinkt auf null, ohne dass sich am Harness etwas verbessert hat – weshalb diese Kennzahl immer zusammen mit der Verifizierungslücke und niemals allein betrachtet werden sollte.

Abgelesen vonACM-08ACM-09

HSC-06

Zeit bis zum verifizierten Ergebnis

secondsBesser, wenn niedriger

Tatsächliche Durchlaufzeit (Wall-Clock-Time) von der Annahme einer Aufgabe bis zum Bestehen der Verifizierung des Ergebnisses, einschließlich der Wartezeit vor jedem menschlichen Schritt.

Wie man es misst

Geben Sie den Median und das 95. Perzentil an, oder lassen Sie es ganz bleiben: Ein langer Tail von feststeckenden Runs ist genau das, was ein Mittelwert verbirgt.

Wie man es manipuliert

Messen Sie bis zum Abschluss des Agenten statt bis zum Bestehen der Verifizierung. Die Warteschlange vor einem menschlichen Prüfer ist der Ort, an dem die Stunden tatsächlich verloren gehen.

Abgelesen vonACM-07

Zuverlässigkeit

HSC-07

Determinismus-Band

percentBesser, wenn höher

Der Anteil des Evaluierungssets, der bei wiederholten Runs derselben Eingabe bei unverändertem Harness dasselbe verifizierte Ergebnis erzielt.

Wie man es misst

Führen Sie das gesamte Set mindestens fünfmal aus und deklarieren Sie N. Ein Fall liegt innerhalb des Bands, wenn jede Wiederholung zum selben Ergebnis führt – nicht, wenn der Durchschnitt gut ist.

Wie man es manipuliert

Führen Sie den Test nur einmal aus und melden Sie das Ergebnis. Eine Zahl aus einem einzelnen Run enthält die Antwort dieser Metrik und verbirgt sie gleichzeitig.

Abgelesen vonACM-11

HSC-08

Recovery-Rate

percentBesser, wenn höher

Der Anteil der Runs, bei denen ein Fehler aufgetreten ist – ein Tool-Fehler, eine Verweigerung, ein Timeout, ein abgelehnter Plan –, die dennoch ein verifiziertes Ergebnis erreichen.

Wie man es misst

Der Fehler muss im Trace sichtbar sein, bevor er gezählt werden kann. Daher kann dies nicht ohne einen korrelierten Run-Trace berechnet werden. Niemals fehlgeschlagen zu sein, ist keine Recovery und darf nicht als solche gezählt werden.

Wie man es manipuliert

Unterdrücken Sie die Fehler, anstatt sie zu beheben (Recovery). Eine Wiederholungsschleife (Retry Loop), die einen Tool-Fehler verschluckt, erhöht diese Zahl und gleichzeitig die Verifizierungslücke.

Abgelesen vonACM-10

HSC-09

Containment-Quote

percentBesser, wenn höher

Der Anteil der schreibfähigen, irreversiblen oder regulierten Aktionen des Harness, die hinter einer Kontrolle liegen, die sowohl vorwärtskoppelnd (feedforward) als auch deterministisch ist.

Wie man es misst

Listen Sie die Aktionen aus dem Tool-Katalog auf, nennen Sie die Kontrolle, die die jeweilige Aktion stoppt, und lesen Sie die beiden Achsen dieser Kontrolle aus der Agentic Control Matrix ab. Durch Ermessensentscheidungen bestimmte Gates zählen hier nicht – diese werden durch die Quote menschlicher Eingriffe erfasst.

Wie man es manipuliert

Klassifizieren Sie Aktionen als reversibel um. Die Quote steigt, aber der Schadensradius (Blast Radius) ändert sich nicht.

Abgelesen vonACM-01ACM-03ACM-17ACM-18

Evidenz

HSC-10

Rekonstruierbarkeit

percentBesser, wenn höher

Der Anteil einer Zufallsstichprobe vergangener Runs, der allein anhand des Logs durchgängig rekonstruiert werden kann: Eingaben, Modell, Tool-Aufrufe, Ergebnis.

Wie man es misst

Wählen Sie stichprobenartig Runs aus, die niemand gezielt ausgesucht hat, und rekonstruieren Sie diese, ohne das Team zu fragen und ohne dass der ursprüngliche Operator anwesend ist. Ein Run, der eine Person zur Erklärung benötigt, hat nicht bestanden.

Wie man es manipuliert

Wählen Sie Runs aus, von denen bereits bekannt ist, dass sie fehlerfrei sind – oder protokollieren Sie alles, einschließlich Geheimnissen (Secrets). Dies wird zusammen mit der Frage betrachtet, ob das Log Daten enthält, die es nie benötigt hätte.

Abgelesen vonACM-10

HSC-11

Regressions-Erkennungsrate

percentBesser, wenn höher

Der Anteil der absichtlich in das System eingebauten Fehler, die von der Evaluierungssuite vor dem Release erkannt werden.

Wie man es misst

Bauen Sie nacheinander genau die Arten von Fehlern ein, die Sie tatsächlich befürchten, und führen Sie die Suite für jeden einzelnen aus. Eine Suite, bei der noch nie ein Fehlschlag beobachtet wurde, hat eine unbekannte Erkennungsrate, keine perfekte.

Wie man es manipuliert

Bauen Sie genau die Fehler ein, für die die Suite geschrieben wurde. Die Rate steigt auf 100 % und misst nichts weiter als das Gedächtnis des Autors.

Abgelesen vonACM-11

Was ein Ergebnis angeben muss

Eine Zahl ohne diese Angaben ist nicht mit einer anderen Zahl vergleichbar. HarnessBench meldet alle sechs oder gar nichts.

  • modelDas Modell und seine genaue Version
  • task_setDas Task-Set und woher es stammt
  • verifierDer Verifizierer und warum er vom Agenten unabhängig ist
  • repeatsWie oft das Set ausgeführt wurde
  • dateDas Datum der Ausführung
  • cost_basisWas die Kostenangabe beinhaltet, einschließlich menschlicher Arbeitszeit