Harness Scorecard

Le Harness Scorecard

Une formule et onze métriques, pour que deux harnesses puissent être comparés par autre chose que des adjectifs. L'unité principale est le coût par résultat correctement vérifié — et non les exécutions réussies, ce qui relève de l'auto-déclaration et constitue la seule chose qu'un harness défectueux sait encore produire.

Version 1.0 · Mis à jour 2026-08-27 · 11 métriques

JSONLisible par machine

L'unité

CVO = total cost of the run set / outcomes that passed independent verification

Numérateur
Chaque coût attribuable à l'ensemble d'exécutions : inférence, outils, infrastructure et temps humain consacré à approuver, corriger ou escalader. Les tentatives échouées et abandonnées figurent au numérateur. Elles ont coûté de l'argent et elles ont bien eu lieu.
Dénominateur
Uniquement les résultats ayant passé un contrôle qui ne partage pas de mode de défaillance avec l'agent qui les a produits. Les exécutions terminées ne comptent pas. Les exécutions déclarées réussies par l'agent ne comptent pas.
Ce qui rend un vérificateur indépendant
Un vérificateur est indépendant lorsqu'il peut échouer sur des entrées pour lesquelles le producteur réussit. Une règle, un test, un second système ou une personne physique sont tous éligibles. Le même modèle invité à évaluer sa propre sortie ne l'est pas : il hérite des angles morts qui ont produit l'erreur.
Pourquoi pas les exécutions réussies
Les exécutions réussies relèvent de l'auto-déclaration, et c'est le chiffre que chaque fournisseur publie déjà. Il comptabilise la fin de l'exécution de l'agent, ce qui est la seule chose qu'un harness défaillant sait encore faire. Le coût par résultat correctement vérifié refuse de bouger tant qu'un élément extérieur à l'agent ne confirme pas que le travail est terminé.

HSC-01 · Coût par résultat correctement vérifié

Ce que c'est, et ce que ce n'est pas

Il s'agit d'une proposition, non d'un résultat mesuré. Rien ici n'a été exécuté sur un système réel, aucun seuil n'est calibré, et les onze métriques ont été choisies par argumentation plutôt qu'en cherchant à savoir lesquelles sont prédictives. Le fichier l'indique d'ailleurs dans son propre bloc de preuves : théorique, faible niveau de confiance.

Il est publié afin de pouvoir être débattu. L'affirmation sur laquelle il repose énonce ce qui l'infirmerait, et le jour où une mesure le contredit, c'est la mesure qui l'emporte.

theoreticallow

L'affirmation sur laquelle cela repose : HE-CLAIM-005récupérable via MCP avec get_claim.

Les métriques

Résultat

HSC-01

Coût par résultat correctement vérifié

currency/outcomeMeilleur quand plus bas

Chaque coût attribuable à un ensemble d'exécutions — inférence, outils, infrastructure et temps humain consacré à approuver, corriger ou escalader — divisé par le nombre de résultats ayant passé un contrôle indépendant.

Comment mesurer

Fixez l'ensemble de tâches et le vérificateur avant de lancer quoi que ce soit. Sommez le coût de l'ensemble complet, tentatives échouées incluses. Divisez par les résultats validés par le vérificateur, et non par les exécutions terminées.

Comment la fausser

Restreindre ce qui est considéré comme un résultat, ou laisser le propre rapport de l'agent faire office de vérification. Les deux réduisent l'honnêteté du dénominateur plutôt que le coût du numérateur.

Relevé depuisACM-11

HSC-02

Taux de rendement vérifié

percentMeilleur quand plus élevé

La part des tâches tentées qui produisent un résultat passant une vérification indépendante.

Comment mesurer

Les tentatives au dénominateur, les résultats vérifiés au numérateur. Une tentative abandonnée en raison d'un dépassement de délai reste une tentative, et une exécution abandonnée par l'agent reste également une tentative.

Comment la fausser

Ne tenter que les tâches que le harness gère déjà. Un taux de rendement sans ensemble de tâches déclaré est un chiffre qui concerne l'ensemble de tâches, pas le harness.

Relevé depuisACM-11

HSC-03

Écart de vérification

percentage pointsMeilleur quand plus bas

Le taux de réussite auto-déclaré moins le taux vérifié de manière indépendante, en points de pourcentage. Il mesure si le harness est capable de savoir s'il a réussi.

Comment mesurer

Enregistrez ce que l'agent a déclaré pour chaque exécution et ce que le vérificateur a trouvé, puis soustrayez. Indiquez le signe : un harness qui sous-déclare a un problème différent de celui qui sur-déclare, et non un problème moindre.

Comment la fausser

Cesser de demander à l'agent de s'auto-déclarer. L'écart disparaît, tout comme le seul signal indiquant que le harness ne peut pas distinguer le succès de l'échec.

Relevé depuisACM-10ACM-11

Coût et effort

HSC-04

Tokens par résultat vérifié

tokens/outcomeMeilleur quand plus bas

Les tokens du modèle, en entrée et en sortie, sur l'ensemble des tentatives, divisés par les résultats vérifiés. Le chiffre de coût qui ne varie pas lorsqu'un fournisseur modifie sa grille tarifaire.

Comment mesurer

Comptez les tokens pour l'ensemble des exécutions — y compris les essais répétés et les tentatives abandonnées. Indiquez en parallèle le modèle et sa version ; sans eux, ce chiffre ne permet aucune comparaison.

Comment la fausser

Déplacer le travail hors du modèle vers un outil non comptabilisé ou une revue humaine plus longue. Les tokens diminuent, mais pas le coût réel.

Relevé depuisACM-07

HSC-05

Interventions humaines par résultat vérifié

interventions/outcomeMeilleur quand plus bas

Approbations, escalades et corrections manuelles par résultat vérifié. Il ne s'agit pas de savoir si une personne intervient dans le processus, mais à quelle fréquence le processus sollicite une intervention humaine.

Comment mesurer

Comptez chaque événement ayant nécessité l'action d'une personne avant que le résultat ne puisse être validé. Les approbations de pure forme comptent : ce qui est mesuré est la sollicitation des personnes, non la qualité de leur attention.

Comment la fausser

Supprimer les points de contrôle. Le taux tombe à zéro sans que rien ne se soit amélioré dans le harness — c'est pourquoi cette mesure doit être lue en parallèle avec l'écart de vérification, et jamais seule.

Relevé depuisACM-08ACM-09

HSC-06

Temps jusqu'au résultat vérifié

secondsMeilleur quand plus bas

Temps réel écoulé entre l'acceptation d'une tâche et la validation de son résultat par la vérification, y compris l'attente avant toute étape humaine.

Comment mesurer

Indiquez la médiane et le 95e percentile, sinon ne publiez rien : une longue traîne d'exécutions bloquées est précisément ce qu'une moyenne dissimule.

Comment la fausser

Mesurer jusqu'à la fin de l'exécution de l'agent plutôt que jusqu'à la validation de la vérification. C'est dans la file d'attente devant un réviseur humain que se trouvent réellement les heures.

Relevé depuisACM-07

Fiabilité

HSC-07

Bande de déterminisme

percentMeilleur quand plus élevé

La part de l'ensemble d'évaluation qui parvient au même verdict vérifié lors d'exécutions répétées de la même entrée, le harness restant inchangé.

Comment mesurer

Exécutez l'ensemble complet au moins cinq fois et déclarez N. Un cas se situe dans la bande lorsque chaque répétition aboutit au même verdict — et non lorsque la moyenne est bonne.

Comment la fausser

Exécuter une seule fois et déclarer le score. Un chiffre basé sur une seule exécution contient la réponse de cette métrique tout en la masquant.

Relevé depuisACM-11

HSC-08

Taux de récupération

percentMeilleur quand plus élevé

Parmi les exécutions qui rencontrent une défaillance — erreur d'outil, refus, dépassement de délai, plan rejeté —, la part de celles qui parviennent tout de même à un résultat vérifié.

Comment mesurer

La défaillance doit être visible dans la trace avant de pouvoir être comptabilisée, cette mesure ne peut donc pas être calculée sans une trace d'exécution corrélée. N'avoir jamais échoué ne constitue pas une récupération et ne doit pas être comptabilisé comme tel.

Comment la fausser

Masquer les défaillances au lieu de s'en remettre. Une boucle de tentative qui ignore une erreur d'outil augmente ce chiffre et l'écart de vérification en même temps.

Relevé depuisACM-10

HSC-09

Ratio de confinement

percentMeilleur quand plus élevé

La part des actions d'écriture, irréversibles ou réglementées du harness qui sont placées derrière un contrôle à la fois prédictif (feedforward) et déterministe.

Comment mesurer

Listez les actions du catalogue d'outils, nommez le contrôle qui bloque chacune d'elles, et lisez les deux axes de ce contrôle sur l'Agentic Control Matrix. Les points de contrôle décidés par jugement ne comptent pas ici — le taux d'intervention humaine comptabilise ceux-là.

Comment la fausser

Reclasser les actions comme réversibles. Le ratio augmente mais le rayon d'impact ne change pas.

Relevé depuisACM-01ACM-03ACM-17ACM-18

Preuves

HSC-10

Reconstructibilité

percentMeilleur quand plus élevé

Sur un échantillon aléatoire d'exécutions passées, la part de celles qui peuvent être reconstruites de bout en bout à partir du seul journal : entrées, modèle, appels d'outils, résultat.

Comment mesurer

Échantillonnez des exécutions que personne n'a choisies, et reconstruisez-les sans solliciter l'équipe et sans la présence de l'opérateur d'origine. Une exécution qui nécessite l'explication d'une personne n'est pas validée.

Comment la fausser

Échantillonner les exécutions déjà connues pour être propres — ou tout journaliser, secrets inclus. Cette mesure est lue en parallèle avec le fait de savoir si le journal contient des données dont il n'a jamais eu besoin.

Relevé depuisACM-10

HSC-11

Taux de détection des régressions

percentMeilleur quand plus élevé

Parmi les défauts délibérément introduits dans le système, la part que la suite d'évaluation détecte avant la mise en production.

Comment mesurer

Introduisez les types de défauts que vous redoutez réellement, un par un, et lancez la suite sur chacun d'eux. Une suite qui n'a jamais échoué présente un taux de détection inconnu, et non parfait.

Comment la fausser

Introduire les défauts à partir desquels la suite a été écrite. Le taux atteint 100 % et ne mesure rien d'autre que la mémoire de l'auteur.

Relevé depuisACM-11

Ce qu'un résultat doit mentionner

Un chiffre sans ces éléments n'est pas comparable à un autre. HarnessBench signale les six ou ne signale rien.

  • modelLe modèle et sa version exacte
  • task_setLe jeu de tâches, et sa provenance
  • verifierLe vérificateur, et pourquoi il est indépendant de l'agent
  • repeatsLe nombre d'exécutions du jeu
  • dateLa date d'exécution
  • cost_basisCe que le coût inclut, y compris le temps humain