Scorecard del harness

La scorecard del harness

Una fórmula y once métricas, para que dos harnesses puedan compararse por algo que no sean adjetivos. La unidad principal es el coste por resultado correctamente verificado, no las ejecuciones exitosas: eso es una autodeclaración, y es justo lo único que un harness roto sigue produciendo bien.

Versión 1.0 · Actualizado 2026-08-27 · 11 métricas

JSONLegible por máquina

La unidad

CVO = total cost of the run set / outcomes that passed independent verification

Numerador
Todo coste imputable al conjunto de ejecuciones: inferencia, herramientas, infraestructura y el tiempo humano dedicado a aprobar, corregir o escalar. Los intentos fallidos y abandonados están en el numerador. Costaron dinero y ocurrieron.
Denominador
Solo los resultados que pasaron una comprobación que no comparte modo de fallo con el agente que los produjo. Las ejecuciones que terminaron no cuentan. Las que el agente declaró exitosas tampoco.
Qué hace independiente a un verificador
Un verificador es independiente cuando puede fallar en entradas en las que el productor acierta. Una regla, un test, un segundo sistema o una persona valen. El mismo modelo al que se le pide que califique su propia salida no: hereda los puntos ciegos que produjeron el error.
Por qué no ejecuciones exitosas
«Ejecuciones exitosas» es una autodeclaración, y es el número que ya publica todo proveedor. Cuenta que el agente termine, que es justo lo único que un harness roto sigue haciendo bien. El coste por resultado correctamente verificado se niega a moverse hasta que algo ajeno al agente da el trabajo por hecho.

HSC-01 · Coste por resultado correctamente verificado

Qué es esto y qué no es

Esto es una propuesta, no un resultado medido. Nada se ha ejecutado contra un sistema real, ningún umbral está calibrado, y las once métricas se eligieron por argumento y no por averiguar cuáles predicen algo. El fichero lo dice en su propio bloque de evidencia: teórico, confianza baja.

Se publica para que se pueda discutir. El claim en el que se apoya declara qué lo falsaría, y el día en que una medición lo contradiga, gana la medición.

theoreticallow

El claim en el que se apoya: HE-CLAIM-005se obtiene por MCP con get_claim.

Las métricas

Resultado

HSC-01

Coste por resultado correctamente verificado

currency/outcomeMejor cuando es menor

Todo coste imputable a un conjunto de ejecuciones —inferencia, herramientas, infraestructura y el tiempo humano dedicado a aprobar, corregir o escalar— dividido por el número de resultados que pasaron una comprobación independiente.

Cómo se mide

Fija el conjunto de tareas y el verificador antes de ejecutar nada. Suma el coste del conjunto entero, incluidos los intentos fallidos. Divide por los resultados que el verificador dio por buenos, no por las ejecuciones que terminaron.

Cómo se falsea

Estrechar lo que cuenta como resultado, o dejar que el propio informe del agente valga como verificación. Las dos cosas encogen la honestidad del denominador, no el coste del numerador.

Se lee enACM-11

HSC-02

Tasa de rendimiento verificado

percentMejor cuando es mayor

La proporción de tareas intentadas que producen un resultado que pasa una verificación independiente.

Cómo se mide

Intentos en el denominador, resultados verificados en el numerador. Un intento abandonado por un tiempo de espera sigue siendo un intento, y una ejecución que el agente dio por perdida también.

Cómo se falsea

Intentar solo las tareas que el harness ya resuelve. Una tasa de rendimiento sin conjunto de tareas declarado es un número sobre el conjunto de tareas, no sobre el harness.

Se lee enACM-11

HSC-03

Brecha de verificación

percentage pointsMejor cuando es menor

La tasa de éxito autodeclarada menos la verificada de forma independiente, en puntos porcentuales. Mide si el harness es capaz de saber que ha tenido éxito.

Cómo se mide

Registra qué afirmó el agente en cada ejecución y qué encontró el verificador, y resta. Informa del signo: un harness que se subestima tiene un problema distinto del que se sobreestima, no uno menor.

Cómo se falsea

Dejar de pedirle al agente que se autoevalúe. La brecha desaparece, y con ella la única señal de que el harness no distingue el éxito del fracaso.

Se lee enACM-10ACM-11

Coste y esfuerzo

HSC-04

Tokens por resultado verificado

tokens/outcomeMejor cuando es menor

Tokens de modelo, de entrada y de salida, en todos los intentos, divididos por los resultados verificados. La cifra de coste que no se mueve cuando un proveedor cambia su lista de precios.

Cómo se mide

Cuenta los tokens del conjunto entero de ejecuciones, reintentos e intentos abandonados incluidos. Informa del modelo y su versión al lado; sin eso el número no compara nada.

Cómo se falsea

Sacar trabajo del modelo y meterlo en una herramienta que nadie cuenta o en una revisión humana más larga. Los tokens bajan y el coste real no.

HSC-05

Intervenciones humanas por resultado verificado

interventions/outcomeMejor cuando es menor

Aprobaciones, escalados y correcciones manuales por resultado verificado. No si hay una persona en el bucle, sino con qué frecuencia el bucle se cierra sobre una.

Cómo se mide

Cuenta todo evento que exigió que una persona actuara antes de que el resultado pudiera sostenerse. Las aprobaciones de trámite cuentan: lo que se mide es la demanda sobre las personas, no la calidad de su atención.

Cómo se falsea

Quitar las compuertas. La tasa cae a cero y nada del harness ha mejorado; por eso esta métrica se lee junto a la brecha de verificación y nunca sola.

Se lee enACM-08ACM-09

HSC-06

Tiempo hasta resultado verificado

secondsMejor cuando es menor

Tiempo de reloj desde que se acepta una tarea hasta que su resultado pasa la verificación, incluida la espera delante de cualquier paso humano.

Cómo se mide

Informa de la mediana y del percentil 95, o no informes: una cola larga de ejecuciones atascadas es justo lo que una media esconde.

Cómo se falsea

Medir hasta que el agente termina y no hasta que la verificación pasa. La cola delante de un revisor humano es donde están de verdad las horas.

Se lee enACM-07

Fiabilidad

HSC-07

Banda de determinismo

percentMejor cuando es mayor

La proporción del conjunto de evaluación que llega al mismo veredicto verificado en ejecuciones repetidas de la misma entrada, con el harness sin cambios.

Cómo se mide

Ejecuta el conjunto entero al menos cinco veces y declara N. Un caso está dentro de la banda cuando todas las repeticiones caen en el mismo veredicto, no cuando la media sale bien.

Cómo se falsea

Ejecutar una sola vez e informar de la puntuación. Un número de una sola ejecución contiene la respuesta de esta métrica y la esconde.

Se lee enACM-11

HSC-08

Tasa de recuperación

percentMejor cuando es mayor

De las ejecuciones que sufrieron un fallo —error de herramienta, negativa, tiempo agotado, plan rechazado—, la proporción que aun así llega a un resultado verificado.

Cómo se mide

El fallo tiene que ser visible en la traza para poder contarlo, así que esto no se calcula sin traza correlacionada. No haber fallado nunca no es recuperarse y no debe contarse como tal.

Cómo se falsea

Silenciar los fallos en lugar de recuperarse de ellos. Un bucle de reintentos que se traga un error de herramienta sube este número y la brecha de verificación a la vez.

Se lee enACM-10

HSC-09

Ratio de contención

percentMejor cuando es mayor

La proporción de las acciones del harness que escriben, son irreversibles o están reguladas y que están detrás de un control a la vez de prealimentación y determinista.

Cómo se mide

Lista las acciones a partir del catálogo de herramientas, nombra el control que detiene cada una y lee los dos ejes de ese control en la Matriz de Control Agéntico. Las compuertas que decide un criterio no cuentan aquí: esas las cuenta la tasa de intervención humana.

Cómo se falsea

Reclasificar acciones como reversibles. El ratio sube y el radio de impacto no se mueve.

Se lee enACM-01ACM-03ACM-17

Evidencia

HSC-10

Reconstruibilidad

percentMejor cuando es mayor

De una muestra aleatoria de ejecuciones pasadas, la proporción que puede reconstruirse de principio a fin solo con el registro: entradas, modelo, llamadas a herramientas, resultado.

Cómo se mide

Muestrea ejecuciones que no eligió nadie y reconstrúyelas sin preguntar al equipo y sin el operador original delante. Una ejecución que necesita que alguien la explique no ha pasado.

Cómo se falsea

Muestrear las ejecuciones que ya se sabe que están limpias, o registrarlo todo, secretos incluidos. Esto se lee junto a si el registro guarda datos que nunca necesitó.

Se lee enACM-10

HSC-11

Tasa de captura de regresiones

percentMejor cuando es mayor

De los defectos plantados a propósito en el sistema, la proporción que la suite de evaluación detecta antes de publicar.

Cómo se mide

Planta los tipos de defecto que de verdad temes, de uno en uno, y ejecuta la suite con cada uno. Una suite a la que nadie ha visto fallar tiene una tasa de captura desconocida, no perfecta.

Cómo se falsea

Plantar los defectos a partir de los cuales se escribió la suite. La tasa sube al 100 % y no mide más que la memoria de quien la escribió.

Se lee enACM-11

Qué tiene que declarar un resultado

Un número sin esto no es comparable con otro número. HarnessBench informa de los seis o no informa de nada.

  • modelEl modelo y su versión exacta
  • task_setEl conjunto de tareas y de dónde salió
  • verifierEl verificador y por qué es independiente del agente
  • repeatsCuántas veces se ejecutó el conjunto
  • dateLa fecha en que se ejecutó
  • cost_basisQué incluye la cifra de coste, tiempo humano incluido