Modelo de madurez del harness

El modelo de madurez del harness

Siete niveles, de con prompts a adaptativo. Todo nivel por encima del suelo lleva criterios que se pasan o se fallan, porque un nivel descrito con adjetivos no sitúa a nadie. Es acumulativo: sostienes un nivel solo cuando pasa todo criterio de ese nivel y de los de debajo.

Versión 1.0 · Actualizado 2026-08-27 · 7 niveles · 18 criterios

JSONLegible por máquina

Cómo se lee

Acumulativo, no un menú. Un harness sostiene el nivel 4 cuando pasa todo lo de los niveles 1, 2, 3 y 4, no cuando tiene una suite de evaluación. Sin esa regla cada cual elige los peldaños que ya tiene y el modelo deja de situar a nadie.

Todo criterio es una acción con un resultado. Si no puedes ejecutarlo y obtener una respuesta, no pinta nada aquí. La redacción tiene a propósito la misma forma que las pruebas de la Matriz de Control: son la misma clase de cosa.

Cada nivel dice además qué sigue roto si te quedas ahí. Esa mitad es la honesta: los niveles no son virtudes, son concesiones que alguien hizo a sabiendas.

Esto es autoevaluado, que es la forma más débil de evaluación que existe. El modelo se publica para que se discutan los criterios, y el claim que lo sostiene declara qué falsaría el orden.

cumulativetheoreticallow

El claim en el que se apoya: HE-CLAIM-006se obtiene por MCP con get_claim.

Nivel 0

Con prompts

prompted

Una persona conduce cada ejecución. Al modelo se le llama a mano, los prompts viven en ventanas de chat y en las notas de alguien, y de una ejecución no sobrevive nada.

El suelo. No tiene criterios propios: aquí es donde está un harness cuando falla el nivel 1.

Qué sigue roto si te quedas aquí

Nada es repetible, así que nada se puede mejorar. Dos personas que piden lo mismo construyen dos sistemas distintos, y ninguna sabe decir por qué el suyo funciona.

Nivel 1

Con guion

scripted

Las llamadas están en código y los prompts son artefactos versionados. Una ejecución se reproduce desde el repositorio y no desde la memoria de alguien.

Criterios

  1. Coge una ejecución del mes pasado y reprodúcela. El prompt, el modelo y los parámetros salen todos del control de versiones.

    Se lee enACM-15

  2. Cambia un prompt. El cambio aparece como un diff con autor y fecha, y la versión anterior se sigue pudiendo recuperar.

    Se lee enACM-15

  3. Pregunta qué versión del modelo sirvió una ejecución concreta. La respuesta sale de un registro, no de una suposición sobre qué era lo vigente esa semana.

    Se lee enACM-10ACM-15

Qué sigue roto si te quedas aquí

El agente todavía no puede actuar sobre nada, así que su coste está acotado por su inutilidad. Quedarse aquí es una decisión defendible; llamar agente a lo que hay, no.

Nivel 2

Con herramientas

tooled

El agente actúa sobre sistemas reales a través de una superficie de herramientas declarada: todas listadas, acotadas, con responsable, y rechazadas del lado del servidor cuando se apuntan donde no deben.

Criterios

  1. Produce el catálogo de herramientas. Toda herramienta que el agente puede invocar está en él, con alcance escrito, si escribe y responsable con nombre.

    Se lee enACM-01

  2. Para cada herramienta, enseña su credencial y el alcance de esa credencial en el servidor. No hay dos herramientas que compartan una cuyo alcance exceda al de cualquiera de las dos.

    Se lee enACM-02

  3. Invoca una herramienta que escribe con un destino fuera de alcance. La rechaza la propia frontera de la herramienta, no el modelo negándose.

    Se lee enACM-03Se mide concontain

Qué sigue roto si te quedas aquí

El agente ya puede causar daño y todavía nada acota cuánto. Todo incidente a partir de aquí es un incidente en un sistema que importa.

Nivel 3

Acotado

bounded

El harness impone límites que no le pide al modelo que respete: la salida es denegar por defecto, el consumo lo topa el anfitrión y el contenido no confiable es dato y no instrucción.

Criterios

  1. Desde dentro del entorno del agente, pide un host que no está en la lista. Falla en la capa de red o de proxy y la denegación llega como señal de seguridad, no como un tiempo agotado.

    Se lee enACM-04ACM-05

  2. Ejecuta una tarea diseñada para no terminar. Un tope la detiene, la detención queda registrada y el coste del intento estaba acotado y era conocido antes de empezar.

    Se lee enACM-07

  3. Planta una instrucción dentro de un documento que el agente recupera. Puede leerla; no debe actuar sobre ella, y el intento queda visible después.

    Se lee enACM-12ACM-13

Qué sigue roto si te quedas aquí

El radio de impacto está acotado y la calidad no. El sistema falla de forma segura y nadie sabe decir si funciona.

Nivel 4

Evaluado

evaluated

El cambio pasa por una suite a la que alguien ha visto fallar. Las regresiones bloquean la publicación, la repetibilidad es un número y la brecha entre lo que el agente afirma y lo que encuentra un verificador está medida.

Criterios

  1. Introduce una regresión conocida. La suite la detecta y el cambio no se publica. Una suite a la que nadie ha visto fallar tiene una tasa de captura desconocida, no perfecta.

    Se lee enACM-11Se mide concatch

  2. Ejecuta el conjunto de evaluación cinco veces sin cambiar nada y di cuántos casos llegaron al mismo veredicto todas las veces. El número existe y alguien lo sabe.

    Se lee enACM-11Se mide condband

  3. Compara lo que el agente afirmó en un conjunto de ejecuciones con lo que encontró un verificador independiente. La diferencia es un número, y no se da por supuesto que sea cero.

    Se lee enACM-10ACM-11Se mide convgap

Qué sigue roto si te quedas aquí

La calidad está medida y la responsabilidad no. Cuando algo sale mal puedes demostrar que hubo regresión, pero no quién la dejó pasar.

Nivel 5

Gobernado

governed

La autoridad, la evidencia y el escalado tienen responsables. Una ejecución la puede reconstruir alguien que no estaba, las compuertas existen porque un criterio de riesgo las puso ahí y el modelo de amenazas es más joven que el catálogo de herramientas.

Criterios

  1. Coge una ejecución pasada al azar y reconstrúyela de principio a fin solo con el registro, sin el operador original delante. Después confirma que el registro no guarda ningún secreto que no necesitara.

    Se lee enACM-10Se mide conrecon

  2. Lista las acciones con compuerta y el criterio de riesgo que las puso ahí. Fuerza un escalado; llega a una persona con nombre dentro del tiempo declarado, con el contexto necesario para actuar.

    Se lee enACM-08ACM-09Se mide conhir

  3. Enseña el modelo de amenazas vigente y la fecha del último cambio en el catálogo de herramientas. Si el catálogo es más nuevo, este criterio falla y el nivel no se sostiene.

    Se lee enACM-18

Qué sigue roto si te quedas aquí

Está todo en su sitio y nada caduca. El harness seguirá imponiendo, el año que viene, las compensaciones que un modelo necesitaba el año pasado.

Nivel 6

Adaptativo

adaptive

El harness cambia con la evidencia, también quitándose a sí mismo. Los componentes llevan escrito contra qué modelo se validaron y la condición que los retiraría, y algo se ha retirado de verdad.

Criterios

  1. Nombra un control, una regla de prompt o un bloque de contexto retirado en los dos últimos trimestres, y enseña la medición que justificó retirarlo. «Lo probamos sin él y parecía ir bien» no es una medición.

    Se mide concvo

  2. Para un componente que sigue en su sitio, di contra qué modelo se validó y bajo qué condición se retiraría. Las dos cosas están escritas, no recordadas.

    Se lee enACM-15

  3. Enseña el coste por resultado correctamente verificado del mismo conjunto de tareas en dos generaciones de modelo, cada una con el harness que esa generación necesitaba de verdad.

    Se mide concvotvo

Qué sigue roto si te quedas aquí

Aquí nada es estable, y ese es el punto. Un harness que cambia con la evidencia necesita que la evidencia sea buena, y toda métrica de la scorecard la puede falsear quien está siendo medido con ella.