GobernanzaActualizado 2026-08-22 · Versión 1.0

¿Qué es un Modelo de Amenazas Agéntico?

Un modelo de amenazas agéntico es el mapa de cómo se puede atacar a un agente autónomo: no a través de sus pesos, sino de todo lo que lee, recuerda, invoca y tiene permitido hacer. Nombra las superficies —inyección de prompts directa e indirecta, envenenamiento de herramientas, exceso de agencia, envenenamiento de memoria, cadena de suministro, canales de exfiltración, diputado confundido— para que cada una tenga un control en el arnés en lugar de una esperanza en el system prompt.

Evidencia: Observación del sectorConfianza: AltaFuente: Observación del sectorFuente: PaperFuente: Experiencia personal

Definición

Un modelo de amenazas agéntico es la enumeración estructurada de las superficies de ataque, objetivos del adversario y rutas de abuso propias de un agente de IA —sus entradas, su contexto, su memoria, sus herramientas, sus credenciales y su autonomía— que sirve para decidir qué controles del arnés son obligatorios antes de dar al agente acceso a producción.

Puntos clave

  • Modela las amenazas sobre las acciones del agente, no sobre las salidas del modelo.
  • Cada entrada que el agente lee es un canal de instrucciones: documentos, páginas, resultados de herramientas, otros agentes.
  • Cada herramienta que el agente puede invocar es una capacidad que el atacante hereda en cuanto una inyección tiene éxito.
  • La memoria convierte un ataque puntual en un ataque persistente.
  • El radio de impacto lo fijan las credenciales y la salida de datos, no el prompt.
  • Una superficie sin nombrar no es una superficie ausente: escribe los riesgos aceptados de forma explícita.

Contexto

El modelado de amenazas clásico pregunta qué puede enviarte un atacante. Con agentes la pregunta difícil es qué va a leer tu sistema por iniciativa propia y tratar como instrucciones. Un agente que descarga una página, abre un ticket o lee el resultado de una herramienta ha ampliado su frontera de confianza sin que nadie lo decidiera.

El segundo cambio es la agencia. Un chatbot engañado produce una frase incorrecta; un agente engañado hace una llamada, mueve dinero, borra una rama o envía un fichero por correo. La gravedad de un ataque con éxito la fijan las herramientas y credenciales del agente: por eso los permisos son una decisión de seguridad y no de comodidad.

Hay marcos que anclan el ejercicio: el OWASP Top 10 para aplicaciones LLM nombra las clases de vulnerabilidad y MITRE ATLAS cataloga tácticas de adversario observadas contra sistemas de IA. Úsalos como listas de comprobación sobre tu arquitectura, no como sustituto de tenerla.

Arquitectura

Inyección directa de prompts: la persona que habla con el agente intenta anular sus instrucciones. Es lo más barato de intentar y lo más fácil de acotar, porque ese usuario ya está dentro de los permisos que le da la sesión.

Inyección indirecta de prompts: instrucciones escondidas en contenido que el agente recupera —una página web, un PDF, el comentario de un ticket, un correo, un fichero de código, la salida de otro agente—. El atacante nunca habla con tu agente; planta el texto donde lo va a leer.

Envenenamiento de herramientas: una herramienta cuya descripción o resultado es en sí mismo adversarial. Un servidor puede describir una herramienta inocua en el momento de la aprobación y cambiarla después: la confianza se comprueba una vez y se ejerce para siempre.

Exceso de agencia: el agente tiene permisos más amplios de los que requiere cualquier tarea concreta. Todavía no ha pasado nada; la superficie es que un agente secuestrado hereda al instante todo lo que el arnés estuvo dispuesto a conceder.

Envenenamiento de memoria: hechos o instrucciones falsas escritas en memoria persistente o en un almacén vectorial, de modo que el ataque sobrevive a la sesión y se vuelve a disparar en tareas futuras sin relación.

Cadena de suministro: modelos, system prompts, servidores MCP, paquetes y datasets traídos de fuera de la organización. Una dependencia que puede reescribir la descripción de una herramienta es una dependencia que puede reescribir el comportamiento del agente.

Canales de exfiltración: cualquier vía por la que pueden salir bytes —una descarga saliente, la URL de una imagen renderizada en la respuesta, una herramienta de correo o webhook, un commit—. Los datos no necesitan que un humano los lea para estar robados; basta una URL.

Diputado confundido: el agente actúa con credenciales que quien lo invoca no tiene, así que un atacante que no puede llegar a un sistema directamente le pide al agente que llegue por él.

Componentes

Inventario de activos: los datos, sistemas y credenciales que el agente puede tocar, listados por el alcance del agente y no por el organigrama del equipo.Fronteras de confianza: qué entradas son instrucciones, cuáles son datos y dónde se aplica esa línea en el código y no en la prosa.Catálogo de herramientas con permisos: cada herramienta, su alcance, si escribe y qué gana un atacante al invocarla.Mapa de salida de datos: todas las formas en que pueden salir bytes, incluidas las accidentales —previsualizaciones de enlaces, imágenes renderizadas, envío de logs, reporte de errores—.Objetivos del adversario: exfiltrar, escalar, persistir, interrumpir, engañar; cada uno mapeado sobre las superficies anteriores.Controles con responsable: qué componente del arnés acota cada ruta y quién lo mantiene.Riesgos aceptados: rutas que se dejan abiertas a propósito, con el motivo y la detección compensatoria.Casos de prueba: para cada superficie, el intento de inyección o abuso que demuestra que el control funciona. Un control que nunca se ha visto fallar es un control que nunca se ha verificado.

Beneficios

  • Convierte «¿es seguro nuestro agente?» en una lista finita de superficies, cada una con responsable y control.
  • Hace explícitas y revisables las decisiones de permisos antes de conceder acceso a producción.
  • Da al equipo de red team una lista de objetivos y a las suites de evaluación casos concretos que automatizar.
  • Envejece bien: los modelos cambian a menudo, las superficies cambian despacio, así que el mapa sobrevive al siguiente cambio de modelo.

Riesgos

  • Modelar el chatbot y no el agente: enumerar daños de salida ignorando las herramientas que los convierten en acciones.
  • Tratar el modelo como punto de control. El alineamiento reduce los intentos; no acota las consecuencias.
  • Un documento escrito una vez y nunca revisado. Cada herramienta nueva es una superficie nueva, así que el modelo forma parte del proceso de cambio.
  • Confundir cobertura con defensa: nombrar una superficie no es controlarla, y un control sin probar es una afirmación.

Herramientas y tecnologías

OWASP Top 10 para aplicaciones LLM: vocabulario común para las clases de vulnerabilidad.MITRE ATLAS: tácticas y técnicas de adversario observadas contra sistemas de IA.NIST AI RMF: el marco de gobierno en el que encaja el mapa (Govern, Map, Measure, Manage).Trazas de agente y logs de auditoría: la capa de evidencia; sin ellos el modelo es infalsable.Suites de red team automatizadas: corpus de inyección ejecutados en CI para que las regresiones aparezcan antes del despliegue.Motores de política y de permisos: donde realmente se aplican las conclusiones del modelo.

Ejemplos

  • Un agente de soporte que lee correo de clientes: el cuerpo del mensaje es entrada de instrucciones no confiable, la herramienta de CRM es la capacidad y el canal de respuesta es la vía de exfiltración. Tres superficies de una sola funcionalidad.
  • Un agente de programación con escritura en el repositorio y salida a red: inyección por el README de una dependencia, capacidad por la herramienta de commit, exfiltración por cualquier registro al que pueda llegar.
  • Un agente de recuperación sobre una wiki interna: cualquiera que pueda editar una página puede escribir instrucciones que el agente leerá, lo que convierte a un editor interno de bajo privilegio en vector de inyección.

FAQs

¿En qué se diferencia de un modelo de amenazas normal?
El método es el mismo; las superficies son nuevas. Los modelos clásicos asumen que el código ejecuta instrucciones y los datos no. Con un agente, los datos son instrucciones: la recuperación, la memoria y los resultados de herramientas se convierten en canales de entrada al alcance del atacante.
¿Necesito uno si mi agente es de solo lectura?
Sí, uno más pequeño. Un agente de solo lectura sigue teniendo superficie de exfiltración —todo lo que puede leer se le puede hacer repetir— y «solo lectura» es una propiedad que hay que aplicar en la capa de herramientas, no suponer desde el prompt.
¿Por dónde empiezo si no tengo nada escrito?
Lista las herramientas que el agente puede invocar y los datos a los que llega cada una. Esa única tabla produce casi todo el mapa: las capacidades son el radio de impacto y las entradas que pueden alcanzarlas son las rutas de ataque.
¿Cada cuánto hay que revisarlo?
Siempre que cambie una herramienta, una fuente de datos o un nivel de autonomía: esos son los eventos que crean superficies. Las actualizaciones de modelo importan menos de lo que se cree; cambian la probabilidad, no el alcance.

Referencias