GovernançaAtualizado 2026-08-22 · Versão 1.0

O que é um Modelo de Ameaças Agêntico?

Um modelo de ameaças agêntico é o mapa de como um agente autônomo pode ser atacado: não pelos seus pesos, mas por tudo o que ele lê, memoriza, invoca e tem permissão para fazer. Ele nomeia as superfícies — injeção de prompts direta e indireta, envenenamento de ferramentas, excesso de agência, envenenamento de memória, cadeia de suprimentos, canais de exfiltração, deputado confuso — para que cada uma tenha um controle no harness em vez de uma esperança no system prompt.

Evidência: Observação do setorConfiança: AltaFonte: Observação do setorFonte: PaperFonte: Experiência pessoal

Definição

Um modelo de ameaças agêntico é a enumeração estruturada das superfícies de ataque, objetivos do adversário e caminhos de abuso próprios de um agente de IA — suas entradas, seu contexto, sua memória, suas ferramentas, suas credenciais e sua autonomia — usada para decidir quais controles do harness são obrigatórios antes de dar ao agente acesso à produção.

Pontos-chave

  • Modele as ameaças sobre as ações do agente, não sobre as saídas do modelo.
  • Toda entrada que o agente lê é um canal de instruções: documentos, páginas, resultados de ferramentas, outros agentes.
  • Toda ferramenta que o agente pode invocar é uma capacidade que o atacante herda assim que uma injeção tem êxito.
  • A memória transforma um ataque pontual em um ataque persistente.
  • O raio de impacto é definido pelas credenciais e pela saída de dados, não pelo prompt.
  • Uma superfície não nomeada não é uma superfície ausente: escreva os riscos aceitos de forma explícita.

Contexto

A modelagem de ameaças clássica pergunta o que um atacante pode enviar ao seu sistema. Com agentes, a pergunta difícil é o que o seu sistema vai ler por iniciativa própria e tratar como instruções. Um agente que baixa uma página, abre um chamado ou lê o resultado de uma ferramenta ampliou sua fronteira de confiança sem que ninguém decidisse isso.

A segunda mudança é a agência. Um chatbot enganado produz uma frase errada; um agente enganado faz uma chamada, movimenta dinheiro, apaga um branch ou envia um arquivo por e-mail. A gravidade de um ataque bem-sucedido é definida pelas ferramentas e credenciais do agente — por isso permissionamento é uma decisão de segurança, não de conveniência.

Existem frameworks que ancoram o exercício: o OWASP Top 10 para aplicações LLM nomeia as classes de vulnerabilidade e o MITRE ATLAS cataloga táticas de adversário observadas contra sistemas de IA. Use-os como listas de verificação sobre a sua arquitetura, não como substituto de tê-la.

Arquitetura

Injeção direta de prompts: a pessoa que fala com o agente tenta anular suas instruções. É o mais barato de tentar e o mais fácil de limitar, porque esse usuário já está dentro das permissões que a sessão concede.

Injeção indireta de prompts: instruções escondidas em conteúdo que o agente recupera — uma página web, um PDF, o comentário de um chamado, um e-mail, um arquivo de código, a saída de outro agente. O atacante nunca fala com o seu agente; ele planta o texto onde o agente vai ler.

Envenenamento de ferramentas: uma ferramenta cuja descrição ou resultado é em si adversarial. Um servidor pode descrever uma ferramenta inofensiva no momento da aprovação e alterá-la depois: a confiança é verificada uma vez e exercida para sempre.

Excesso de agência: o agente detém permissões mais amplas do que qualquer tarefa concreta exige. Ainda não aconteceu nada; a superfície é que um agente sequestrado herda instantaneamente tudo o que o harness se dispôs a conceder.

Envenenamento de memória: fatos ou instruções falsas gravadas em memória persistente ou em um banco vetorial, de modo que o ataque sobrevive à sessão e volta a disparar em tarefas futuras e não relacionadas.

Cadeia de suprimentos: modelos, system prompts, servidores MCP, pacotes e datasets trazidos de fora da organização. Uma dependência que pode reescrever a descrição de uma ferramenta é uma dependência que pode reescrever o comportamento do agente.

Canais de exfiltração: qualquer caminho pelo qual bytes possam sair — uma requisição de saída, a URL de uma imagem renderizada na resposta, uma ferramenta de e-mail ou webhook, um commit. Os dados não precisam ser lidos por um humano para estarem roubados; basta uma URL.

Deputado confuso: o agente age com credenciais que quem o invoca não tem, então um atacante que não consegue alcançar um sistema diretamente pede ao agente que o alcance por ele.

Componentes

Inventário de ativos: os dados, sistemas e credenciais que o agente pode tocar, listados pelo alcance do agente e não pelo organograma do time.Fronteiras de confiança: quais entradas são instruções, quais são dados e onde essa linha é aplicada no código e não na prosa.Catálogo de ferramentas com permissões: cada ferramenta, seu escopo, se escreve e o que um atacante ganha ao invocá-la.Mapa de saída de dados: todas as formas pelas quais bytes podem sair, inclusive as acidentais — pré-visualizações de links, imagens renderizadas, envio de logs, relatórios de erro.Objetivos do adversário: exfiltrar, escalar, persistir, interromper, enganar; cada um mapeado sobre as superfícies acima.Controles com responsável: qual componente do harness limita cada caminho e quem o mantém.Riscos aceitos: caminhos deixados abertos de propósito, com o motivo e a detecção compensatória.Casos de teste: para cada superfície, a tentativa de injeção ou abuso que prova que o controle funciona. Um controle que nunca foi visto falhando é um controle que nunca foi verificado.

Benefícios

  • Converte «o nosso agente é seguro?» em uma lista finita de superfícies, cada uma com responsável e controle.
  • Torna as decisões de permissão explícitas e revisáveis antes de conceder acesso à produção.
  • Dá ao red team uma lista de alvos e às suítes de avaliação casos concretos para automatizar.
  • Envelhece bem: modelos mudam com frequência, superfícies mudam devagar, então o mapa sobrevive à próxima troca de modelo.

Riscos

  • Modelar o chatbot e não o agente: enumerar danos de saída ignorando as ferramentas que os transformam em ações.
  • Tratar o modelo como ponto de controle. O alinhamento reduz as tentativas; não limita as consequências.
  • Um documento escrito uma vez e nunca revisitado. Cada ferramenta nova é uma superfície nova, então o modelo faz parte do processo de mudança.
  • Confundir cobertura com defesa: nomear uma superfície não é controlá-la, e um controle não testado é uma afirmação.

Ferramentas e tecnologias

OWASP Top 10 para aplicações LLM: vocabulário comum para as classes de vulnerabilidade.MITRE ATLAS: táticas e técnicas de adversário observadas contra sistemas de IA.NIST AI RMF: o marco de governança em que o mapa se encaixa (Govern, Map, Measure, Manage).Traces de agente e logs de auditoria: a camada de evidência; sem eles o modelo é infalsificável.Suítes de red team automatizadas: corpora de injeção executados em CI para que regressões apareçam antes do lançamento.Motores de política e de permissão: onde as conclusões do modelo são de fato aplicadas.

Exemplos

  • Um agente de suporte que lê e-mails de clientes: o corpo da mensagem é entrada de instruções não confiável, a ferramenta de CRM é a capacidade e o canal de resposta é a via de exfiltração. Três superfícies em uma única funcionalidade.
  • Um agente de programação com escrita no repositório e saída de rede: injeção pelo README de uma dependência, capacidade pela ferramenta de commit, exfiltração por qualquer registro que ele consiga alcançar.
  • Um agente de recuperação sobre uma wiki interna: qualquer pessoa que possa editar uma página pode escrever instruções que o agente vai ler, o que transforma um editor interno de baixo privilégio em vetor de injeção.

FAQs

Em que isso difere de um modelo de ameaças normal?
O método é o mesmo; as superfícies são novas. Os modelos clássicos assumem que o código executa instruções e os dados não. Com um agente, os dados são instruções: recuperação, memória e resultados de ferramentas viram canais de entrada ao alcance do atacante.
Preciso de um se o meu agente é somente leitura?
Sim, um menor. Um agente somente leitura ainda tem superfície de exfiltração — tudo o que ele pode ler pode ser levado a repetir — e «somente leitura» é uma propriedade que precisa ser aplicada na camada de ferramentas, não presumida a partir do prompt.
Por onde começo se não tenho nada escrito?
Liste as ferramentas que o agente pode invocar e os dados que cada uma alcança. Essa única tabela produz quase todo o mapa: as capacidades são o raio de impacto e as entradas que conseguem alcançá-las são os caminhos de ataque.
Com que frequência deve ser revisitado?
Sempre que uma ferramenta, uma fonte de dados ou um nível de autonomia mudar — esses são os eventos que criam superfícies. Atualizações de modelo importam menos do que se imagina; mudam a probabilidade, não o alcance.

Referências