Harness EngineeringMis à jour 2026-06-21 · Version 1.0

Qu'est-ce que les systèmes de mémoire d'agent ?

La mémoire d'agent désigne la manière dont un agent d'IA conserve et rappelle des informations au-delà d'une seule fenêtre de contexte — à travers les étapes, les sessions et les tâches. Elle sépare généralement la mémoire de travail à court terme (le contexte actuel) de la mémoire à long terme (des espaces de stockage durables dans lesquels l'agent lit et écrit). La mémoire est ce qui permet à un agent de conserver un état tout au long d'une tâche complexe, de se souvenir d'un utilisateur au fil du temps et d'éviter de répéter le même travail. C'est une couche fondamentale de la discipline Harness Engineering.

Preuve: Observation du secteurConfiance: ÉlevéSource: Observation du secteurSource: Publication scientifique

Définition

La mémoire d'agent est l'ensemble des mécanismes qu'un agent d'IA utilise pour stocker, organiser et récupérer des informations au-delà de sa fenêtre de contexte immédiate, englobant la mémoire de travail à court terme et la mémoire persistante à long terme.

Points clés

  • La mémoire permet à un agent de s'étendre au-delà d'une seule fenêtre de contexte finie.
  • La mémoire à court terme (de travail) et la mémoire à long terme (persistante) jouent des rôles différents.
  • La mémoire à long terme est souvent récupérée à la demande, à l'instar d'un RAG appliqué à l'historique propre de l'agent.
  • Une bonne mémoire évite la répétition des tâches et la perte d'état lors de travaux de longue durée.
  • Déterminer ce qu'il faut écrire, conserver et oublier relève d'une décision de conception, et non d'un processus automatique.

Contexte

La fenêtre de contexte d'un modèle étant finie, tout ce qu'un agent doit mémoriser au-delà de celle-ci nécessite un stockage externe. Sans mémoire, un agent oublie les étapes précédentes, répète des actions et ne peut pas personnaliser l'expérience d'une session à l'autre.

La mémoire transforme un modèle sans état (stateless) en un système doté d'une continuité. La difficulté réside dans la curation : décider de ce qui mérite d'être consigné, comment l'organiser et comment ne récupérer que ce qui est pertinent à l'instant T — un aspect étroitement lié au context engineering.

Architecture

Deux couches : la mémoire de travail (la fenêtre de contexte actuelle, contenant la tâche active) et la mémoire à long terme (stockages externes — vectoriels, clé-valeur, documents ou graphes — alimentés pendant une tâche et récupérés ultérieurement). Certaines architectures y ajoutent une mémoire épisodique (événements), sémantique (faits) et procédurale (compétences).

L'agent charge les souvenirs pertinents dans son contexte à chaque étape et en écrit de nouveaux au fil de son apprentissage. Des politiques de récupération, de résumé et d'oubli permettent de maintenir la mémoire utile plutôt qu'encombrante.

Composants

Mémoire de travailStockage à long terme (vectoriel/clé-valeur/graphe)Politique d'écriturePolitique de récupérationRésumé / consolidationOubli / expiration

Avantages

  • Continuité à travers les étapes, les sessions et les tâches.
  • Personnalisation persistante dans le temps.
  • Évite la répétition des tâches et la perte de contexte.
  • Permet de concevoir des agents avec état (stateful) sur de longs horizons.

Risques

  • Des souvenirs obsolètes ou erronés corrompent les réponses futures.
  • Obligations de confidentialité et de gouvernance sur les données stockées.
  • La récupération de souvenirs non pertinents ajoute du bruit.
  • Croissance illimitée en l'absence de consolidation ou d'expiration.

Outils et technologies

Bases de données vectoriellesStockages clé-valeur / de documentsGestionnaires de mémoire de type MemGPTFrameworks d'agents (LangGraph, SDK d'agents)

Exemples

  • Un assistant se souvenant des préférences d'un utilisateur d'une session à l'autre.
  • Un agent à exécution longue résumant sa progression pour ne jamais répéter une étape.
  • Un agent de support rappelant les anciens tickets d'un client lorsque c'est pertinent.

FAQ

En quoi la mémoire d'agent diffère-t-elle du RAG ?
Le RAG effectue des recherches dans une base de connaissances externe ; la mémoire d'agent récupère des informations à partir de l'état accumulé par l'agent lui-même. Le mécanisme de récupération est similaire, mais la source et le chemin d'écriture diffèrent.
Quelle est la différence entre la mémoire à court terme et la mémoire à long terme ?
La mémoire à court terme (de travail) est la fenêtre de contexte active pour la tâche en cours ; la mémoire à long terme est un stockage persistant dans lequel l'agent lit et écrit à travers les tâches et les sessions.
Pourquoi ne pas tout conserver dans la fenêtre de contexte ?
Les fenêtres sont finies et la qualité diminue à mesure qu'elles se remplissent. Externaliser l'état vers la mémoire et ne récupérer que ce qui est pertinent permet de garder l'agent concentré et d'optimiser les coûts.
Quelles sont les préoccupations en matière de gouvernance ?
La mémoire stockée peut contenir des données personnelles ou sensibles, elle nécessite donc un contrôle d'accès, des limites de conservation et la possibilité de corriger ou de supprimer des entrées.

Références