Qu'est-ce que le RAG d'entreprise ?
Le RAG d'entreprise (génération augmentée de récupération) est le modèle consistant à ancrer les réponses d'un modèle dans les propres documents d'une organisation, récupérés au moment de la requête, plutôt que de s'appuyer sur la mémoire paramétrique du modèle. Il permet à une entreprise d'utiliser des connaissances privées, actuelles et gouvernées — politiques, manuels, tickets, contrats — sans réentraîner le modèle, tout en conservant le contrôle d'accès, les citations et l'auditabilité requis par les entreprises.
Définition
Le RAG d'entreprise est un modèle qui récupère des passages pertinents à partir des sources de connaissances gouvernées d'une organisation et les fournit à un modèle en tant que contexte, afin que les réponses soient ancrées, actuelles et citables.
Points clés
- Le RAG ancre les réponses dans les documents récupérés, réduisant ainsi les hallucinations.
- Il utilise des connaissances privées et récentes sans réentraînement.
- La qualité de la récupération (découpage + embeddings) détermine la qualité des réponses.
- Le RAG de classe entreprise ajoute le contrôle d'accès, les citations et l'audit.
- Devient agentique lorsque le système décide quand et quoi récupérer.
Contexte
Un modèle de base ne sait que ce qu'il a appris lors de son entraînement. Les connaissances de l'entreprise sont privées, évolutives et soumises à un contrôle d'accès. Le RAG comble cet écart en récupérant les bons passages au moment de la requête et en y ancrant la réponse.
La différence pour l'entreprise réside dans la gouvernance : qui est autorisé à voir quels documents, d'où proviennent les sources de la réponse et si l'ensemble de l'interaction peut être audité. Un RAG qui ignore ces aspects est un prototype, pas un système de production.
Architecture
Ingestion : les documents sont analysés, découpés en blocs autonomes, convertis en embeddings et stockés dans un index vectoriel (souvent combiné à une recherche par mots-clés). Récupération : la requête est convertie en embedding, les blocs les plus proches sont récupérés, éventuellement re-classés et filtrés selon les autorisations. Génération : le modèle répond à l'aide de ces blocs et les cite.
La qualité repose sur des aspects moins prestigieux : une analyse propre, un découpage cohérent, une récupération hybride (vectorielle + mots-clés), un re-classement et un filtrage des autorisations. Un contenu source bien structuré facilite chacune de ces étapes.
Composants
Avantages
- Réponses ancrées, citables et à jour.
- Utilise des connaissances privées sans réentraînement.
- Respecte le contrôle d'accès et l'auditabilité.
- Plus économique et plus rapide à mettre à jour que le fine-tuning.
Risques
- Un mauvais découpage (chunking) ou une mauvaise récupération produit un contexte erroné ou non pertinent.
- Des données obsolètes ou sans autorisation s'infiltrent dans les réponses.
- Les citations peuvent être plausibles mais non étayées si elles ne sont pas vérifiées.
- Latence de récupération et coût à grande échelle.
Outils et technologies
Exemples
- Un assistant interne répondant aux questions sur les politiques RH avec des passages cités.
- Un agent de support récupérant la documentation produit pour résoudre des tickets.
- Un assistant juridique faisant ressortir les clauses pertinentes avec des liens vers les sources.
FAQ
- Le RAG est-il meilleur que le fine-tuning ?
- Ils résolvent des problèmes différents. Le RAG injecte des connaissances fraîches et gouvernées au moment de la requête ; le fine-tuning adapte le comportement ou le style. Ils sont souvent combinés.
- Pourquoi le découpage (chunking) est-il si important ?
- La récupération fonctionne sur des fragments (chunks). Des fragments autonomes et bien structurés sont récupérés proprement ; les fragments fragmentés renvoient du bruit. La qualité du découpage détermine en grande partie la qualité du RAG.
- Qu'est-ce qui rend le RAG de niveau entreprise ?
- Le contrôle d'accès lors de la récupération, les citations de sources, l'auditabilité, la fraîcheur et l'évaluation — et pas seulement un stockage vectoriel associé à un modèle.
- Quand le RAG devient-il agentique ?
- Lorsque la récupération est une étape dans une boucle multi-étapes où le système décide si, quand et quoi récupérer, plutôt que de toujours effectuer une récupération unique.