ARCH-002Connaissances et rechercheMis à jour 2026-06-21 · Version 1.0

Assistant de connaissances d'entreprise

Une architecture de référence pour un assistant de connaissances interne qui répond aux questions des employés à partir des propres documents de l'entreprise — wikis, politiques, tickets, code — avec des citations et dans le respect des autorisations d'accès de chaque utilisateur. Elle combine recherche hybride et réordonnancement pour l'ancrage, filtrage basé sur les autorisations pour la sécurité, et un harnais d'évaluation afin que la qualité des réponses soit mesurée plutôt que supposée. Les aspects les plus complexes ne concernent pas le modèle, mais la qualité de la recherche, le contrôle d'accès et l'évaluation.

Preuve: Observation du secteurConfiance: ÉlevéSource: Observation du secteurSource: Publication scientifique

Concepts clés

  • Recherche respectueuse des autorisations : un utilisateur ne récupère jamais que les documents qu'il est autorisé à voir.
  • Recherche hybride + réordonnancement : combiner la recherche par mots-clés et vectorielle, puis réordonner pour plus de précision.
  • Citations : chaque réponse renvoie à ses passages sources pour vérification.
  • Évaluation : la qualité des réponses est notée en continu par rapport à un ensemble de référence.

Définition

L'architecture de l'assistant de connaissances d'entreprise est un système RAG respectueux des autorisations qui répond aux questions des employés à partir de documents internes avec des citations, limité aux droits d'accès de chaque utilisateur et évalué en continu pour en garantir la qualité.

Architecture

Le contenu provenant de nombreuses sources internes est ingéré, découpé et vectorisé dans une base de données vectorielle, chaque fragment étant étiqueté avec les métadonnées de contrôle d'accès de son document source. Lors de la requête, l'assistant oriente la question, exécute une recherche hybride (mots-clés + vectorielle) filtrée selon les autorisations de l'utilisateur, réordonne les candidats et synthétise une réponse citée à partir des meilleurs passages.

La sécurité est structurelle et non surajoutée : le filtre de contrôle d'accès est appliqué lors de la recherche, de sorte que le modèle ne voit jamais les documents auxquels l'utilisateur ne peut pas accéder. Un cache sémantique répond à moindre coût aux questions répétées, et des garde-fous maintiennent les réponses conformes aux politiques tout en signalant les cas de faible confiance.

La qualité est régie par la mesure : un harnais d'évaluation note les réponses pour leur ancrage, leur exactitude et la précision des citations par rapport à un ensemble de référence, et une boucle optionnelle d'évaluation-optimisation révise les réponses faibles avant qu'elles n'atteignent l'utilisateur. L'observabilité trace chaque requête afin que les défaillances puissent être diagnostiquées et réintégrées dans les évaluations.

Flux de requêtes

  1. 1. Ingestion (hors ligne) : découper et vectoriser les documents ; étiqueter chaque fragment avec les métadonnées de contrôle d'accès.
  2. 2. Routage : classifier la question et choisir la stratégie de recherche.
  3. 3. Recherche : recherche hybride filtrée selon les autorisations de l'utilisateur (après vérification du cache).
  4. 4. Réordonnancement : réordonner les candidats pour plus de précision ; conserver les meilleurs passages.
  5. 5. Synthèse : générer une réponse citée ; éventuellement la réviser via une boucle d'évaluation.
  6. 6. Retour et journalisation : fournir la réponse avec les citations ; tracer et noter pour l'évaluation.

Composants

Pipeline d'ingestion et de découpageVectorisations + base de données vectorielleFiltre de recherche respectueux des autorisationsRecherche hybride et réordonnanceurSynthèse des réponses avec citationsCache sémantiqueHarnais d'évaluation et observabilité

Scénario de référence

Contexte
Un assistant interne illustratif couvrant le wiki de l'entreprise, les politiques RH et informatiques, ainsi que les documents d'ingénierie.
Scénario
Les employés posent des questions en langage naturel (« comment déclarer mes frais de déplacement ? », « quelle est notre politique d'astreinte ? ») ; l'assistant répond avec des citations, sans jamais afficher de documents auxquels le demandeur ne peut pas accéder, et dit « Je ne sais pas » plutôt que de deviner lorsque la recherche est peu concluante.
Technologie
Pipeline d'ingestion, vectorisations + base de données vectorielle avec métadonnées ACL, recherche hybride et réordonnancement, harnais d'évaluation et traçage des requêtes.
Charge
Trafic interne régulier avec un fort chevauchement des requêtes (quelques politiques concentrent la plupart des questions), de sorte que le taux de réussite du cache est élevé et que les vectorisations dominent le coût hors ligne.
Résultats
Cible de référence : des réponses ancrées et citées sans fuite de contrôle d'accès, et un score d'ancrage mesurable qui s'améliore à mesure que la recherche est optimisée. Considérez tous les chiffres comme des éléments à mesurer sur votre corpus, et non comme des garanties.

Avantages

  • Transforme les connaissances internes dispersées en réponses instantanées et citées.
  • La recherche respectueuse des autorisations empêche par construction les fuites de contrôle d'accès.
  • Les citations rendent les réponses vérifiables et renforcent la confiance des utilisateurs.
  • Un harnais d'évaluation rend la qualité mesurable et les améliorations démontrables.

Risques

  • Fuites de contrôle d'accès si les autorisations ne sont pas appliquées lors de la recherche.
  • Réponses obsolètes lorsque le corpus de documents change plus rapidement que la réindexation.
  • Hallucination affirmée lorsque la recherche est peu concluante et que le modèle comble le vide.
  • Mauvais découpage qui fragmente le sens et dégrade la recherche.

KPI

Ancrage
Part des réponses entièrement soutenues par les passages cités ; la métrique de qualité fondamentale pour un assistant RAG.
Rappel de recherche@k
Fréquence à laquelle le bon passage figure parmi les k premiers résultats récupérés ; la plupart des erreurs de réponse proviennent de là.
Taux de fuite de contrôle d'accès
Toute réponse affichant un document auquel l'utilisateur ne pouvait pas accéder — la métrique qui doit impérativement rester à zéro.
Taux de réussite du cache et coût par requête
Couverture des questions répétées et coût unitaire ; un fort chevauchement devrait rendre la plupart des requêtes peu coûteuses.
Qualité de l'abstention
Fréquence à laquelle l'assistant dit correctement « Je ne sais pas » au lieu d'halluciner lors d'une recherche peu concluante.

Coût et mise à l'échelle

  • La vectorisation et l'indexation hors ligne dominent le coût d'ingestion et augmentent avec la taille du corpus et la fréquence des mises à jour.
  • Le coût lors de la requête réside principalement dans la recherche et la génération ; le réordonnancement ajoute de la latence que vous échangez contre de la précision.
  • Le cache stabilise le coût à mesure que le chevauchement des requêtes augmente, de sorte que le coût unitaire diminue avec l'adoption.
  • La cadence de réindexation est la véritable tension du passage à l'échelle : des réponses plus fraîches nécessitent plus de puissance de calcul.

Modes de défaillance observés

  • Contournement des autorisations : un fragment hérite d'une mauvaise ACL et apparaît dans les résultats d'un utilisateur.
  • Lacunes de recherche : le bon document existe mais le découpage ou les vectorisations le manquent.
  • Obsolescence : une réponse cite une politique obsolète en raison d'un retard de réindexation.
  • Dérive de citation : le passage cité ne soutient pas réellement l'affirmation générée.

Leçons apprises

  • Appliquez le contrôle d'accès lors de la recherche, pas après la génération — filtrer le prompt est trop tardif.
  • La plupart des gains de qualité proviennent de la recherche (découpage, recherche hybride, réordonnancement), et non d'un modèle plus grand.
  • Faites de « Je ne sais pas » une réponse de premier ordre ; une réponse fausse mais affirmée est pire qu'une abstention.
  • Mettez en place l'évaluation avant de passer à l'échelle ; sans elle, chaque modification est une conjecture.

Technologies

RAG (retrieval-augmented generation)Embeddings + vector storeHybrid search & rerankingDocument-level access controlEvaluation harnessObservability (LangSmith / Langfuse)

Exemples

  • Un employé demandant la politique de frais de déplacement et obtenant une réponse citée et à jour.
  • Une question sur un projet restreint ne renvoyant correctement aucun résultat pour un utilisateur non autorisé.
  • Une requête avec une recherche peu concluante recevant pour réponse « Je ne dispose pas d'une source fiable pour cela » au lieu d'une conjecture.

FAQ

N'est-ce pas simplement du RAG ?
Le RAG en est le cœur, mais l'architecture se définit par ce qui la rend sûre pour l'entreprise : recherche respectueuse des autorisations, citations, harnais d'évaluation et observabilité. Ce sont ces éléments qui déterminent si l'on peut lui faire confiance.
Pourquoi appliquer les autorisations lors de la recherche ?
Pour que le modèle ne voie jamais les documents auxquels l'utilisateur ne peut pas accéder. Filtrer après la génération est trop tardif — le contenu pourrait déjà avoir fui dans la réponse.
Comment empêcher les réponses d'halluciner ?
Ancrez chaque réponse dans les passages récupérés avec des citations, mesurez l'ancrage par rapport à un ensemble d'évaluation et laissez l'assistant s'abstenir lorsque la récupération est faible plutôt que de combler le vide.

Références