模式更新于 2026-06-21 · 版本 1.0

什么是企业级 RAG?

企业级 RAG(检索增强生成)是一种在查询时检索组织自身的文档,并以此作为模型回答依据的模式,而不是依赖模型的参数化记忆。它允许企业在不重新训练模型的情况下,使用私有、最新且受治理的知识(如政策、手册、工单、合同),同时保持企业所需的访问控制、引用和可审计性。

证据: 基准测试置信度: 来源: 基准测试来源: 论文来源: 行业观察

定义

企业级 RAG 是一种从组织受治理的知识源中检索相关段落,并将其作为上下文提供给模型的模式,从而使回答有据可依、保持最新且可引用。

核心要点

  • RAG 以检索到的文档作为回答依据,从而减少幻觉。
  • 它无需重新训练即可使用私有且最新的知识。
  • 检索质量(分块 + Embedding)决定了回答质量。
  • 企业级 RAG 增加了访问控制、引用和审计功能。
  • 当系统决定何时检索以及检索什么内容时,它就具备了智能体特征。

背景

基础模型只知道它在训练期间学到的知识。而企业知识是私有的、动态变化的且受访问控制的。RAG 通过在查询时获取正确的段落并以此作为回答的依据,弥合了这一差距。

企业级的区别在于治理:谁被允许查看哪些文档、回答的来源出自哪里,以及整个交互过程是否可以被审计。忽略这些要素的 RAG 只是原型,而非生产系统。

架构

摄取:对文档进行解析,拆分为自包含的分块,进行 Embedding 并存储在向量索引中(通常与关键词搜索并存)。检索:对查询进行 Embedding,获取最接近的分块,并可选择进行重排和权限过滤。生成:模型使用这些分块进行回答并进行引用。

质量取决于那些看似不起眼的部分:干净的解析、合理的分块、混合(向量 + 关键词)检索、重排以及权限过滤。结构良好的源内容会让这些步骤中的每一步都变得更加轻松。

组件

摄取与分块Embeddings向量 / 混合索引检索器与重排器权限过滤器生成器(LLM)引用层

优势

  • 有据可依、可引用且最新的回答。
  • 无需重新训练即可使用私有知识。
  • 遵循访问控制和可审计性。
  • 比微调更便宜、更新更快。

风险

  • 糟糕的分块或检索会导致错误或不相关的上下文。
  • 陈旧或未授权的数据泄露到回答中。
  • 如果不进行验证,引用内容可能看似合理但实际上缺乏支持。
  • 大规模情况下的检索延迟和成本。

工具与技术

向量数据库(例如 pgvector、Pinecone、Vertex AI Vector Search)Embedding 模型重排器混合搜索引擎MCP 资源服务器

示例

  • 一个通过引用段落来回答人力资源(HR)政策问题的内部助手。
  • 一个通过检索产品文档来解决工单的支持智能体。
  • 一个提供相关条款及来源链接的法律助手。

常见问题解答

RAG 比微调更好吗?
它们解决不同的问题。RAG 在查询时注入新鲜且受治理的知识;微调则用于调整行为或风格。它们通常结合使用。
为什么分块如此重要?
检索是基于分块进行的。内容自包含、结构良好的分块能实现干净的检索;而碎片化的分块则会返回噪音。分块质量在很大程度上决定了 RAG 的质量。
是什么让 RAG 达到企业级水平?
检索上的访问控制、来源引用、可审计性、新鲜度以及评估——而不仅仅是一个向量存储加上一个模型。
RAG 何时会具有智能体特征?
当检索成为多步循环中的一个步骤,且系统能够自主决定是否检索、何时检索以及检索什么,而不是总是只进行一次固定检索时。

参考文献