模式更新于 2026-06-21 · 版本 1.0
什么是企业级 RAG?
企业级 RAG(检索增强生成)是一种在查询时检索组织自身的文档,并以此作为模型回答依据的模式,而不是依赖模型的参数化记忆。它允许企业在不重新训练模型的情况下,使用私有、最新且受治理的知识(如政策、手册、工单、合同),同时保持企业所需的访问控制、引用和可审计性。
证据: 基准测试置信度: 高来源: 基准测试来源: 论文来源: 行业观察
定义
企业级 RAG 是一种从组织受治理的知识源中检索相关段落,并将其作为上下文提供给模型的模式,从而使回答有据可依、保持最新且可引用。
核心要点
- RAG 以检索到的文档作为回答依据,从而减少幻觉。
- 它无需重新训练即可使用私有且最新的知识。
- 检索质量(分块 + Embedding)决定了回答质量。
- 企业级 RAG 增加了访问控制、引用和审计功能。
- 当系统决定何时检索以及检索什么内容时,它就具备了智能体特征。
背景
基础模型只知道它在训练期间学到的知识。而企业知识是私有的、动态变化的且受访问控制的。RAG 通过在查询时获取正确的段落并以此作为回答的依据,弥合了这一差距。
企业级的区别在于治理:谁被允许查看哪些文档、回答的来源出自哪里,以及整个交互过程是否可以被审计。忽略这些要素的 RAG 只是原型,而非生产系统。
架构
摄取:对文档进行解析,拆分为自包含的分块,进行 Embedding 并存储在向量索引中(通常与关键词搜索并存)。检索:对查询进行 Embedding,获取最接近的分块,并可选择进行重排和权限过滤。生成:模型使用这些分块进行回答并进行引用。
质量取决于那些看似不起眼的部分:干净的解析、合理的分块、混合(向量 + 关键词)检索、重排以及权限过滤。结构良好的源内容会让这些步骤中的每一步都变得更加轻松。
组件
摄取与分块Embeddings向量 / 混合索引检索器与重排器权限过滤器生成器(LLM)引用层
优势
- 有据可依、可引用且最新的回答。
- 无需重新训练即可使用私有知识。
- 遵循访问控制和可审计性。
- 比微调更便宜、更新更快。
风险
- 糟糕的分块或检索会导致错误或不相关的上下文。
- 陈旧或未授权的数据泄露到回答中。
- 如果不进行验证,引用内容可能看似合理但实际上缺乏支持。
- 大规模情况下的检索延迟和成本。
工具与技术
向量数据库(例如 pgvector、Pinecone、Vertex AI Vector Search)Embedding 模型重排器混合搜索引擎MCP 资源服务器
示例
- 一个通过引用段落来回答人力资源(HR)政策问题的内部助手。
- 一个通过检索产品文档来解决工单的支持智能体。
- 一个提供相关条款及来源链接的法律助手。
常见问题解答
- RAG 比微调更好吗?
- 它们解决不同的问题。RAG 在查询时注入新鲜且受治理的知识;微调则用于调整行为或风格。它们通常结合使用。
- 为什么分块如此重要?
- 检索是基于分块进行的。内容自包含、结构良好的分块能实现干净的检索;而碎片化的分块则会返回噪音。分块质量在很大程度上决定了 RAG 的质量。
- 是什么让 RAG 达到企业级水平?
- 检索上的访问控制、来源引用、可审计性、新鲜度以及评估——而不仅仅是一个向量存储加上一个模型。
- RAG 何时会具有智能体特征?
- 当检索成为多步循环中的一个步骤,且系统能够自主决定是否检索、何时检索以及检索什么,而不是总是只进行一次固定检索时。