RAG 企业知识库是怎么工作的(非技术人员版)
RAG 是让大模型基于企业自有资料回答问题的常用方法。本文不讲公式和代码,用「图书管理员」的比喻解释文档切分、向量检索、生成回答三个环节,以及影响效果的关键因素和常见误解。
很多企业想让员工或客户能够用自然语言提问,直接从公司内部的制度、产品资料、技术文档中得到答案。实现这个需求最常用的方法叫 RAG,全称是检索增强生成(Retrieval-Augmented Generation)。名字听起来很技术,但原理用一个比喻就能讲清楚。
一个比喻:图书管理员加写作助手
想象你有一位非常会写作、知识面很广的助手,但他从来没读过你们公司的内部资料。你问他「我们公司的差旅报销标准是多少」,他要么说不知道,要么凭常识编一个看起来合理的答案。这就是直接使用大模型的问题。
RAG 的做法是给这位助手配一位图书管理员。每次有人提问,图书管理员先去公司资料室里找出和问题最相关的几页资料,交给助手;助手读完这几页,再组织语言回答,并注明答案出自哪份文件。这样助手说的内容就有了依据。
所以 RAG 知识库由两部分组成:负责找资料的检索系统,负责读资料写回答的大模型。
第一步:把资料整理成可以检索的形式
在有人提问之前,系统需要先把企业资料准备好,这个过程通常包括:
- 收集文档:Word、PDF、Excel、网页、内部 Wiki 等;
- 提取文字:把文档中的文字、表格内容提取出来,扫描件需要先做文字识别;
- 切分:把长文档切成较短的片段,例如按章节或段落,每段保留所属文档和标题等信息;
- 向量化:用一种叫嵌入模型的工具,把每个片段转换成一串数字。这串数字代表片段的意思,意思相近的片段,数字也相近;
- 存储:把片段和对应的数字存入向量数据库,以备检索。
这一步决定了知识库的底子。切分太碎会丢失上下文,切分太长会混入无关信息;表格、流程图如果处理不好,里面的信息就检索不到。
第二步:根据问题找到相关片段
用户提问时,系统把问题也转换成一串数字,然后在向量数据库中找出意思最接近的若干片段。这种方式的好处是不依赖关键词完全一致,例如问「出差住酒店能报多少钱」,也能找到标题为「差旅费用管理办法」的片段。
实际项目中,检索往往不只用这一种方式,还会结合关键词检索、按部门或文档类型过滤、对候选结果重新排序等手段,以提高找得准的概率。
第三步:让大模型基于片段生成回答
系统把找到的片段和用户的问题一起交给大模型,并附上明确的要求:只根据提供的资料回答,资料里没有的就说不知道,并列出引用的来源。大模型据此生成一段通顺的回答。
由于回答附带了来源,使用者可以点开原文核对,这是 RAG 知识库比单纯聊天机器人更可信的原因之一。
影响效果的关键因素
- 资料质量:过时、矛盾、残缺的资料会直接导致错误回答,这一点比选用哪个模型更重要;
- 文档处理:复杂排版、表格、图片中的文字能否被正确提取;
- 检索质量:找不到正确的片段,再好的模型也答不对,很多答错的情况其实是检索环节出了问题;
- 权限控制:不同员工能看到的资料不同,检索时必须按权限过滤,避免越权看到敏感文件;
- 更新机制:资料更新后,知识库要能及时同步,删除的文件要从索引中移除;
- 问题范围:知识库擅长回答资料中有明确答案的问题,对于需要综合大量数据计算的问题,例如「上季度各区域销售对比」,更适合对接数据库或报表系统。
常见误解
- 「把资料丢进去就能用」。资料整理和持续维护是知识库项目中最花时间的部分。
- 「RAG 可以完全消除错误」。它能显著减少凭空编造,但检索失误或资料有歧义时仍可能出错,重要场景需要保留人工核对。
- 「需要训练自己的大模型」。大多数企业知识库场景不需要训练或微调模型,RAG 就能满足需求,成本也低得多。
- 「越大的模型效果越好」。在检索质量有保证的前提下,中等规模的模型往往已经够用,响应更快、成本更低。
企业启动知识库项目的建议
- 从一个边界清晰的场景开始,例如内部制度问答、产品技术支持、售后政策查询;
- 指定资料负责人,先把这一个场景的资料整理干净;
- 准备几十个真实问题及标准答案,作为验收和日常测试的依据;
- 考虑数据安全:资料是否可以发送到外部模型服务,还是需要私有化部署;
- 上线后收集「答不上来」和「答错了」的问题,持续补充资料。
关于部署方式,也值得多说一句。使用公有云上的大模型服务,启动快、维护少,但资料片段会随请求发送到模型服务商,需要评估合同条款和数据安全要求;私有化部署把模型和数据都放在企业自己的服务器上,数据不出内网,但需要承担硬件和运维成本,可选用的模型规模也受限于算力。很多企业会按资料的敏感程度分级处理:一般资料走云服务,敏感资料走私有部署。
RAG 的核心不是让模型更聪明,而是让模型在回答前先查资料。资料准、查得准,答案才会准。
大乐网络提供企业知识库的设计与开发,包括资料梳理建议、检索方案和权限设计,可以支持公有云模型服务和私有化部署两种方式。