企业 AI 实施指南

企业知识库与 RAG 怎么建设:从资料治理到可引用回答

说明企业知识库项目中资料治理、切分检索、权限过滤、引用展示和效果评估之间的关系。

直接回答

企业知识库为什么不能只把文档上传给大模型?

因为生产系统还要解决资料是否有效、谁有权查看、如何找到正确片段、回答能否给出来源,以及答错时如何拒答和复核。RAG 是检索与生成的组合,不是对资料质量和业务规则的替代。
01

先治理资料,再讨论模型

制度、产品手册、项目文档和客服话术往往存在重复版本、过期内容和权限差异。第一步应确定资料负责人、有效版本、更新时间和适用范围。

如果来源本身相互冲突,模型即使检索到内容,也无法稳定判断哪一份才是正式依据。

  • 按部门、业务和保密级别建立资料目录
  • 保留版本、发布日期、失效日期和负责人
  • 删除扫描噪声、重复页眉和无意义附件
02

检索质量决定回答上限

切分长度、标题层级、表格处理、关键词与向量检索组合都会影响召回结果。不能只凭几个演示问题判断效果,应使用真实业务问题建立评估集。

评估不仅看回答是否流畅,还要分别检查正确来源是否被召回、关键事实是否一致、引用是否可打开,以及无依据问题能否拒答。

03

权限必须在检索前生效

企业知识库不能先检索全部资料,再要求模型不要泄露。用户身份、部门、项目和数据级权限应在检索阶段过滤,并记录访问与引用日志。

  • 公开资料、内部资料和敏感资料分层
  • 继承现有账号和组织权限
  • 对导出、分享和高风险回答增加确认

立项前检查清单

  1. 1

    是否明确首批用户和高频问题

  2. 2

    是否有可确认的正式资料版本

  3. 3

    是否能接入现有身份与权限

  4. 4

    是否准备真实问题与标准答案

  5. 5

    是否定义引用、拒答和人工升级规则

把检查清单用于真实项目

可以先评审流程、数据、接口与验收标准,再决定模型和技术路径。

沟通项目