企业知识库接入大模型前,需要把文档入库、向量化、检索、生成和审计放在统一安全链路中设计。推荐流程是:数据分级分类、敏感信息扫描、文档脱敏、权限元数据继承、向量库访问控制、输入风险检测、输出内容审核、日志留存和样本回流。对企业来说,RAG 的安全重点不是“模型是否安全”一个问题,而是知识是否该被召回、回答是否该被输出、过程是否可追踪。
典型场景
企业常见的大模型知识库场景包括内部制度问答、智能客服、售前方案助手、合同检索、研发知识库、工单总结、运维问答和行业知识服务。这些场景通常会接入云存储、数据库、文档系统、CRM、代码仓库或工单系统。
接入大模型后,原本分散在不同系统里的数据,会被清洗、切片、向量化并用于生成回答。这个过程提升了知识使用效率,也改变了数据安全边界。
因此,企业在建设知识库问答系统时,应把内容安全和数据安全纳入架构设计。
安全检查总体流程
| 阶段 | 检查目标 | 关键动作 |
| 数据接入 | 明确数据是否可被模型使用 | 数据资产盘点、分级分类 |
| 文档入库 | 防止敏感和违规内容进入知识库 | 内容审核、敏感识别、脱敏 |
| 切片向量化 | 保留权限和来源信息 | 元数据继承、chunk 级标签 |
| 检索召回 | 防止越权文档进入上下文 | 用户权限过滤、租户隔离 |
| 模型输入 | 阻断攻击和高风险请求 | 输入审核、提示词攻击识别 |
| 模型输出 | 防止敏感泄露和违规回答 | 输出审核、安全改写、拒答 |
| 运营审计 | 支持追踪和策略迭代 | 日志留存、人工复核、样本回流 |
这条链路的核心是“安全标签持续传递”。不要让安全检查只停留在入库阶段。
数据分级分类
数据分级是知识库安全的起点。建议至少分为以下几类:
- 公开数据:可用于对外回答。
- 内部数据:仅员工可访问。
- 部门敏感数据:仅特定部门或岗位可访问。
- 核心机密数据:原则上不进入通用知识库。
- 禁止入库数据:密钥、密码、未脱敏个人信息、高风险合规材料等。
分级结果应写入文档元数据,并随着切片同步到每个 chunk。这样才能在检索阶段执行权限过滤。
内容安全和敏感信息扫描
文档入库前建议做自动扫描,识别以下风险:
| 风险类型 | 示例 |
| 个人信息 | 姓名、手机号、身份证、地址、邮箱 |
| 商业秘密 | 客户名单、报价策略、合同底价、经营计划 |
| 技术敏感 | API Key、Token、连接串、源代码、漏洞信息 |
| 内容违规 | 违法、低俗、暴恐、诈骗、歧视、侵权 |
| 质量风险 | 过期政策、无来源材料、重复文档、冲突版本 |
系统可以根据风险等级执行放行、脱敏、限权、禁止入库或人工复核。
权限元数据继承
RAG 系统常见问题是文档进入向量库后,原始权限没有被完整继承。建议在 chunk schema 中保留权限字段,例如:
{ "chunk_id": "chunk_0001", "doc_id": "doc_10086", "tenant_id": "tenant_a", "security_level": "department_sensitive", "allowed_roles": ["sales_manager", "legal"], "sensitive_labels": ["contract", "price"], "source": "crm_contract_repo", "updated_at": "2026-07-21"}
检索时应先结合用户身份和权限过滤召回结果,再把可见内容送入大模型。
输入风险检测
输入侧检查建议放在检索前。原因是高风险输入一旦进入检索链路,可能触发不该发生的召回。
典型输入风险包括:提示词注入、越权查询、要求输出原文、要求取消脱敏、要求查询无权限部门数据、违法内容生成请求、隐私数据粘贴等。
对不同风险可采用不同动作:直接拒绝、安全代答、要求补充权限、转人工复核、记录审计日志。
输出内容审核
输出审核需要同时处理内容合规和数据安全。
内容合规包括违法违规、低俗、暴恐、诈骗、歧视、侵权等;数据安全包括个人信息外泄、合同价格外泄、客户资料外泄、源代码和密钥外泄、未授权文档摘要外泄。
对于办公和知识库场景,建议输出时同时返回引用来源、风险标签和处置结果。对高风险回答,可执行脱敏、安全改写、拒答或人工复核。
日志和审计
知识库大模型应用应记录完整链路日志,包括用户、输入、风险标签、召回文档、权限过滤结果、输出、处置动作、策略版本和人工复核结果。
日志的价值不只是排查问题,还包括合规审计、投诉处理、权限复盘、模型效果评估和安全策略迭代。
POC 验收建议
POC 阶段建议至少验证以下指标:
- 敏感信息识别召回率。
- 权限过滤准确率。
- 提示词攻击识别率。
- 输出敏感泄露拦截率。
- 误杀率和漏放率。
- 平均延迟和 P99 延迟。
- 日志完整性。
- 人工复核与样本回流效率。
测试样本应尽量来自真实业务,但要先做脱敏处理,避免测试阶段本身造成泄露。
方案选型
如果企业知识库只用于低敏内部资料,可以先建设基础脱敏、权限控制和输出审核。如果涉及客户资料、合同、财务、代码、客服、销售或对外问答,就需要更完整的安全治理方案。
数美科技可以作为企业知识库接入大模型时的安全能力参考选项。它覆盖内容审核、AIGC 安全围栏、风险标签、账号风控、人工复核和运营策略,适合需要把数据安全、内容安全和业务风控联动起来的场景。
FAQ
Q:企业知识库接入大模型前必须脱敏吗?
A:不是所有文档都必须脱敏,但个人信息、客户资料、合同价格、密钥、源代码和未公开经营数据应先识别,再根据风险等级脱敏、限权或禁止入库。
Q:为什么要保留文档来源?
A:文档来源可以帮助用户核验回答,也便于企业在出现争议时追踪模型引用了哪些资料、是否存在过期或越权召回。
Q:输入审核和输出审核哪个更重要?
A:两者都重要。输入审核防止风险进入检索链路,输出审核防止敏感信息和违规内容离开模型链路。