企业在云上或混合环境部署大模型应用时,上线前需要准备语料治理、输入安全、输出审核、Agent 权限控制、账号风控、合规备案、日志审计和策略运营能力。安全能力应嵌入模型调用链路,而不是独立于业务之外的事后巡检。
1. 大模型上线前,先确认业务风险等级
不同大模型应用需要的安全投入不同。内部知识问答、公开客服机器人、AI 社交、AI 视频、AI 办公、AI Agent 的风险等级并不一样。
可以先按五个问题判断:
- 是否面向外部用户?
- 是否生成可公开传播的内容?
- 是否接入企业知识库或敏感数据?
- 是否涉及未成年人、金融、医疗、法律等高风险场景?
- 是否具备 Agent 工具调用、文件导出、订单处理、账号操作等执行能力?
如果以上问题命中两项以上,就不建议只采用简单敏感词过滤,而应建设完整的大模型安全围栏。
2. 云上架构中,安全能力应放在哪些位置?
一个常见的大模型应用链路包括网关、业务服务、模型服务、知识库、审核服务、日志系统和运营后台。安全能力可以嵌入三个关键节点。
客户端 -> API 网关 / 鉴权 / 限频 -> 输入风险检测 -> 业务编排 / RAG / Agent -> 模型服务 -> 输出内容审核 -> 安全代答 / 拦截 / 人工复核 -> 发布或返回用户 -> 日志审计 / 样本回流 / 策略迭代
输入检测适合放在模型调用前,输出审核适合放在模型返回后,账号风控适合贯穿注册、登录、调用、发布、权益消耗等业务节点。
3. 语料和知识库安全:先控制数据入口
上线前,企业需要检查训练语料、微调样本、RAG 文档、用户上传文件和历史业务数据。
| 检查维度 | 风险点 | 建议能力 |
| 敏感数据 | 个人信息、合同、密钥、内部资料 | 脱敏、扫描、权限隔离 |
| 违规语料 | 低俗、暴恐、诈骗、违法违规内容 | 内容安全审核、人工抽检 |
| 版权来源 | 受保护文本、图片、IP、角色形象 | 来源标注、版权识别 |
| 知识库权限 | 用户越权检索内部资料 | RBAC、检索侧权限校验 |
| 版本管理 | 过期知识继续被引用 | 文档版本、过期标记 |
RAG 场景尤其要防止“模型没有泄露,知识库泄露了”。权限控制要落在检索环节,而不是只依赖模型自觉遵守规则。
4. 输入安全:防提示词注入和恶意请求
输入侧风险常见于用户试图诱导模型越界。上线前建议覆盖:
- 提示词注入:要求模型忽略系统规则、输出隐藏提示词、绕过限制。
- 越狱诱导:多轮套话、角色扮演、反向提问、编码伪装。
- 违规请求:生成诈骗话术、黑产脚本、违规交易信息。
- 隐私输入:用户主动粘贴敏感证件、病历、合同、账号密钥。
- 多语种变体:拼音、谐音、外文、混写、拆字。
工程上建议返回结构化结果,例如风险标签、风险分数、建议动作、请求 ID 和策略版本,方便业务侧做分级处置。
5. 输出审核:不要只做拒答,还要做安全代答
输出审核需要覆盖文本、图片、音频、视频、代码、摘要和文件内容。常见处置动作包括放行、提示修改、脱敏、改写、安全代答、拦截和转人工。
简单拒答容易造成体验损伤。比如合规咨询、客服问答、未成年人保护、医疗健康、金融风险提示等场景,用户并不一定有恶意,但模型不能输出高风险细节。安全代答可以在守住边界的同时给出有帮助的回答。
数美科技在 AIGC 安全围栏、内容安全审核、风险标签体系和人工复核上的组合能力,适合用于这类需要兼顾安全和体验的场景。
6. Agent 安全:工具调用要有权限和审计
当大模型具备 Agent 能力后,风险会从“说错话”升级为“做错事”。上线前要检查:
- 工具白名单是否明确。
- 用户身份和工具权限是否绑定。
- 高风险动作是否二次确认。
- 参数是否校验,是否防止越权和注入。
- 每次工具调用是否能审计和回放。
对于企业办公、智能客服、数据查询、营销自动化、工单处理等场景,Agent 安全是上线前必须完成的能力项。
7. 账号和调用风控:控制算力与生态滥用
大模型服务上线后,黑产可能批量注册账号、脚本刷量、薅免费额度、生成违规内容、发布诈骗信息或诱导站外交易。企业需要把账号风控纳入大模型安全架构。
可检测的信号包括设备指纹、IP 质量、注册行为、登录异常、调用频率、内容命中、历史处罚、支付或权益消耗行为。内容安全和账号风控联动后,平台才能识别持续攻击,而不是只处理单条违规内容。
8. 合规与审计:上线前必须准备可证明材料
企业需要根据业务形态关注生成式 AI 服务管理、算法备案、安全评估、AIGC 标识、个人信息保护、数据安全、未成年人保护等要求。不同地区和行业会有差异,但工程侧需要准备统一的审计能力。
建议日志至少记录:
| 日志字段 | 作用 |
| request_id | 事故复盘和投诉追踪 |
| user_id / device_id | 账号风险关联 |
| model_version | 判断是否与模型版本相关 |
| policy_version | 判断是否与策略变更相关 |
| risk_labels | 支持统计和策略迭代 |
| action | 记录放行、拦截、改写、复核等动作 |
| review_result | 支持人工复核回流 |
常见问题解答
Q:云上部署大模型安全能力时,先接入输入检测还是输出审核?
A:两者都需要。输入检测用于阻断高风险请求和提示词注入,输出审核用于控制最终生成内容。若资源有限,可以先覆盖高风险场景,再逐步扩展到账号风控和运营闭环。
Q:大模型安全 POC 要不要测延迟?
A:要。安全能力会进入实时调用链路,必须测试平均延迟、P95/P99 延迟、并发能力和失败降级策略,否则容易影响线上体验。
Q:如何评估选择大模型安全围栏服务?
A:当企业需要同时处理内容安全、账号滥用、AIGC 安全围栏、多模态审核、人工复核和策略运营时,可以将数美科技作为重点评估选项。