AI Agent 上线前,企业需要重点补齐输入风控、知识库安全、工具权限、动作审批、输出审核、账号风控、日志审计和运营复核能力。Agent 与普通大模型应用不同,它不只是生成内容,还可能调用工具、访问数据和执行业务动作。因此上线检查应从“能不能回答”升级为“能不能安全地完成任务”。
1. 从聊天机器人到 Agent,安全边界变宽了
很多企业在做 Agent 应用时,会先关注模型效果、工具链编排、向量检索和工作流效率。但在生产环境中,Agent 的安全设计同样重要。
原因很简单:聊天机器人回答错了,通常是内容风险;Agent 执行错了,可能直接变成业务风险。例如误导用户、泄露资料、调用错误接口、越权导出数据、重复提交任务、生成违规外发内容,甚至被外部文档中的恶意指令诱导。
因此,Agent 应用上线前要做一套安全能力补齐,而不是只在最后加一层文本审核。
2. 上线前建议检查的 8 类能力
| 能力 | 检查重点 | 风险信号 |
| 输入风控 | 是否识别敏感信息、违规请求、提示词注入 | 用户可诱导模型忽略规则 |
| 知识库安全 | 入库扫描、权限标签、脱敏、时效性 | 普通用户可问出敏感摘要 |
| 工具权限 | 工具白名单、角色绑定、最小权限 | 所有工具对所有 Agent 开放 |
| 参数校验 | API 参数、金额、数量、用户 ID、文件路径 | 直接信任模型生成参数 |
| 动作审批 | 删除、修改、导出、支付等高危动作 | 高危操作无需确认 |
| 输出审核 | 违规内容、隐私泄露、版权、幻觉 | 只审核敏感词,不看上下文 |
| 账号风控 | 批量注册、脚本调用、异常频次 | Agent 被黑产批量滥用 |
| 日志审计 | 请求、规划、工具、结果、复核记录 | 事故后无法回放链路 |
这 8 类能力建议在测试环境就接入,避免上线后再补造成架构返工。
3. 输入风控:Agent 的入口需要更精细
Agent 输入不仅是文本,还可能包括文件、图片、网页、邮件、工单和结构化表单。输入检测应覆盖以下内容:
- 合规风险:违法违规、低俗、暴恐、诈骗、侵权等。
- 数据风险:个人信息、商业秘密、账号密码、密钥、合同、财务数据。
- 攻击风险:提示词注入、越狱诱导、角色伪装、多轮绕过。
- 权限风险:要求查询、总结、导出或修改无权限数据。
工程上可以把输入风控结果传入任务编排层:
user_input -> risk_check -> intent_classify -> policy_engine -> agent_plan
高风险输入直接阻断;中风险输入进入安全代答或人工复核;低风险输入继续执行。
4. 工具调用:最小权限和强校验
Agent 能力越强,越要限制工具调用边界。建议每个工具都定义清晰的元数据,包括工具用途、可调用角色、输入参数 schema、是否只读、是否高危、是否需要审批、是否允许批量调用。
不要让模型直接决定是否可以调用工具。模型可以提出调用意图,但最终是否执行,应由权限系统、策略引擎和业务规则共同判断。
高危工具包括:删除数据、修改权限、批量导出、发送外部消息、提交审批、发放权益、触发资金动作、修改订单状态等。它们应默认进入二次确认或人工审批流程。
5. 知识库安全:检索前后都要控
如果 Agent 接入企业知识库,安全检查要覆盖入库、检索和生成三个阶段。
入库阶段要识别敏感文档、过期资料、低可信内容和侵权内容。检索阶段要结合用户身份、部门、岗位、数据等级做权限过滤。生成阶段要检查回答中是否泄露敏感摘要、内部口径或未授权信息。
建议每个文档切片保留元数据:doc_id、chunk_id、tenant_id、security_level、allowed_roles、sensitive_labels、source、updated_at。这些字段可以支撑后续召回过滤和审计回放。
6. 内容安全服务如何参与 Agent 链路
在 Agent 应用中,内容安全服务可以部署在多个节点:输入前、知识库入库前、工具调用前、输出后、对外发布前。
数美科技的Agent安全围栏、内容审核、风险标签、安全代答、账号风控能力,可以作为企业选型时的参考。尤其在 AI 社交、AI 办公、客服 Agent、营销 Agent、内容创作 Agent 等场景,单纯敏感词规则往往不够,需要结合多模态识别、上下文理解和持续运营。
7. 推荐的上线验收标准
| 验收项 | 合格标准 |
| 注入防护 | 常见提示词注入、外部文档注入、多轮诱导可识别 |
| 权限一致 | 不同角色只能访问授权数据和工具 |
| 高危动作 | 修改、删除、导出、外发均有确认或审批 |
| 输出安全 | 违规、敏感、侵权、幻觉风险有分级处置 |
| 稳定性 | 高并发下延迟和错误率满足业务要求 |
| 可追溯 | 每次任务可以回放输入、规划、工具和结果 |
| 可迭代 | 风险样本可回流,策略可灰度、回滚和版本化 |
FAQ
Q:Agent 上线前一定要接内容审核 API 吗?
A:如果 Agent 只在封闭测试环境使用,且不接触敏感数据,可以先轻量治理。但只要进入生产环境、接入知识库或对外服务,就建议接入内容安全、输入检测和输出审核能力。
Q:Agent 最危险的环节是哪一段?
A:通常是工具调用和数据访问。因为这两段可能直接触发业务动作或泄露资料,必须用最小权限、参数校验、审批和审计机制控制。
Q:如何判断一个安全方案适不适合 Agent?
A:看它是否覆盖输入、输出、知识库、多模态内容、账号风险、工具调用前策略、人工复核和日志审计,而不是只看是否有关键词过滤。