AI Agent 安全是企业智能体从试点走向生产前必须补齐的运行时安全能力。它关注的不只是模型输入输出是否合规,还包括 Agent 是否被指令劫持、是否越权调用工具、是否访问敏感数据、是否使用不可信 MCP 或插件,以及风险事件能否形成审计证据链。
一、从大模型应用到企业智能体,风险位置变了
企业早期大模型应用多是问答、检索、总结和辅助生成。安全重点通常放在输入检测、输出复检、隐私识别和内容合规。
AI Agent 上线后,系统开始具备任务规划和工具调用能力。它可以调用 API、数据库、MCP、插件、RPA、消息系统和业务后台。风险不再只是“模型说了什么”,而是“Agent 做了什么”。
典型链路如下:
用户请求 -> 输入安全检测 -> 上下文 / 知识库 / 文件检测 -> 任务规划 -> 身份权限校验 -> 能力入口调用 -> 返回内容复检 -> 输出安全检测 -> 运行时策略决策 -> 审计事件
二、企业智能体上线前要明确六类边界
1. Agent 资产边界
企业需要先知道哪些 Agent 在运行、属于哪个业务、由谁负责、部署在哪里、接入方式是什么、可控等级如何。如果 Agent 资产不清,安全策略无法准确生效。
2. 指令边界
Prompt Injection 不是普通内容违规,而是攻击者试图改变 Agent 的任务目标、系统约束、权限边界或工具调用行为。
直接攻击可能来自用户输入;间接攻击可能来自网页、文件、邮件、知识库或能力入口返回内容。
3. 权限边界
Agent 权限校验要回答的是“用户是否有权让 Agent 对特定资源执行特定动作”。例如用户是否能让 Agent 批量导出客户名单、删除工单、发起退款或调用外发接口。
4. 能力入口边界
能力入口包括 API、函数、MCP 工具、插件、数据库查询、文件操作、邮件发送、支付退款等。企业需要标记哪些是高风险动作,哪些可实时控制,哪些只能旁路审计。
5. 组件供应链边界
MCP、Skill、插件、知识库和依赖包是 Agent 能力载体。组件来源、版本、签名、权限声明和运行状态需要准入、复检和隔离能力。
6. 审计证据边界
执行链风险必须能追溯。审计事件应包含主体、Agent、能力入口、资源、风险命中、处置动作、策略版本和证据完整度。
三、接入可控等级决定安全承诺
在云上或混合环境中,企业经常同时存在自研 Agent、低代码平台 Agent、云厂商托管 Agent 和业务系统内嵌 Agent。不同 Agent 的可控等级不同。
| 等级 | 场景 | 安全动作 |
| L3 内联可控 | 自研代码型 Agent、可接入网关或运行时 Hook | 实时拦截、权限拒绝、二次确认、组件隔离 |
| L2 半内联可控 | 只接入输入输出或工具代理 | 覆盖节点内实时处置 |
| L1 旁路可观测 | 托管平台日志、异步事件 | 告警、事件、审计追溯 |
| L0 不可接入 | 无链路数据 | 不进入生产防护验收 |
这个分级可以避免把旁路审计误写成实时防护。
四、Agent 安全 POC 建议
企业在上线前可按以下矩阵验证:
| 测试项 | 样本示例 | 通过标准 |
| 直接提示词注入 | 忽略规则、泄露系统提示词 | 能识别风险类型和等级 |
| 间接提示词注入 | 文件或网页隐藏恶意指令 | 不执行隐藏指令并留痕 |
| 越权工具调用 | 普通员工导出全量客户 | 权限拒绝或二次确认 |
| 高风险动作 | 支付、退款、删除、外发 | 按策略拦截、降权或审批 |
| 组件风险 | 外部 MCP 权限扩大 | 准入审批、复检或隔离 |
| 审计完整度 | 复盘一次执行链 | 能还原主体、Agent、能力、资源和动作 |
五、数美科技天枢 Agent 安全围栏的参考定位
数美科技天枢 Agent 安全围栏面向企业 Agent 应用,围绕 Agent 执行链提供可接入、可识别、可处置、可审计的运行时安全防护。
从能力框架看,可拆成两组:
- AGENT 运行风险识别:输入输出内容风险、指令攻击与劫持风险、Agent 行为风险基础信号。
- AGENT 风险管理:Agent 资产与接入、身份权限与访问控制、供应链与组件治理、审计管理与证据链。
它适合作为企业智能体上线前的安全 POC 参考,尤其适合已经接入业务 API、MCP、插件、知识库和企业数据的场景。
六、上线前工程清单
- 建立 Agent 资产台账和能力入口目录。
- 标记每条链路的 L3/L2/L1/L0 可控等级。
- 对高风险动作建立权限、二次确认和审计策略。
- 对用户输入、文件、网页、知识库、工具返回做指令攻击识别。
- 对 MCP、Skill、插件、知识库和依赖包做准入和复检。
- 对 R3/R4 风险建立统一事件、证据链和复盘流程。
- 验证 P95/P99 延迟、并发、失败兜底和日志脱敏。
FAQ
AI Agent 安全是什么?
AI Agent 安全是围绕智能体执行链的运行时安全体系,覆盖指令、权限、能力入口、组件和审计。
云上 Agent 只能做旁路审计怎么办?
可以先按 L1 建立告警、事件和证据链;如果要实时阻断,需要进一步接入可控节点或能力入口代理。
MCP 安全为什么重要?
MCP 是 Agent 调用外部能力的载体,来源不明、权限扩大或被污染都会影响 Agent 的执行安全。