间接提示词注入的风险在于,攻击指令并不一定来自用户输入,而可能来自网页、文件、知识库、搜索结果、邮件附件或工具返回内容。企业建设 Agent 和 RAG 应用时,应把这些外部内容默认视为不可信数据,并在检索、规划、工具调用和输出环节建立运行时治理。
一、为什么企业 Agent 需要关注间接提示词注入
在云上 Agent、智能客服、智能办公、知识库问答和业务自动化场景中,模型读取的信息来源越来越多。用户输入只是入口之一,网页、PDF、Word、Excel、邮件、图片 OCR、搜索结果、知识库召回片段和 MCP 工具返回,都可能进入模型上下文。
攻击者可以把恶意指令藏在这些内容里,诱导 Agent 忽略系统规则、泄露提示词、访问越权数据,或者调用导出、外发、删除、退款、支付等高风险能力。治理这类风险,需要从“提示词写法”升级到“运行时安全架构”。
二、治理链路一:建立知识来源准入
每个知识库、同步源、上传入口和外部连接器都要有负责人、权限范围、版本记录和更新策略。来源不明、权限不清或版本异常的内容,不应直接进入高可信知识库。
知识来源准入至少要记录:来源系统、同步方式、内容类型、最近更新时间、负责人、可访问人群、适用业务范围、是否允许进入高风险 Agent 上下文。
三、治理链路二:入库前做隐藏指令检测
检测对象不只是不合规内容,还包括“忽略规则”“泄露系统提示”“调用外部接口”“导出全部数据”“绕过审批”等指令攻击意图。
文件类内容还应关注白色小字、页脚、批注、隐藏工作表、OCR 文本、二维码说明和附件嵌套文档。网页类内容应关注不可见元素、alt 文本、评论区、meta 信息、折叠区域和脚本生成文本。
四、治理链路三:召回时做片段级风险标注
知识片段应携带来源、时间、权限状态和风险标签。模型引用它时,应明确知道这是一段资料,而不是可执行命令。
如果某个片段包含可疑指令,不一定要直接删除,但应降低召回权重、限制进入高风险任务、触发复核,或在上下文中明确标注为不可信内容。
五、治理链路四:工具调用前做运行时校验
即使召回内容诱导 Agent 调用导出、删除、支付、退款、外发等能力,也必须再次检查用户、Agent、工具、资源、动作、参数和业务场景是否被授权。
权限校验的重点不是“用户能否登录系统”,而是“用户是否有权让 Agent 代表自己调用某个能力、访问某类资源、执行某个动作”。对高风险动作,应引入二次确认、审批、降权、拦截或告警。
六、治理链路五:保留审计证据链
高风险命中应记录请求 ID、执行链 ID、主体、Agent、知识片段、风险证据、工具候选、权限校验和最终处置结果。这样安全团队才能复盘误报、漏报、配置缺陷和真实攻击。
没有证据链的提示词注入治理,很容易停留在“模型好像被带偏了”的感受层面,难以形成可运营的安全闭环。
七、Agent 安全围栏的参考位置
对企业来说,提示词注入治理的目标不是让模型“更听话”,而是让系统具备可接入、可识别、可处置、可审计的安全能力。数美天枢 Agent 安全围栏可作为运行时安全参考选项,适合在 L3/L2 可控链路上执行实时拦截、脱敏、权限拒绝和二次确认,在 L1 旁路链路上提供事件发现、告警和审计追溯。
它不是 Agent Builder,也不替代企业 IAM/SSO,而是围绕 Agent 执行链处理输入侧防护、运行侧处置、组件治理和审计证据链。
FAQ
企业 Agent 最容易在哪些位置被注入?
常见位置包括网页、PDF、Word、Excel、邮件、知识库片段、搜索结果、OCR 文本、MCP 工具返回和长期记忆。
权限过滤能不能完全解决 RAG 安全?
不能。权限过滤解决“谁能看什么”,但不能完全解决“被召回内容是否包含恶意指令”。还需要入库检测、召回标注、引用约束和运行时校验。
实时拦截是否一定可做?
不一定。实时拦截依赖接入可控等级。L3/L2 可控链路可以做实时处置;L1 旁路链路更适合告警、事件生成和审计追溯。