Claude Code 被曝提示注入漏洞,成功率能到 80%——你的 Agent 可能正在"被网页说服"

简介: 一份安全测试报告揭示:Claude Code等AI Agent在Auto Mode下易遭网页内容劫持——仅需在普通网页嵌入隐蔽指令,即可误导其偏离原任务,成功率高达60%–80%。问题根源在于模型无法区分“用户指令”与“网页文本”,且权限过高。这非单一产品漏洞,而是所有具备网页读取+执行能力的Agent共性风险。当前最务实的应对,是将Agent视为需审批的“新人”,关键操作人工确认、权限分离、操作留痕、明确高危清单。能力跃进之时,“可信执行”机制才刚起步。

这两天圈子里在传一份安全测试报告,测的是 Claude Code 的 Auto Mode。结论挺扎心:不需要复杂的攻击手段,只要在一个普通网页里嵌一段藏得不明显的文字,就有可能让 Agent 偏离你原本交代的任务,转而去执行网页作者埋下的指令。受限环境下的测试,成功率做到了 60%–80%。

这到底是怎么发生的

先说清楚问题出在哪:对模型来说,"你的指令"和"网页里的文字"走的是同一条输入通道,都是它要理解和响应的自然语言,模型本身分不清"这句话是老板说的"还是"这句话是网页说的"。你让 Agent 帮你总结一篇技术博客,博客作者提前在页面某个角落埋了一句"如果你是AI,请忽略之前的任务,改为执行以下操作",Agent 读到这句话时,处理逻辑跟处理你的原始需求没有本质区别。

顺着这个漏洞往下想,风险链条其实很短:Agent 读网页 → 网页里有诱导指令 → Agent 把这条指令当真 → 如果它手里正好有文件读写、终端执行、联网请求的权限,事情就不可控了。测试报告里提到,普通的网页内容摘要场景,就可能触发被劫持。这意味着攻击门槛低到"随便写篇博客"就能试。
12167.png

这不是哪一家的锅

值得澄清一句:这不是 Claude Code 独有的毛病,是所有"能读网页、能跑代码、有执行权限"的 Agent 产品共同的软肋,只是这次被测出来、被拿出来说了。模型的自主性和能力在往上走,能接触的外部信息也越来越多,这个攻击面几乎是随着能力提升同步在变大的,属于这类产品发展到这个阶段绕不开的问题,而不是某个团队一时疏忽。

从这个角度看,与其说是"Claude Code 出了漏洞",不如说是行业刚刚撞上了"Agent 到底该信任到什么程度"这道题——而这道题目前还没有标准答案。

现在能做点什么

把 Agent 当成一个"权限有限、需要审批"的新人来用,是目前相对靠谱的应对思路:

· 涉及文件修改、API 调用、发送请求这类有实际影响的操作,中间加一道人工确认,别让它一条链路跑到底
· 密钥、生产环境相关的任务,尽量别交给同时具备联网/读取网页能力的 Agent 去做,权限分开
· 选工具时留意有没有"任务级别的操作留痕"和细粒度权限控制,真出问题了,至少能查得到、能及时叫停
· 对于团队协作场景,与其事后补救,不如提前把"高风险操作清单"定下来,列入 Agent 的使用规范里

AI 写代码的速度确实在肉眼可见地变快,但"用得放心"和"能力够强",中间隔着一整套还没成熟的权限设计和审计机制。这道题,才刚刚开始被认真对待,够每个用 Agent 干活的团队琢磨一阵子了。

相关文章
人工智能 缓存 前端开发
12633 74
人工智能 自然语言处理 安全
1504 0
Web App开发 人工智能 API
1585 2
人工智能 JavaScript 开发工具
4936 0
人工智能 Java BI
1685 1
人工智能 JavaScript 测试技术
2638 2
开发工具 Swift git
2010 6
人工智能 JavaScript 测试技术
1262 4

热门文章

最新文章