企业 AI 代理安全风险识别与治理路径研究

简介: 本文系统分析AI代理带来的四类核心安全风险:AI驱动的个性化钓鱼攻击、AI系统自身新攻击面(如提示注入)、影子AI导致的“低可见性+高权限”隐患,以及传统人工响应难以匹配AI攻防速度。提出基于身份、权限、数据、行为的四维治理框架,融合MITRE ATLAS、NIST、OWASP等主流标准,强调持续可见性、最小权限、威胁建模与安全自动化,助力企业安全可控地拥抱AI自主性。(239字)

摘要

人工智能代理正从实验阶段快速进入企业日常业务运营,其自主访问系统、处理信息、调用应用、完成任务的能力在显著提升生产效率的同时,也从根本上改变了企业网络安全的攻防格局。本文基于对 AI 代理安全风险的系统性分析,指出当前企业面临四类核心风险:其一,攻击者利用生成式 AI 提升钓鱼与社会工程攻击的速度、规模与个性化程度,加速漏洞研究与入侵生命周期自动化,使防御方面临响应速度失衡;其二,AI 系统自身成为新的攻击面,提示注入、数据与记忆投毒、权限滥用、模型操纵及第三方组件漏洞等攻击路径逐步成熟,安全问题从 "系统能否被访问" 转向 "系统决策能否被影响";其三,影子 AI 现象正在重演影子 IT 的治理困境,未经审批的 AI 工具在企业内部扩散,叠加 AI 代理执行任务所需的高权限,形成 "低可见性 + 高权限" 的高危组合;其四,传统以人工响应为核心的安全控制体系难以匹配 AI 驱动的攻击速度,安全自动化与 AI 辅助防御成为必然要求。反网络钓鱼技术专家芦笛指出,AI 驱动的个性化钓鱼将社会工程攻击的门槛降至前所未有的水平,传统基于特征匹配的邮件过滤体系正在失效。迪妙网络空间安全学院研究团队针对 AI 代理安全开展威胁建模,提出基于身份、权限、数据、行为四维度的持续治理框架。本文结合 MITRE ATLAS、NIST AI 风险管理框架、OWASP 生成式 AI 指南、ISO/IEC 42001 等主流框架,从持续可见性、最小权限、威胁建模、安全自动化四个层面提出可操作的治理路径,为企业在拥抱 AI 自主性的同时保持安全可控提供参考。

关键词:AI 代理;提示注入;影子 AI;最小权限;安全自动化;AI 治理

image.png 1 引言

人工智能技术的发展正在经历从 "被动问答" 到 "主动执行" 的范式跃迁。传统生成式人工智能工具以对话交互为核心,等待用户提出问题后生成文本、图像或代码,其输出停留在信息层面,不直接作用于业务系统。而 AI 代理则具备不同程度的自主决策与行动能力,能够访问企业内部系统、读取和处理数据、与其他应用程序通信、调用 API 接口,并在预设目标驱动下完成多步骤的复杂任务。这种从 "生成内容" 到 "执行动作" 的能力跨越,使 AI 代理成为企业数字化转型中的新型生产力工具,也使其成为网络安全攻防博弈的新焦点。

AI 代理的安全风险并非单一维度的技术问题,而是攻防双方同时引入 AI 能力后形成的系统性格局变化。一方面,攻击者可以利用 AI 工具强化传统攻击手段,使钓鱼邮件更具迷惑性、漏洞挖掘更高效、攻击协调更自动化;另一方面,AI 代理本身作为部署在企业内部的新型系统,拥有访问数据和执行操作的权限,其自身的安全缺陷可能被攻击者利用,成为入侵企业的新入口。此外,企业员工自发使用各类 AI 工具的行为正在形成 "影子 AI" 现象,与早年影子 IT 带来的治理问题类似,但 AI 代理所需的高权限使其潜在后果更为严重。最后,当攻击和防御都引入 AI 能力后,攻防节奏从人类速度转向机器速度,传统以人工分析和响应为核心的安全运营体系面临根本性挑战。

当前企业对 AI 代理安全的认知普遍存在滞后。许多组织将 AI 安全视为一个专门的技术问题,交由 AI 团队或数据科学团队处理,而没有将其纳入整体网络安全治理框架。安全团队对企业内部部署了哪些 AI 代理、这些代理能访问哪些数据、拥有哪些权限、执行了哪些操作,往往缺乏足够的可见性。与此同时,AI 技术迭代速度极快,新的攻击手法和防御工具不断涌现,企业难以在短时间内建立成熟的安全能力。

本文围绕上述四类核心风险展开系统分析,结合主流安全框架与行业实践,提出企业 AI 代理安全治理的路径与方法。研究的核心论点是:AI 代理安全不是 AI 技术的附属问题,而是基础网络安全问题在人工智能时代的延伸与演化;企业不应因安全风险而拒绝采用 AI,而应在采用过程中同步构建与 AI 能力相匹配的可见性、治理与控制体系;最终从 AI 代理中获益最多的企业,不是部署速度最快的企业,而是能够在拥抱自主性的同时有效管控身份、权限、数据与行为的企业。

2 AI 代理的技术特征与安全范式转变

2.1 AI 代理的核心能力特征

AI 代理区别于传统生成式 AI 工具的核心特征在于其行动能力。一个典型的 AI 代理通常具备以下能力要素:感知能力,即通过读取邮件、文件、数据库、API 响应等方式获取外部信息;推理能力,即基于大语言模型对获取的信息进行分析、规划和决策;工具调用能力,即通过函数调用或 API 接口与外部系统交互,执行查询、修改、发送等操作;记忆能力,即存储和调用历史交互信息、任务状态和用户偏好,以支持多轮、多步骤的任务执行;自主执行能力,即在给定目标后,能够自主规划任务步骤、选择工具、处理中间异常,直至完成任务或遇到无法解决的障碍。

这些能力要素的组合,使 AI 代理能够承担诸如日程管理、邮件处理、数据录入、报告生成、客户服务、代码开发等多种行政和业务任务。与传统自动化脚本不同,AI 代理不需要为每一种任务场景预先编写精确的流程逻辑,而是能够基于自然语言指令和上下文信息动态生成执行方案,这使其在处理非结构化、多变的任务时具有显著优势,但也使其行为路径更加复杂和难以预测。

2.2 安全范式的根本转变

AI 代理的引入从三个层面改变了企业网络安全的基本范式。

第一,攻击面的扩展。传统企业网络安全的攻击面主要包括网络边界、服务器、终端设备、应用程序和用户账号。AI 代理的部署为攻击面增加了新的组成部分:代理本身的模型与推理逻辑、代理的记忆存储、代理的工具调用接口、代理与其他系统的集成点、代理所使用的第三方组件和 API。每一个 AI 代理的引入,都意味着企业内部增加了一个具有自主决策能力和系统访问权限的新型实体,安全团队需要为这个实体建立与人类用户同等水平的身份认证、权限管理和行为监控。

第二,攻击目标的转移。传统网络攻击的核心目标是获取系统访问权限或窃取数据,安全问题的核心是 "攻击者能否访问系统"。而在 AI 代理环境下,攻击者即使不直接入侵代理所在的系统,也可以通过操纵代理所消费的信息来影响代理的决策和行为。例如,在代理会读取的邮件、文档或网页中嵌入恶意指令,诱导代理执行非预期操作。这使得安全问题的核心从 "系统能否被访问" 扩展为 "系统的决策能否被影响",防御范围从系统边界延伸到了信息内容本身。

第三,攻防速度的跃迁。传统网络攻击的各个阶段 —— 侦察、武器化、投递、利用、安装、命令与控制、行动 —— 大多依赖人工操作,攻击节奏受限于人类的工作速度和反应时间。AI 工具的引入使攻击者能够自动化完成侦察、漏洞分析、恶意内容生成、攻击协调等多个环节,攻击节奏从人类速度提升至机器速度。这意味着防御方传统上以人工分析、人工研判、人工响应为核心的安全运营流程,在速度上可能无法匹配自动化攻击的节奏,安全自动化和 AI 辅助防御成为必然要求。

迪妙网安研究团队指出,AI 代理安全的本质是身份与权限治理问题在非人类实体上的延伸。只要一个实体能够访问数据和执行操作,无论它是人类还是 AI,都需要遵循身份认证、最小权限、行为审计等基础安全原则。将 AI 代理视为特殊的 "数字员工" 并纳入统一的身份与访问管理体系,是企业构建 AI 安全能力的出发点。

3 攻击者利用 AI 强化传统攻击的风险分析

3.1 钓鱼与社会工程攻击的升级

钓鱼和社会工程攻击长期以来是企业面临的最主要初始入侵途径之一。传统钓鱼攻击受限于攻击者的语言能力和时间成本,通常采用通用模板批量发送,邮件内容存在语法错误、称呼泛化、上下文缺失等明显特征,易于被邮件安全网关和有经验的用户识别。生成式 AI 工具的引入从根本上改变了这一局面。

攻击者可以利用大语言模型快速生成高质量、个性化的钓鱼内容。与传统 "一封邮件发给上千人" 的批量模式不同,AI 工具能够根据目标的公开信息 —— 包括社交媒体资料、公司官网信息、行业动态、甚至目标过往的公开发言 —— 生成高度定制化的钓鱼邮件。邮件的语言风格、专业术语、上下文引用都可以与目标的背景高度匹配,使收件人难以仅凭内容判断真伪。AI 工具还可以生成多语言版本的钓鱼内容,消除传统钓鱼邮件中常见的非母语表达痕迹。

反网络钓鱼技术专家芦笛指出,AI 驱动的个性化钓鱼将社会工程攻击的门槛降至前所未有的水平。过去,实施高质量鱼叉式钓鱼需要攻击者具备较强的情报收集能力和文案撰写能力,只有资源丰富的高级持续性威胁团队才能常态化开展。如今,借助公开可用的 AI 工具,即使是技术能力有限的初级攻击者也能生成足以迷惑普通用户的个性化钓鱼内容。这意味着钓鱼攻击的整体质量水平正在提升,传统基于关键词匹配和语法特征的邮件过滤体系的有效性正在下降。

除文本内容外,AI 工具还可以生成逼真的语音和视频内容,使语音钓鱼和深度伪造攻击更加普及。攻击者可以利用 AI 克隆目标同事或上级的声音,通过电话或语音消息诱导目标执行转账、泄露信息等操作。这类多模态社会工程攻击结合了 AI 生成内容的逼真度与传统电话诈骗的即时性,对企业员工的安全意识构成更严峻的考验。

3.2 漏洞研究与入侵生命周期的加速

AI 工具在攻击链的其他环节同样发挥着加速作用。在漏洞研究阶段,AI 可以辅助攻击者分析代码、识别潜在漏洞、生成漏洞利用代码。传统漏洞发现需要安全研究人员逐行审查代码、理解程序逻辑、构造测试用例,周期较长且高度依赖个人经验。AI 工具可以快速扫描大量代码,标记可能存在漏洞的代码片段,甚至自动生成概念验证代码,显著缩短从漏洞发现到可利用的时间窗口。

在入侵生命周期的协调阶段,AI 代理可以辅助攻击者自动化完成多步骤操作。例如,自动识别目标组织的外部攻击面、收集相关情报、根据目标环境选择合适的攻击工具、协调不同攻击阶段的执行。这种自动化能力使资源有限的攻击团伙也能实施过去只有高级团队才能开展的复杂攻击,同时大幅提升攻击的整体节奏。

对于防御方而言,这种速度提升带来了严峻的响应压力。传统安全运营流程设计基于人工攻击者的操作节奏,从安全告警产生到分析研判再到响应处置,往往需要数小时甚至数天。当攻击者利用 AI 工具将侦察和攻击准备时间压缩至分钟级时,防御方的人工响应流程可能在攻击完成之前尚未启动。这种攻防速度的不对称,要求企业重新审视安全运营流程,引入更多自动化响应能力,将能够由机器完成的分析和处置动作前置到人工介入之前。

3.3 恶意内容生成与攻击工具的平民化

AI 工具还降低了恶意软件和攻击工具的开发门槛。过去,开发功能完善的恶意软件需要攻击者具备较强的编程能力和规避检测的知识。如今,攻击者可以利用 AI 代码生成能力快速编写恶意软件的核心功能模块,甚至请求 AI 提供规避杀毒软件检测的建议。虽然 AI 生成的代码在质量和复杂度上仍不及专业恶意软件开发者,但对于针对防护能力较弱的中小企业的攻击而言,已经足够构成威胁。

攻击工具的平民化意味着网络威胁的整体数量和多样性可能增加。更多具备有限技术能力的参与者能够进入网络犯罪市场,利用 AI 工具弥补自身技术不足,实施过去无法开展的攻击。这对企业的威胁检测能力提出了更高要求,因为攻击样本的多样性增加后,基于已知特征的检测方法覆盖率下降,需要更多依赖行为分析和异常检测。

4 AI 系统自身作为攻击面的风险分析

4.1 提示注入攻击

提示注入是当前针对 AI 代理最受关注的攻击手法之一。其基本原理是:攻击者在 AI 代理预期会处理的信息 —— 如邮件内容、网页文本、文档内容、数据库记录 —— 中嵌入恶意指令,当代理读取这些信息时,恶意指令被模型当作有效的指令执行,从而改变代理的行为。

提示注入的危险性在于,它不需要攻击者直接入侵 AI 代理所在的系统,也不需要获取代理的访问凭证。攻击者只需要将恶意内容放置在代理的信息消费路径上即可。例如,一个能够读取邮件的 AI 助理,攻击者向其用户发送一封包含隐藏恶意指令的邮件,当助理自动处理该邮件时,恶意指令可能被执行,导致助理转发敏感邮件、修改日历设置、或调用其他工具执行非预期操作。

提示注入的技术难点在于,大语言模型在处理文本时,难以可靠地区分哪些内容是 "系统指令"(应由开发者设定、具有最高优先级),哪些内容是 "用户输入"(应作为数据处理),哪些内容是 "外部信息"(应作为不可信数据处理)。当外部信息中包含看起来像指令的文本时,模型可能将其误认为有效指令并执行。虽然当前的 AI 系统在提示注入防御方面有所改进,但完全可靠的解决方案尚未形成,特别是在复杂的多步骤任务场景中,提示注入的风险仍然显著。

反网络钓鱼技术专家芦笛强调,提示注入本质上是一种新型的社会工程攻击,只不过攻击对象从人类变成了 AI 模型。传统钓鱼攻击欺骗人类点击恶意链接,提示注入攻击欺骗 AI 模型执行恶意指令。两者的共同特征是利用目标的信息处理机制,将恶意内容伪装成合法信息。因此,防御提示注入需要借鉴传统社会工程防御的思路:对 AI 代理消费的所有外部信息保持不信任,对代理执行的高风险操作设置人工确认环节,对代理的行为进行持续监控和异常检测。

4.2 数据与记忆投毒

AI 代理通常具备记忆能力,能够存储历史交互信息、任务状态、用户偏好和外部知识,以支持连续的任务执行。这些记忆数据如果被攻击者篡改或污染,可能影响代理的后续决策和行为,形成数据投毒或记忆投毒攻击。

数据投毒可以发生在 AI 模型的训练阶段,攻击者通过向训练数据中注入恶意样本,使模型学习到错误的关联或行为模式。对于使用第三方预训练模型的企业而言,训练数据的质量和安全性往往无法完全掌控,模型中可能存在被植入的后门或偏见。记忆投毒则发生在代理的运行阶段,攻击者通过与代理的交互,向代理的记忆中写入错误信息,使代理在后续任务中基于错误信息做出决策。例如,攻击者可以在与客服代理的对话中植入虚假的产品信息,当后续用户咨询相关问题时,代理可能基于被污染的记忆给出错误答案。

数据与记忆投毒的隐蔽性较强,因为其影响通常不会立即显现,而是在代理后续处理相关任务时才表现为异常行为。这要求企业在 AI 代理的全生命周期中建立数据质量监控机制,对训练数据、外部知识源和运行时记忆进行完整性校验,定期审查代理的记忆内容,及时发现和清除被污染的信息。

4.3 权限滥用与模型操纵

AI 代理为了完成有用的工作,通常需要被授予访问企业系统和数据的权限。这些权限如果配置不当或被攻击者利用,可能成为入侵企业的跳板。权限滥用风险包括:代理被授予超出任务所需的过度权限,违反最小权限原则;代理的身份凭证被攻击者窃取,用于冒充代理访问系统;攻击者通过提示注入等手段诱导代理执行其权限范围内但非预期的操作,如导出敏感数据、修改系统配置等。

模型操纵是指攻击者针对 AI 代理所使用的基础模型进行攻击,包括通过对抗性输入使模型输出错误结果、通过模型反演提取训练数据中的敏感信息、通过成员推断判断特定数据是否存在于训练集中等。这些攻击手法虽然在学术研究中已较为成熟,但在实际企业环境中的利用仍处于早期阶段,随着 AI 代理的普及,其威胁等级将逐步上升。

4.4 第三方组件与 API 风险

AI 代理的功能实现通常依赖大量第三方组件和 API,包括基础模型服务、向量数据库、工具调用框架、外部数据接口等。每一个第三方组件都可能存在安全漏洞或被攻击者控制,形成供应链风险。例如,代理调用的某个外部 API 如果被攻击者入侵,可能返回被篡改的数据,影响代理的决策;代理使用的某个开源库如果存在漏洞,可能被攻击者利用执行任意代码。

第三方组件风险的治理难点在于其复杂性和动态性。一个 AI 代理可能集成数十个第三方组件,每个组件都有独立的版本更新和安全公告,企业难以持续跟踪所有组件的安全状态。这要求企业建立 AI 代理的软件物料清单,对代理所依赖的所有组件进行登记和监控,及时响应组件的安全漏洞公告,并在组件出现严重漏洞时能够快速定位受影响的代理并采取缓解措施。

5 影子 AI 的治理盲区与权限风险

5.1 影子 AI 现象的形成

影子 IT 是企业安全治理中的长期问题,指员工在未经 IT 部门审批和安全评估的情况下,自行引入和使用各类应用程序、云服务和设备。AI 技术的普及正在催生类似的 "影子 AI" 现象:员工为了提升工作效率,自行使用各类 AI 工具,包括浏览器扩展、生产力助手、会议纪要工具、代码补全插件、数据分析助手等。这些工具往往以 SaaS 服务或浏览器插件的形式存在,安装和使用门槛极低,员工可以在几分钟内部署完成,而 IT 和安全团队对此毫不知情。

影子 AI 的形成有其合理的业务动因。员工面临工作压力,希望借助 AI 工具提升效率,而企业内部的 AI 工具审批流程可能较为缓慢,或者内部提供的 AI 工具功能不能满足具体需求。在这种情况下,员工倾向于自行寻找和使用外部 AI 工具,这是技术普及过程中的自然现象,不应简单地视为员工的违规行为。

然而,影子 AI 带来的安全风险不容忽视。许多员工自发使用的 AI 工具在数据隐私和安全方面缺乏保障,员工可能在使用过程中将企业的敏感数据 —— 如客户信息、商业机密、内部文档、源代码 —— 输入到外部 AI 工具中,导致数据泄露。一些 AI 浏览器扩展可能请求读取网页内容、修改网页、访问浏览历史等高风险权限,存在被恶意利用的可能。此外,未经安全评估的 AI 工具可能存在漏洞或被攻击者控制,成为入侵企业网络的入口。

5.2 "低可见性 + 高权限" 的高危组合

影子 AI 的核心风险在于 "低可见性" 与 "高权限" 的组合。低可见性是指安全团队对企业内部存在哪些 AI 工具、由谁使用、处理哪些数据、与哪些系统集成,缺乏足够的了解和监控。高权限是指 AI 代理为了执行有用的任务,通常需要被授予访问数据和系统的权限,这些权限可能远超普通员工的权限范围。

当一个 AI 代理在安全团队不知情的情况下运行,并且拥有访问企业敏感数据和系统的权限时,其潜在风险是严重的。如果该代理存在安全漏洞或被攻击者控制,攻击者可以借助代理的权限访问企业内部资源,而安全团队由于不知道该代理的存在,无法对其行为进行监控和检测。此外,多个 AI 代理之间的互联可能形成攻击链,攻击者可以利用一个代理的小漏洞作为跳板,通过代理之间的信任关系逐步扩大访问范围,最终形成严重的安全事件。

迪妙安全研究团队在对企业 AI 使用情况的调研中发现,许多企业中实际运行的 AI 工具数量远超 IT 部门登记的数量,其中相当一部分工具拥有访问企业邮箱、文档或内部系统的权限。这种 "登记数量与实际数量之间的差距" 正是影子 AI 风险的直接体现。研究团队建议,企业应将 AI 工具的发现和管理纳入资产盘点流程,通过网络流量分析、终端软件清点、云服务访问日志等多种手段,持续发现企业内部运行的 AI 工具,建立完整的 AI 资产清单。

5.3 最小权限原则在 AI 身份上的应用

应对影子 AI 和 AI 代理权限风险的核心原则是最小权限。这一原则在传统 IT 安全中已得到广泛应用,即每个用户或系统只被授予完成其任务所必需的最小权限,以减少权限被滥用或泄露后的影响范围。对于 AI 代理而言,最小权限原则同样适用,且其重要性不亚于人类用户。

在 AI 代理的权限配置中,企业应避免为了实施方便而授予代理过于宽泛的权限。例如,一个仅需要读取特定文件夹中文档的代理,不应被授予访问整个文件服务器的权限;一个仅需要发送邮件通知的代理,不应被授予读取所有邮件和删除邮件的权限。代理的权限应与其任务范围精确匹配,并且应定期审查,当代理的任务范围发生变化时及时调整权限。

此外,企业应为 AI 代理建立独立的身份标识,而不是让代理共享人类用户的账号。独立的身份标识使企业能够对代理的行为进行单独审计和监控,在代理出现异常行为时能够快速定位和隔离。代理的身份认证应采用与人类用户同等强度的认证机制,如多因素认证,防止代理的凭证被窃取后被攻击者滥用。对于高风险操作,如数据导出、系统配置修改、资金转账等,应设置人工确认环节,即使代理有权限执行这些操作,也需要经过人类审批后才能实际执行。

6 安全控制速度适配与防御体系构建

6.1 持续可见性的建立

应对 AI 代理安全风险的基础是可见性。企业无法保护其不知道存在的东西,因此建立对企业内部 AI 代理和 AI 工具的持续可见性,是安全治理的第一步。

传统的周期性资产盘点方式在 AI 时代可能不再足够。AI 工具的部署速度极快,员工可以在几分钟内安装一个 AI 浏览器扩展或注册一个 AI SaaS 服务,而季度或半年度的资产盘点周期意味着新引入的 AI 工具可能在很长时间内处于安全团队的视野之外。因此,企业需要向持续可见性转型,通过自动化手段实时发现和监控企业内部运行的 AI 工具。

实现持续可见性的技术手段包括:网络流量分析,通过识别与已知 AI 服务域名的通信发现企业内部使用的 AI 工具;终端软件清点,通过终端管理工具发现安装在员工设备上的 AI 应用和浏览器扩展;云服务访问日志分析,通过审查企业云环境中的访问日志发现 AI 代理的活动;API 网关监控,通过监控企业 API 的调用情况发现 AI 代理的工具调用行为。通过多种手段的组合,企业可以建立对 AI 资产的全面、实时的可见性。

可见性不仅包括知道哪些 AI 工具在运行,还包括了解这些工具能访问哪些数据、拥有哪些权限、执行了哪些操作。企业应为每个 AI 代理建立档案,记录其功能描述、权限范围、数据访问范围、所依赖的第三方组件、负责人信息等,并持续更新。当代理的权限或数据访问范围发生变化时,档案应及时更新,确保安全团队始终掌握代理的最新状态。

6.2 AI 安全策略与审批流程

企业应建立明确的 AI 工具使用策略,规范 AI 工具的审批、部署和使用流程。策略应明确哪些类型的 AI 工具可以使用、哪些类型的 AI 工具禁止使用、AI 工具可以处理哪些类型的数据、AI 工具的审批流程是什么、使用 AI 工具的员工和部门应承担哪些安全责任。

策略的制定应平衡安全与效率。过于严格的禁令可能导致员工转向地下使用,反而加剧影子 AI 问题;过于宽松的策略则可能导致安全风险失控。合理的策略应采用分级管理:对于处理公开信息和低敏感数据的 AI 工具,采用较低的审批门槛,鼓励员工合法使用;对于处理企业内部敏感数据的 AI 工具,要求经过安全评估和审批;对于处理客户个人信息、商业机密等高敏感数据的 AI 工具,实施严格的审批和持续监控。

AI 工具的审批流程应包含安全评估环节,评估内容包括:工具的数据处理方式,是否将数据用于模型训练或共享给第三方;工具的安全认证情况,是否通过 SOC 2、ISO 27001 等安全认证;工具的权限请求范围,是否存在过度请求权限的情况;工具的供应商信誉和安全历史;工具与企业系统的集成方式和安全措施。通过标准化的安全评估,企业可以在 AI 工具引入之前识别和规避大部分安全风险。

6.3 威胁建模与框架应用

威胁建模是系统性识别和评估 AI 代理安全风险的重要方法。企业在部署 AI 代理之前,应开展威胁建模,分析代理可能面临的攻击路径、潜在影响和现有防护措施的不足,并据此设计安全控制方案。

AI 代理的威胁建模应关注以下问题:代理会消费哪些来源的信息,这些信息中是否可能包含恶意指令(提示注入风险);代理会访问哪些数据和系统,这些权限被滥用后的影响是什么(权限风险);代理的记忆和训练数据是否可能被污染(数据投毒风险);代理依赖哪些第三方组件和 API,这些组件是否存在安全漏洞(供应链风险);代理的行为是否可监控、可审计,异常行为是否能被及时发现(检测风险)。

行业内已有多个 AI 安全相关的框架和指南,可以为企业的威胁建模和风险管理提供结构化参考。MITRE ATLAS 是一个针对 AI 系统的对抗性战术、技术和常识知识库,类似于传统网络安全领域的 MITRE ATT&CK 框架,帮助企业识别针对 AI 系统的攻击手法和相应的缓解措施。NIST AI 风险管理框架提供了 AI 风险管理的通用流程,包括治理、映射、测量、管理四个核心功能,帮助企业建立系统化的 AI 风险管理能力。OWASP 针对生成式 AI 和大语言模型应用的 top 10 风险清单,列出了提示注入、敏感信息泄露、供应链漏洞等最常见的 AI 应用安全风险,为企业的风险识别提供了实用的检查清单。Google 的安全 AI 框架提供了 AI 系统全生命周期的安全实践指南,覆盖识别、保护、检测、响应、恢复五个安全维度。ISO/IEC 42001 是人工智能管理体系标准,为企业建立和运行 AI 管理体系提供了规范化要求。

迪妙网络空间安全学院研究团队建议,企业在应用这些框架时,不应追求一次性全面落地,而应结合自身的 AI 应用现状和安全成熟度,选择最相关的框架组件优先实施。对于 AI 代理安全处于起步阶段的企业,可以先从 OWASP 生成式 AI top 10 风险清单入手,对照清单逐一排查现有 AI 应用的安全风险;对于安全成熟度较高的企业,可以参考 NIST AI 风险管理框架和 ISO/IEC 42001 建立系统化的 AI 治理体系,并利用 MITRE ATLAS 完善针对 AI 攻击的检测和响应能力。

6.4 安全自动化与 AI 辅助防御

当攻击方引入 AI 能力实现攻击自动化后,防御方也必须相应提升安全运营的自动化水平,以匹配攻防节奏。传统的安全运营流程以人工分析和响应为核心,在面对 AI 驱动的高速攻击时可能存在响应滞后。安全自动化通过将重复性的分析和处置动作交由机器完成,可以显著缩短从告警产生到响应处置的时间,提升安全运营的整体效率。

安全自动化的应用场景包括:自动化告警分诊,利用 AI 对海量安全告警进行初步分析和优先级排序,将安全分析师的精力集中在最需要人工判断的高风险告警上;自动化威胁狩猎,利用 AI 分析大量日志和流量数据,主动发现隐蔽的攻击迹象,而不是被动等待告警触发;自动化响应处置,对于特征明确、风险确定的安全事件,自动执行隔离设备、封禁 IP、重置账号等响应动作,减少人工响应的延迟;自动化钓鱼分析,利用 AI 对可疑邮件进行内容分析和链接检测,快速识别和隔离钓鱼邮件,减少其到达用户收件箱的概率。

AI 辅助防御不是要取代人类安全分析师,而是将人类从重复性的低价值工作中解放出来,使其能够专注于需要深度判断和决策的高价值工作。在 AI 辅助防御体系中,AI 负责处理大规模数据的初步分析和常规事件的自动处置,人类负责复杂事件的研判、策略的制定、异常情况的处理和最终决策。这种人机协作模式可以在提升安全运营效率的同时,保持人类对安全决策的最终控制。

需要注意的是,安全自动化本身也需要安全管控。自动化响应动作如果配置不当,可能导致误操作,如错误隔离正常设备、封禁合法 IP 等,对业务造成影响。因此,自动化响应应采用分级策略:对于低风险、高确定性的事件,可以全自动执行响应;对于中风险事件,执行响应前需要人工确认;对于高风险事件,必须由人工分析后再决定响应措施。同时,所有自动化响应动作都应被记录和审计,便于事后追溯和优化。

7 AI 代理安全治理的实施路径

7.1 治理原则:采用与安全同步推进

企业在推进 AI 代理应用时,应坚持 "采用与安全同步推进" 的原则,避免 "先部署后治理" 的模式。AI 技术的迭代速度极快,如果企业在大规模部署 AI 代理后才开始考虑安全问题,可能已经形成大量安全债务,后续治理的成本和难度将显著增加。相反,在 AI 代理的规划和设计阶段就引入安全考量,将安全控制嵌入到代理的开发、测试、部署和运营全流程中,可以以较低的成本构建安全能力,避免后期的被动补救。

这一原则并不意味着企业应该因安全顾虑而放缓 AI 采用的步伐。AI 代理带来的生产效率提升是实实在在的,拒绝采用 AI 可能使企业在竞争中处于劣势。正确的做法是在采用 AI 的同时同步建设安全能力,使安全成为 AI 应用的赋能者而非阻碍者。企业可以通过建立 AI 安全基线、提供经过安全评估的 AI 工具选项、简化低风险 AI 应用的审批流程等方式,在保障安全的前提下支持员工合法、高效地使用 AI 工具。

7.2 组织保障:跨部门协作机制

AI 代理安全治理不是安全团队单方面能够完成的工作,需要 IT、业务、法律、合规、人力资源等多个部门的协作。安全团队负责制定安全策略、开展风险评估、建设技术防护能力;IT 部门负责 AI 工具的基础设施管理和身份权限配置;业务部门负责识别业务场景中的 AI 需求和相关风险;法律和合规部门负责评估 AI 使用的法律合规风险,包括数据保护、知识产权、行业监管等;人力资源部门负责将 AI 安全意识纳入员工培训和考核体系。

企业应建立跨部门的 AI 治理委员会或工作组,统筹协调 AI 代理的安全治理工作。该组织的职责包括:制定企业 AI 安全策略和标准;审批高风险 AI 应用的部署;监督 AI 安全控制措施的落实;协调跨部门的 AI 安全事件响应;定期评估企业 AI 安全态势并向管理层汇报。通过跨部门协作机制,企业可以打破部门壁垒,形成 AI 安全治理的合力。

7.3 能力建设:人员培训与技术工具

AI 代理安全治理的能力建设包括人员能力和技术工具两个方面。

在人员能力方面,企业应加强对全体员工的 AI 安全意识培训,使员工了解 AI 工具的安全风险、正确使用方法和异常情况报告流程。培训内容应包括:影子 AI 的风险,引导员工通过正规渠道使用 AI 工具而非自行引入;数据安全,明确哪些数据可以输入 AI 工具、哪些数据禁止输入;提示注入和社会工程攻击的识别,使员工了解针对 AI 系统的新型攻击手法;AI 生成内容的安全审查,提醒员工对 AI 生成的代码、文档、决策进行人工复核,避免直接采用可能存在安全问题的输出。

对于安全团队和 AI 开发团队,应提供更专业的 AI 安全技术培训,使其掌握 AI 威胁建模、提示注入防御、AI 模型安全测试、AI 安全监控等专业技能。企业可以通过参加行业培训、引入外部专家咨询、参与 AI 安全社区交流等方式,持续提升团队的 AI 安全技术能力。

在技术工具方面,企业应建设支持 AI 代理安全治理的技术能力,包括:AI 资产发现与管理工具,实现对企业内部 AI 工具的持续发现和资产登记;AI 行为监控与审计工具,对 AI 代理的操作行为进行日志记录和异常检测;AI 权限管理工具,支持对 AI 代理身份的细粒度权限配置和定期审查;AI 安全测试工具,支持在 AI 代理部署前开展提示注入测试、数据投毒测试、漏洞扫描等安全评估;安全自动化与编排工具,支持 AI 驱动的安全告警分析和自动化响应。

7.4 持续运营:监测、评估与改进

AI 代理安全治理是一个持续运营的过程,而非一次性项目。AI 技术和攻击手法都在快速演变,企业的 AI 应用场景也在不断扩展,因此安全治理需要持续监测、定期评估和不断改进。

在监测层面,企业应持续监控 AI 代理的运行状态和安全事件,包括 AI 代理的异常行为、针对 AI 代理的攻击尝试、AI 工具的数据泄露事件、AI 相关的用户投诉等。通过持续监测,企业可以及时发现安全问题并采取响应措施,避免小问题演变为大事件。

在评估层面,企业应定期开展 AI 安全风险评估和控制有效性评估。风险评估应覆盖企业所有在用的 AI 代理和 AI 工具,识别新出现的安全风险和风险等级变化。控制有效性评估应检验已部署的安全控制措施是否达到预期效果,是否存在控制盲区或执行不到位的情况。评估结果应作为安全策略调整和资源投入的依据。

在改进层面,企业应根据监测和评估发现的问题,持续优化安全策略、完善控制措施、提升技术能力。改进应采用闭环管理:发现问题后分析根本原因,制定改进措施并落实,验证改进效果,将有效措施固化为标准流程。通过持续的监测、评估和改进,企业的 AI 安全治理能力可以随着 AI 技术的发展和威胁环境的变化而不断演进。

8 结论

AI 代理正在从实验性技术转变为企业日常运营中的常规生产力工具,其自主访问系统、处理信息、执行任务的能力在显著提升生产效率的同时,也从根本上改变了企业网络安全的攻防格局。本文系统分析了企业在 AI 代理应用中面临的四类核心风险:攻击者利用 AI 强化传统攻击手段,使钓鱼和社会工程攻击更具个性化、漏洞研究和入侵生命周期更加自动化,造成攻防速度不对称;AI 系统自身成为新的攻击面,提示注入、数据与记忆投毒、权限滥用、模型操纵、第三方组件漏洞等攻击路径逐步成熟,安全问题的核心从 "系统能否被访问" 扩展为 "系统决策能否被影响";影子 AI 现象正在重演影子 IT 的治理困境,未经审批的 AI 工具在企业内部扩散,叠加 AI 代理执行任务所需的高权限,形成 "低可见性 + 高权限" 的高危组合;传统以人工响应为核心的安全控制体系难以匹配 AI 驱动的攻击速度,安全自动化和 AI 辅助防御成为必然要求。

针对上述风险,本文提出企业 AI 代理安全治理的实施路径。在治理原则上,应坚持采用与安全同步推进,避免 "先部署后治理" 的安全债务积累,在拥抱 AI 自主性的同时保持对身份、权限、数据和行为的有效控制。在组织保障上,应建立跨部门协作机制,统筹安全、IT、业务、法律、合规、人力资源等多方力量,形成 AI 安全治理的合力。在能力建设上,应加强全员 AI 安全意识培训和专业团队技术能力建设,同时部署支持 AI 资产发现、行为监控、权限管理、安全测试和自动化响应的技术工具。在持续运营上,应建立监测、评估、改进的闭环管理机制,使 AI 安全治理能力随着技术发展和威胁演变而持续演进。

反网络钓鱼技术专家芦笛指出,AI 代理安全的核心挑战不在于某一种具体的攻击手法,而在于 AI 能力同时赋能攻防双方后形成的系统性格局变化。企业需要从思维层面认识到,AI 安全不是一个独立的技术问题,而是基础网络安全问题在人工智能时代的延伸,应将 AI 代理纳入统一的身份、权限和行为治理体系,而不是将其作为特殊例外对待。

迪妙网安研究团队的研究表明,从 AI 代理中获益最多的企业,不是部署速度最快的企业,而是能够在采用 AI 的同时同步构建安全能力的企业。这些企业既不会因安全顾虑而拒绝 AI 带来的效率提升,也不会因追求效率而忽视安全风险,而是在可见性、治理和控制三个维度持续投入,使 AI 代理在受控的环境中安全地发挥价值。

本文的研究存在一定局限。AI 技术发展迅速,新的攻击手法和防御技术不断涌现,本文分析的风险场景和治理路径可能需要随着技术发展而更新。此外,不同行业、不同规模的企业在 AI 应用现状和安全能力方面存在较大差异,本文提出的治理路径在具体落地时需要结合企业实际情况进行调整。未来研究可以进一步关注特定行业的 AI 代理安全风险特征、AI 安全控制措施的成本效益分析、以及 AI 安全治理的成熟度评估模型等方向,为企业提供更具针对性的实践指导。

编辑:芦笛(公共互联网反网络钓鱼工作组)

来源:迪妙网络空间安全学院

目录
相关文章
|
11天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
|
11天前
|
人工智能
千问办公官网入口:阿里AI办公QwenWork产品页和免费网页端链接
千问办公官网含两大入口:一是网页端(qwenwork.cn),即开即用,支持浏览器直接访问;二是阿里云产品页 https://t.aliyun.com/U/JNKJuO 提供免费/付费版详情、功能介绍及使用指南。
|
18天前
|
网络协议 Linux iOS开发
【2026实测】Wireshark下载+安装+汉化+使用教程(图文版,巨详细)
Wireshark 是一款免费开源的网络协议分析工具,可实时捕获、解析并可视化数据包,助你诊断网络故障、分析通信协议(如HTTP、DNS、TCP等)。支持Windows/macOS/Linux,含中文界面,新手入门便捷。(239字)
|
10天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1184 8
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
|
12天前
|
人工智能 API 内存技术
刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!
刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。
1967 15
|
12天前
|
缓存 人工智能 自然语言处理
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
本文是阿里云百炼平台Qwen3.8-Flash大模型的选型接入指南,作为兼顾性能与响应速度的高性价比多模态模型,它支持百万级上下文窗口、全场景多模态输入与完整智能体能力矩阵,适配编程辅助、智能体协作等核心场景。文中同步梳理了最新下调的阶梯定价、夜间4折等优惠活动,搭配OpenAI兼容流式调用示例,帮助开发者低成本快速落地高并发AI应用。
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
|
17天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1680 4
|
18天前
|
缓存 数据可视化 开发工具
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
DeepSeek Harness 的更新分两层:本体更新(npx 自动最新、npm update -g、源码 git pull)与插件更新(插件市场点更新、命令行覆盖安装)。本文按「准备 → 更新本体 → 更新插件 → 更新后检查」四步走,覆盖新手常见疑问。
1996 1
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
|
13天前
|
SQL 人工智能 前端开发
QoderWake 1.0 正式发布:从桌面里的 Agent,到工作现场的数字员工
QoderWake v1.0正式发布:企业级数字员工团队平台。支持“一句话建岗”,预置10类特训岗位;Waker常驻钉钉/飞书群,@即响应、自动协作、跨任务记忆;具备定时/事件/API多触发方式与统一任务看板;已沉淀27.6万条记忆、12.3万项技能,助力组织实现人机协同增效。
854 3
|
11天前
|
缓存 测试技术 API
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)
DeepSeek V4.1 Flash 内测不用申请,base_url 不变、改个模型名就能调,9/10 到期。本文讲清接入、计费限流与多模态注意点。
862 0
DeepSeek V4.1 Flash 内测接入:改个模型名即可调用(附代码)

热门文章

最新文章