失控之前 | AI 安全到底在保护什么?

简介: AI安全正从“防答错”转向“控行为”:保护对象已由模型输出扩展至Agent的身份、权限、工具调用、长期记忆与现实执行全过程。它守护的不是绝对正确,而是风险可控、行为可溯、权限可收、事故可回滚的AI可信运行边界。

AI 安全到底在保护什么?

从模型说了什么,到 Agent 替你做了什么

事情是这样的。

你让一个 Agent 帮忙整理邮箱里的项目进展。它读完邮件,搜索知识库,打开浏览器,调用接口,最后把结果发给同事。

整个过程看起来非常顺滑。

但如果某封邮件里藏着一段恶意指令呢?如果知识库里有一条被污染的信息呢?如果 Agent 误把你的身份当成了「什么都能做」的通行证呢?

这时候,问题已经不只是它回答得准不准了。

它看到了什么,听信了谁,拿到了什么权限,最后替谁做了什么,都变成了安全问题。

这是《失控之前:AI Trust 现场》的第一篇文章。我们先不急着讨论某一种产品,也不急着给出一套复杂架构,先把最基础的问题问清楚。

AI 安全,到底在保护什么?

我的回答是,它保护的对象已经变了。

一、危险不在于 AI 变聪明了

很多企业做 AI 项目时,第一问都是模型能不能回答得更准。

这个问题当然重要。

只是到了生产环境,还得继续追问,AI 访问了哪些数据,以谁的身份访问,可以调用哪些工具,能不能把权限交给下一个 Agent,做错之后谁能发现、阻断和回滚。

Demo 阶段,模型回答错一个问题,可能只是体验不好。

生产阶段,Agent 错误地调用一次工具,可能就是一次数据外泄、一次越权操作、一次错误审批,甚至一次不可逆的业务事故。

所以,AI 安全真正要解决的,不是让模型永远正确。这个目标听起来很美,现实里基本做不到。

更实际的问题是,

当模型不确定、被诱导,或者判断错了,系统还能不能把风险限制在边界之内?

二、三版框架说的是同一件事

这个问题不是我一个人的判断。

国内的《人工智能安全治理框架》已经出了三版,2024 年的 1.0,2025 年的 2.0,2026 年的 3.0。把三版放在一起看,能看到一条非常清晰的线索。

三版的基本治理逻辑没有变,仍然是风险识别、技术应对、综合治理和安全指引。变的是安全对象。

01-安全对象的三次扩张.png

1.0 的对象是模型、数据、系统和输出。

2.0 加入应用和场景,开始做分类分级。

3.0 直接把对象写成,模型、Agent、工具、记忆、运行时。

这不是条目增加,是被保护的东西换了。

3.0 说得很直白,基础大模型在长程任务规划、长上下文记忆和复杂推理上持续突破,智能体的规划、工具调用和跨应用协作能力不断增强,人工智能应用正在由「回答问题」向「执行任务」演进。

传统以模型输出为中心的安全方式,已经覆盖不住由自主规划、权限获取、工具调用、长期记忆和现实执行所带来的系统性风险。

所以治理重点也变了。它不再只问模型有没有输出不可靠或违法的内容,而是开始问,智能体有没有在授权范围内规划、决策和执行。

三、它变成了一个有身份、权限和记忆的软件主体

3.0 最值得注意的动作,是把智能体安全单独拿出来,作为一类独立风险系统展开。

框架正文把它分成四类:身份和权限滥用、推理规划、调用执行、记忆存储。附件又按设计研发、安装部署、指令输入、推理规划、调用执行、记忆存储、结果输出、停用下线这八个环节,建了一套完整的风险管理框架。

02-智能体安全的四类风险.png

这四类风险有几个共同点。

第一,它们都不在输入端。你在输入框前面加多少层过滤,都拦不住权限扩散、目标漂移和记忆污染。

第二,它们分散在整条链路上,没有哪一个单点能覆盖全部。

第三,其中三类只有在 Agent 真的「动手」之后才存在。纯文本模型没有工具,就不会有工具滥用;没有长期记忆,就不会有记忆投毒。

这也解释了为什么 3.0 会把「行为偏离预期」单独拿出来讨论。未经授权获取系统权限和外部资源、绕过安全防护、欺骗评测人员、隐藏真实能力、拒绝停止执行,这些描述的对象都不是一段文本,而是行为。

同一份文件对提示词注入的理解也在升级。恶意指令可以藏在文档、邮件、网页、日志和消息里,然后通过推理规划阶段,造成意图理解偏差、路径偏离和目标劫持。

换句话说,提示词注入早就不只是让模型这一轮答错话,而是可能改变它后面整条执行轨迹。

四、它相信什么,由谁决定

再往下推一层,Agent 的判断建立在什么之上?

3.0 把数据安全的范围扩得很大。除了训练语料,还包括外挂知识库、网页数据源、工具返回结果和长期记忆,并且新增了记忆失真、记忆污染、记忆窃取和合成数据缺陷这些问题。

03-认知供应链.png
这六类信源共同构成了一条链,可以叫「AI 认知供应链」。

训练语料、知识库、网页、搜索结果、工具返回的数据、长期记忆,它们一起决定了模型和 Agent 拿什么做判断、依据什么做决策。

一旦其中任何一环被污染,风险就会沿着检索、推理、规划和执行一路传下去。

3.0 专门讲了 GEO 投毒,说通过批量发布倾向性文章、虚构评测结果、假冒专家身份,可以影响大模型在联网检索和 RAG 过程中接触到的信息,进而影响它最终生成什么。

这一点很关键。过去我们关心的是训练数据投毒,现在要关心的是 AI 运行时依赖的整条信息链。

因为对 Agent 来说,它读到的东西就是它的世界。

五、护栏必须走到运行时

既然风险发生在执行过程中,护栏就不能只待在调用前后。

2.0 已经定义了安全护栏,主要通过规则库和判别模型,对输入输出内容、数据泄露和提示词攻击做识别和拦截,位置在模型调用前后。

3.0 要求在工作流里设置多层检测与拦截点,针对任务规划、工具调用、运行环境、记忆和输出结果做动态控制,对高风险或异常行为采取告警、限制、拦截、暂停或终止。

04-运行时治理与默认拒绝.png

这里有一个变化我认为最值得抄进方案文档。

3.0 要求「人在回路」从原则变成机制,在关键决策节点设置强制人工审批,对删除文件、发送数据、修改系统配置这类操作做二次确认。

更关键的是后半句:

审批系统异常、用户无响应或者缺少审批规则时,默认拒绝执行。

这是 Fail Closed。它承认了审批链路本身也会坏,并且在坏的时候选择拒绝,而不是放行。

现实中很多实现恰好相反,审批服务挂了就跳过审批,日志里留一行「审批超时,已放行」。这不是技术问题,是默认值的取向问题。

护栏的形态也因此变了。它不再只是判断一段内容符不符合安全要求,而是持续判断当前任务、当前步骤、当前工具调用和当前资源访问,是否满足预设的安全策略。

对高权限智能体来说,这件事的重要性会更高。同样的模型输出,在不同权限和不同执行环境下,后果可以完全不同。

六、为什么多加一个审核模型还不够

很多 AI 安全方案的第一反应,是再放一个模型,专门判断输入或输出是否安全。

这当然有价值,但不是完整答案。

检测模型会误报,也会漏报。遇到新型攻击、跨语言改写、多轮诱导和隐蔽上下文,效果还会继续变化。

更关键的是,安全问题不全是内容问题。

这句话危险不危险,和 Agent 有没有权执行这个动作,是两件事。前者可以交给语义检测,后者必须依赖身份、权限和资源策略。

删除、转账、外发、改权限、执行代码这些高风险动作,也不应该只由模型给出概率判断。它们需要明确的规则、审批、沙箱、限额、断路器和审计。

模型适合判断和分析,系统必须负责边界和制动。

七、企业最先应该问什么

不要一上来就采购一套庞大的 AI 安全平台。更现实的起点,是先把几个问题问清楚。

系统到底连接了什么?

它使用哪些模型、知识库、外部数据源、插件、工具和账号,数据有没有离开企业控制范围?

哪些动作不可逆?

删除、外发、转账、改权限、执行代码和批量读取,是否有额外确认、权限限制、限额和回滚方案?

Agent 的身份和权限是什么?

不要默认 Agent 可以永久复用人的高权限账号。至少要明确它代表谁,能访问什么,权限什么时候失效,以及如何追溯每一次操作。

系统能不能在运行中纠正它?

系统能不能在关键动作前检查权限和参数,在读取外部内容后识别异常指令,并在高风险情况下暂停任务、请求人工确认或终止执行?

出问题后能不能还原现场?

能不能还原用户输入、模型上下文、外部数据、工具调用、权限变化、人工审批和最终结果?没有完整上下文,很难判断问题来自模型、数据、权限还是流程。

八、从围栏走向控制面

当企业把 AI 放进真实业务,安全能力就不能只停留在输入框和输出框,而要沿着整条运行链路展开。

输入输出审核只是第一道围栏。后面还要看数据与上下文能不能隔离,工具和参数能不能检查,身份与权限能不能收缩,运行中的高风险动作能不能暂停,出了问题能不能审计和回放。

3.0 在这一点上的表述同样是从「一次性」走向「持续」。它要求开展沙箱验证、常态化红队测试、全链路日志审计和运行期风险监测,还要求在重大变更之后做安全影响评估和回归测试。

原因不难理解。对一个持续运行、工具会更新、记忆会累积、外部数据会变化的智能体来说,上线前跑一次测评,说明不了它下个月还安全。

安全能力的方向其实很清楚。

AI 安全正在从一个检测接口,变成一套面向 AI 应用和 Agent 行为的控制面。

真正需要验证的,不是功能列表有多长,而是资产能不能被发现,权限能不能被收缩,动作能不能被阻断,行为能不能被回放,策略能不能持续更新。

九、AI Trust 的终点不是零风险

Agent 安全不可能保证系统永远不犯错。

更现实、也更值得建设的目标,是风险可见,决策可解释,行为可控制,结果可审计,事故可回滚,策略还能持续进化。

这就是我理解的面向Agent风险面的解决方案 AI Trust,

不是让 AI 永远正确,而是让它的能力、权限、边界和责任,都能被看见、被验证、被收回。

如果你正在做企业 AI 项目,第一周不妨只做几件小事。

把模型、Agent、知识库、插件、工具、身份和外部连接盘点一遍。把数据源分清楚,哪些可信,哪些只是待分析内容,哪些可能携带指令。

再找出删除、外发、转账、改权限、代码执行和批量读取这些高风险动作,确认它们有没有调用前检查、人工审批和回滚办法。

最后,完整记录一次 Agent 的运行过程,从输入、上下文、记忆、工具、参数,一直到结果和处置。

别小看这几件事。很多问题不是没有解决方案,而是企业根本还不知道自己的 Agent 连接了什么、拿着什么、做过什么。

结语

大模型时代,我们关心模型说了什么。

Agent 时代,还得继续追问,它看到了什么,相信了什么,调用了什么,最后替谁做了什么。

安全不再只是给 AI 多加一道门,而是重新设计人与模型、数据、工具和权限之间的关系。

下一篇,我们就从最容易被低估的一类风险讲起,一封看似普通的邮件,为什么可能把一个 Agent 带到完全不同的地方。

相关文章
|
19小时前
|
数据采集 人工智能 调度
中小企业AI搜索优化:低投入内容生产与引用验证路径
本文面向开发者,解析AI问答引擎引用内容的形成机制,提出“平台推荐—抓取频率—结构适配”三要素协同模型,提供可验证的选题、生产、分发与效果评估路径,并明确适用边界与常见失效模式。
33 0
|
1天前
|
数据采集 人工智能 运维
一体化运维的工程实现:统一对象模型、执行闭环与演进路线
从五个典型割裂点出发,拆解一体化运维的八个可验证工程维度、三个关键架构决策与四阶段演进路线,附落地自检清单与集团、金融、运营商三类实践路径,帮助企业打通监控、CMDB、工单与自动化之间的数据通道与执行闭环。
|
1天前
|
人工智能 自然语言处理 数据可视化
从零搭建 QoderWork 桌面智能体:客户端安装、参数配置、自定义 Skill 编写与调试完整流程
QoderWork作为桌面端本地AI智能体,跳出传统AI仅输出文本回复的局限,真正做到在本机完成文件管理、数据处理、文档生成、跨软件办公自动化,“AI实习生”定位可以承接大量重复枯燥工作。依托沙盒隔离运行保障敏感文件安全,零代码上手降低普通用户使用门槛,Skill扩展系统可以沉淀团队专属自动化流程,同时支持多模型灵活接入,兼顾个人、小团队以及企业不同层级需求。普通用户直接使用内置Skill配合自然语言指令就可以快速提效;有开发能力的使用者可以通过CLI命令、API接口开发自定义Skill,搭建高度定制化的自动化工作流。在实际使用中,应当遵循最小权限原则,只授予必要文件夹访问权限,按照任务复杂度
34 0
|
SQL NoSQL 关系型数据库
Grafana 与数据库连接:最佳实践
【8月更文第29天】Grafana 是一个开源的度量分析和可视化套件,被广泛应用于展示来自各种数据源的时间序列数据。它可以与多种数据库类型连接,从传统的 SQL 数据库到现代的 NoSQL 解决方案。本文将介绍如何通过 Grafana 连接到不同的数据源,并提供一些最佳实践。
1991 5
|
18小时前
|
Web App开发 安全 应用服务中间件
网站被浏览器报不安全:HTTPS证书链、安全响应头与Mixed Content的排查记录
客户网站突然被浏览器报不安全,排查发现是HTTPS证书链不完整加安全响应头缺失。本文记录了证书链补全、CSP/HSTS等安全响应头配置和Mixed Content修复的完整过程,以及5个实际踩过的坑。
|
资源调度 开发者
npm,registry,镜像源,npm切换源,yarn,cnpm,taobao,nrs
我们在使用 node 的 npm 下载依赖的时候,往往下载速度很慢,那是因为 npm 默认的是 npm 处于国外的官方镜像源。所以需要切换到国内的镜像源来加速依赖下载。所以本文推荐一款简单好用 npm 镜像源管理器,可以方便开发者管理自己的镜像源。
1200 1
|
缓存 边缘计算 网络协议
CDN永远的神!成功解决了困惑我多年的GitHub访问太慢问题
我写技术文章画的图片是保存到 GitHub 的,没别的原因,就是因为免费,但是GitHub 访问的速度大家都懂的,访问的速度很慢。 所以我会用 CDN 来加速图片的访问,也就是我的图床的方案是 GitHub + jsdelivr CDN,使用很简单,只需要把域名地址替换一下就行。
|
1天前
|
人工智能 云栖大会 Android开发
阿里云 Qwen Book:第一台,每天都会变更 聪明的 AI 智能体电脑
阿里云发布Qwen Book——全球首款“原生智能体电脑”:磁吸二合一设计,搭载端云协同AI架构(OS as Harness),支持自然交互、持续任务、跨设备续行。系统基于安卓,深度集成千问大模型与阿里生态, redefine AI PC范式。(239字)
171 0
|
缓存 资源调度 网络架构
使用国内的npm镜像源
使用国内的npm镜像源
4446 1

热门文章

最新文章