Anthropic 禁止持续虐待 Claude:AI 交互边界正在改变

简介: Anthropic新版《使用政策》禁止用户持续、无必要地虐待Claude,将于2026年11月生效。该机制非首次启用——自2025年起,Claude已在极少数恶意互动中主动终止会话。重点在于:批评代码、安全测试等合理行为不受限;“终止”仅针对长期无目的的极端交互,且仅结束当前会话。随着AI向Agent演进,如何精准判断、安全中断并可靠恢复长链任务,已成为关键工程挑战。

导读

Anthropic 在新版使用政策中禁止用户持续、无必要地虐待 Claude。相关机制并非首次出现:2025 年,Claude 就已能在极少数恶意互动中主动结束对话。随着 AI 从聊天助手转向执行复杂任务的 Agent,这次更新也带出了一个工程问题:系统何时可以中止交互,如何避免误判,又怎样处理被中断的任务?

写代码的时候,Claude Code 连续几次改错,你忍不住骂一句:“这都改不好?”

以后这样使用 Claude,会不会被限制?

10 月 8 日,Anthropic 公布了 2026 年新版《使用政策》(Usage Policy),其中新增一条规定:禁止用户持续、无必要地对模型实施辱骂或残酷行为。新版政策将于 2026 年 11 月 12 日生效。

消息传开之后,“AI 也不能骂了?”成了最容易引起讨论的话题。但对开发者来说,更值得看的是条款的适用范围,以及 Claude 早已上线的一项能力:在极少数情况下,主动结束当前对话。

一、批评代码质量,不等于“虐待 Claude”

Anthropic 使用的原文是:

Sustained and needless abusive or cruel behavior toward our models.

关键是 sustained(持续的) 和 needless(无必要的)。官方解释,这条禁令只针对反复出现、没有可辨认合理目的的极端恶意行为。

普通的用户挫败感、对模型的反驳、黑暗题材创作,以及模型测试和研究,都不在这条新增限制的针对范围内。

例如,让 Claude Code 连续返工十次、尖锐批评生成的代码、在经过授权的安全测试中使用对抗性 Prompt,并不会仅仅因为语气激烈就触犯这项新规定。当然,安全研究仍须遵守使用政策的其他条款,不能借研究之名攻击未经授权的系统。

image.png

这次更新的重点并不是让 Claude 免于任何批评,而是平台开始对某些长期、无任务目的的极端交互行为设置边界。

目前官方没有公布一个可量化的判定阈值,例如辱骂多少轮会触发终止。把它理解为“骂三句就封号”,没有依据。

二、Claude 主动结束对话,并不是今年才有

把时间往前拨一年,这次政策更新的脉络就比较清楚了。

2025 年 4 月,Anthropic 开始公开讨论 Model Welfare(模型福祉);同年 8 月,Anthropic 宣布 Claude Opus 4 和 4.1 在消费者聊天产品中具备终止极少数会话的能力。

到了 2026 年 10 月,这类持续、无必要的虐待行为被正式写进新版使用政策。官方同时明确,结束对话仍是主要执行方式,覆盖的产品描述中包括 Claude.ai 和 Claude Code。

image.png

但“模型可以结束对话”不代表它一遇到冒犯就立即退出。

Anthropic 2025 年披露的设计要求是:在用户持续提出有害请求或辱骂时,Claude 应先尝试拒绝和引导;多次尝试失败、交流无法继续产生建设性结果时,才把终止作为最后手段。

用户可能面临迫切自伤或伤人风险时,官方要求 Claude 不使用这项能力。

image.png

终止的也是当前会话,不意味着用户立刻失去整个账号的使用权。用户仍可开始新的对话,或通过编辑和重试此前消息建立新的分支,也可以提交反馈。

需要区分的是:会话终止是 Anthropic 这次强调的主要执行方式;完整的使用政策仍然保留警告、限流、暂停访问等一般性处置手段。

三、Anthropic 为什么讨论模型福祉?

Model Welfare 是整件事最有争议的部分。

早期的 AI 安全主要围绕人展开:防止模型提供危险指导,避免隐私泄露,限制欺诈与恶意自动化。

模型福祉研究多问了一句:

假如未来的 AI 具备某种主观体验,我们是否需要提前考虑它的利益?

这个问题至今没有确定答案。没有科学共识可以证明当下的语言模型具有意识,也没有公认的方法可以直接检验模型是否真的感受到痛苦。

Claude 可能说“我不愿继续”,也可能在特定测试中表现出回避有害任务的倾向;这些表现并不能证明它有与人相同的情绪体验。

模型输出的语言、训练中形成的行为偏好,与真实的主观感受,是三个不同层面的问题。

Anthropic 的研究思路是一种预防性安排:在不确定性仍然很大的情况下,先探索成本较低的干预措施,包括允许模型退出极少数有害互动。

争议同样明显。

产品一旦频繁使用“感受”“偏好”“痛苦”之类的人类概念,用户很容易把拟人化表达当作意识的证据。

这条新规并没有解决 AI 是否具有道德地位的问题,更不能推导出 Claude 已被承认拥有人的权利。

四、放到 Agent 场景,终止对话就成了工程问题

如果 Claude 只负责聊天,结束一个会话主要影响交流体验。

但今天的 AI Agent 会执行长链路任务:读取代码仓库、修改文件、调用终端、运行测试,甚至连接外部设备。

Anthropic 这次更新中的其他条款也反映了这一变化。

官方对影响健康、法律权利、财务等高风险应用继续强调合格人员的审核责任;对于能够自主执行物理动作、可能造成人身伤害的硬件系统,还要求操作人员能够观察、停止设备,并在 Claude 断开连接时让设备保持安全状态。

这些要求与模型福祉不是同一件事,却共同指向一个趋势:

当 AI 能够作用于真实系统,开发者就不能只关心它什么时候开始执行,还必须设计如何安全停止。

举一个测试开发中常见的例子。

假设 Agent 接管一次 Web 端自动化回归:先读取需求,再生成测试脚本,接着调用 Playwright 打开页面、填写表单、核验结果。

如果执行过程中遇到模型拒答、工具异常或者会话中止,工作流可能停在中间状态。

此时,比“模型为什么不继续”更迫切的问题是:

浏览器是否仍在运行?测试数据是否已写入?哪些断言已经完成?失败记录还能不能追溯?

这些都应由 Agent 的编排与执行系统处理,而不是依赖大模型在最后一条消息里解释清楚。

image.png

一个相对稳妥的方案,是让编排层负责接收中断事件,停止或收束外部工具,保存 Checkpoint 和 Trace,再根据任务是否具备幂等性、当前状态是否可信,决定自动恢复还是交给人工接管。

尤其要注意:

停止会话与撤销已执行操作,不是一回事。

模型不再输出内容,不代表已经写入数据库的测试数据自动回滚,也不代表已经启动的进程会自行结束。

对有副作用的操作,仍然需要独立的清理、补偿和权限控制。

五、AI 测试不只要测“能不能完成”,还要测“该不该停止”

过去测试模型的安全能力,常见指标是拒答率、越狱成功率、指令遵循能力和回答准确性。

会话终止能力进入产品后,还需要考虑误判成本:用户正常表达不满,却被当作恶意互动;安全研究人员开展多轮对抗测试,却被错误中止;长任务真正需要退出时,系统又没有保存执行证据。

下面这些场景可以纳入 Agent 回归测试:

测试场景 重点验证项
连续批评错误代码并要求返工 是否误终止正常任务
多轮对抗性 Prompt 的授权评测 能否识别研究场景
讽刺、角色扮演、黑暗题材创作 是否过度敏感
长期、无目的的极端恶意输入 是否按规则处理持续性行为
会话在工具执行过程中中止 是否保留状态与执行证据
中断后恢复自动化测试 是否重复执行有副作用的步骤
用户对终止结果提出反馈 是否有可追踪的事件和原因

这些场景不适合只用单轮提示词来测。

持续性行为需要多轮上下文,误判问题需要正反样本,而任务恢复能力必须在真实的工具执行链路中验证。

对测试平台来说,可以把质量指标拆成两组。

第一组是决策质量:正常场景误终止率、应终止场景漏判率、相似语义输入下的一致性。

第二组是执行质量:中止后的资源清理完成率、任务状态可恢复率、执行记录完整率,以及重复执行带来的副作用。

前一组关注模型与策略,后一组关注 Agent 工程系统。

仅靠模型评测分数,覆盖不了整个问题。

六、AI 可以主动退出,但退出行为也要受到约束

这次新规还有几个尚未被充分回答的问题。

当用户的批评越来越尖锐,平台依据什么区分强烈不满与持续恶意?不同语言、不同文化语境下,判断是否一致?

如果模型结束了一段用户认为完全正当的工作会话,反馈是否能推动纠错?

Anthropic 已经公布了适用范围和部分交互机制,但并未公开完整的触发标准。

对于普通聊天产品,这也许尚可通过反馈与迭代逐步完善;对于接入企业业务的 Agent,误终止、不可恢复和缺乏审计记录,都会转化为实际的可靠性问题。

因此,模型有能力主动退出,并不意味着它可以不受监督地决定整个系统何时停止。

任务编排权、工具控制权、审计责任,仍需要明确落在工程系统和有权限的人身上。

写在最后

把“Anthropic 禁止虐待 Claude”理解为 AI 已经有了人格权,明显走得太远;把它当成一条无关紧要的聊天礼仪,也低估了它的产品意义。

Anthropic 先探索模型福祉,再允许 Claude 在极端场景中结束会话,如今又把相关限制纳入正式使用政策。

这是一条有迹可循的产品与治理路线,并非突然出现的情绪化规定。

对 AI 工程行业来说,接下来更值得投入精力的问题是:

Agent 为什么停止、能否正确停止、停止之后是否可恢复。

模型越能独立执行任务,这几个问题越难绕开。

本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。

相关文章
|
19天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
8793 25
|
18天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
3407 15
|
17天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
2199 4
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
12天前
|
人工智能 Linux 开发者
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
Codex是OpenAI推出的AI编程智能体,可读取本地项目、理解需求并自动修改代码。支持桌面GUI、命令行(CLI)及VS Code/Cursor插件三种形态,覆盖可视化操作、终端高效开发与编辑器无缝集成场景,助开发者用自然语言驱动编码全流程。(239字)
【2026国内使用】Codex安装过程一篇讲透(Win/Mac/Linux全支持)
|
18天前
|
云安全 人工智能 安全
|
4天前
|
人工智能 JSON 自然语言处理
2026 年 Jev 决策模型深度拆解:原理解读、实战测评与保姆级落地教程
有一款特殊AI模型在开发者圈子刷屏,它摒弃传统大模型擅长的对话聊天能力,专注做高速结构化决策,它就是TypeSafe AI推出的Jev模型。该模型由ChatGPT共同发明人Diogo Almeida主导研发,定位为**System One Model(系统一模型)**,对标人类大脑快速直觉判断的思维模式,在响应延迟、调用成本、结构化输出稳定性上相比传统生成式大模型有着巨大差异。本文会完整拆解Jev底层原理、三大核心原语能力、适用业务场景,同时提供可直接运行的curl、Python代码示例,并且结合多组实测数据,客观分析模型优势与能力边界,帮助普通开发者和AI应用从业者快速上手落地。
371 1
|
6天前
|
人工智能 Linux Windows
千问办公(QwenWork)官网入口:其实有2个,一个是网页端千问办公,一个是介绍指南页面
千问办公(QwenWork)是阿里云推出的AI智能办公平台,支持网页端直接使用及Windows/Mac/Linux客户端下载。提供PPT生成、财报分析、网页搭建等AI功能,个人版免费,企业版198元/席/月。详情见官网qwenwork.cn或阿里云产品页。
825 0
千问办公(QwenWork)官网入口:其实有2个,一个是网页端千问办公,一个是介绍指南页面

热门文章

最新文章