RocketMQ 高可用创新论文入选 ACM FSE:无需复制业务数据,实现有状态服务秒级接管

简介: 面向云上有状态服务高可用,提出无需额外业务数据复制的秒级故障接管机制,在不牺牲成本和稳态性能的前提下,实现云上有状态消息服务的快速恢复。

作者:金融通


近日,阿里云消息团队发表的 Apache RocketMQ 高可用创新论文 《无业务数据复制的故障接管:面向有状态服务的协议级安全接管》(英文原名:Replication-Free Failover: Protocol-Fenced Takeover for Stateful Services)入选 FSE 2026 Industry Papers Track


ACM FSE(The ACM International Conference on the Foundations of Software Engineering)是享有盛誉的国际学术会议,被《中国计算机学会推荐国际学术会议和期刊目录》列为 CCF-A 类软件工程顶级会议。FSE 2026 于 2026 年 7 月 5 日至 9 日在加拿大蒙特利尔举行,Industry Papers Track 重点关注软件工程研究在真实工业场景中的创新与应用。


此次入选论文来自阿里云消息团队长期建设和运维大规模云上消息服务的实践。面对数千个租户隔离的 RocketMQ 有状态集群,团队提出 Replication-Free Failover,旨在低成本、高稳态性能和快速恢复之间取得更好的平衡。

FSE 2026 官方论文页面

创新亮点:不复制业务数据,也能安全接管有状态服务

云上有状态服务通常希望同时获得低成本、高稳态性能和快速恢复,但三者很难兼得。围绕这一工程难题,论文的创新主要体现在以下几个方面。

1. 无需额外业务数据复制,正常数据路径保持不变

方案继续使用单副本、单机文件系统和具备存储侧冗余能力的云块存储,不在 RocketMQ 服务层增加额外业务数据副本,也不引入额外写放大;同时无需重写 CommitLog / WAL,尽可能保留原有的成本与稳态性能优势,并最大程度保持与 Apache RocketMQ 社区版本的兼容性。

2. 协议级安全接管,并可验证所有权转移

方案利用多挂载(Multi-Attach)提前使磁盘对候选节点可见,并通过 NVMe Persistent Reservation(NVMe PR)将写权限控制下沉至存储协议层。在此基础上,引入持有者校验、原子化抢占、关键阶段标记和退避机制,避免文件系统恢复过程中写权限被再次抢占。

3. 面向本地文件系统的接管一致性闭环

方案将确认写权限、清理接管节点的旧缓存、挂载文件系统、执行文件系统日志回放与应用崩溃恢复,以及通过就绪检查恢复流量纳入同一状态机,解决共享盘对新节点可见以后,如何安全恢复持久化状态和服务的问题。

4. 基于持久化进展的去中心化故障探测

方案通过共享盘中租约(lease)记录的版本进展判断当前主节点是否仍能完成持久化,而不仅仅判断进程或者节点是否存活。因此,它能够识别 I/O 卡顿(I/O hang)等“节点仍然存活,但持久化状态已经停止推进”的故障,并减少对集中式控制面的依赖;在网络分区等场景下,则由存储协议层的写隔离保证接管后的单写安全。

5. 最小权限、可审计的生产级端到端落地

方案将 NVMe PR、缓存处理和挂载等高权限操作收敛到节点侧 Agent,业务容器无需获得系统级权限;同时将故障发现、写权限切换、应用恢复和流量恢复串联起来,形成可观测、可审计、可持续演练的端到端恢复流程。


区别于通过重构存储引擎、引入共享 WAL 和对象存储,使节点无状态化的技术路线,本方案选择保留 RocketMQ 已有的单机文件系统和正常读写语义,只重新设计故障接管路径。由于高可用机制不替换正常存储引擎,既能继续复用成熟的 CommitLog、文件系统缓存和崩溃恢复能力,也使后续新增存储特性无需为高可用路径单独重构。


由此,方案既降低了对 Broker 核心代码的侵入和改造范围,也减少了后续社区版本升级与长期维护成本,更适合已经运行在生产环境中的单主有状态服务。

Replication-Free Failover 整体架构图

评估与生产验证:从分钟级恢复压缩到秒级

论文以 Apache RocketMQ 为代表性工作负载进行评估。结果表明,该方案可以将节点故障后的恢复时间从常见 Kubernetes 单副本云盘方案的分钟级缩短至秒级,同时保持接近原生单副本部署的吞吐和延迟表现


论文还报告了方案的生产验证:系统已完成数万次灾备演练,并在生产环境运行。该工作将阿里云消息团队在节点宕机、I/O 卡顿和网络分区等真实故障中的实践,沉淀为一种适用于单主、单写有状态服务的高可用设计,为云上基础软件在成本、性能和恢复速度之间提供了新的工程化选择。


随着 AI Infra 对可靠消息传递和有状态服务的需求增长,这类高可用能力也具备进一步的复用价值。产品能力与配置说明可参见阿里云官方文档:云消息队列 RocketMQ 版实例容灾 [ 1]


面向未来,阿里云消息团队将继续围绕 Apache RocketMQ 的云原生、高可用、弹性伸缩和智能运维能力展开探索,把大规模生产经验转化为可复用的技术能力,为企业级消息系统提供更稳定、更高效、更低成本的基础设施支撑。


附论文信息:

论文题目:《无业务数据复制的故障接管:面向有状态服务的协议级安全接管》(英文原名:Replication-Free Failover: Protocol-Fenced Takeover for Stateful Services)

作者: 金融通、古崟佑、季俊涛、傅玉宝、刘涛、赖福智、蔡高扬、林清山(均来自阿里云)


论文概述: 本文面向云上单主有状态服务,提出一种无需额外业务数据复制的故障接管机制。方案保持单副本单机文件系统的正常数据路径不变,并通过存储协议层的写隔离缩短恢复链路。实验与生产实践表明,该方案能够在保持接近单副本稳态性能的同时实现秒级恢复。


相关链接:

[1] 云消息队列 RocketMQ 版实例容灾产品能力与配置说明

https://help.aliyun.com/zh/apsaramq-for-rocketmq/cloud-message-queue-rocketmq-5-x-series/security-and-compliance/instance-disaster-recovery#h3-data-ha

[2] FSE 2026 官方论文详情页

https://conf.researchr.org/details/fse-2026/fse-2026-industry-papers/25/Replication-Free-Failover-Protocol-Fenced-Takeover-for-Stateful-Services

[3] ACM Digital Library 完整论文下载

https://dl.acm.org/doi/10.1145/3803437.3805226


欢迎关注 Apache RocketMQ 中文社区https://rocketmq-learning.com/,了解 RocketMQ 最新版本、技术文章、最佳实践与社区活动。


也欢迎加入 Apache RocketMQ 开发者交流群(钉钉群号:44552972),与社区开发者一起交流 RocketMQ 在高可用、云原生架构与 AI 原生消息场景中的实践。

image.png

相关文章
|
1月前
|
人工智能 运维 Linux
凌晨告警不再慌!SysOM 巡检 Skill 一键锁定根因
凌晨两点被叫醒,还要花 40 分钟拼出根因?阿里云操作系统控制台发布的 SysOM 巡检 Skill,沉淀了内核专家的排查经验,37 秒即可生成报告,巡检发现问题后自动衔接诊断、精准定位根因。目前 SysOM 巡检 Skill 已开源,一行命令即可立即上手,欢迎体验。
187 10
|
1月前
|
Java Shell API
专为 Managed Agents 而生的 Harness 底座:AgentScope 2.0
基于 AgentScope 2.0 的 Harness 内核与 Sandbox 隔离能力,AgentScope 可以作为 Managed Agents 的底层运行时 Runtime,为其提供稳定可靠的执行环境。
|
架构师 中间件
阿里中间件首席架构师钟华:《企业IT架构转型之道:阿里巴巴中台战略思想与架构实战》新书出版(含试读PDF)!
阿里中间件首席架构师钟华:《企业IT架构转型之道:阿里巴巴中台战略思想与架构实战》新书出版!
38817 112
|
1月前
|
人工智能 弹性计算 运维
STAROps 主机智能巡检:给你的 ECS 请个 24 小时在线的 AI 医生
STAROps 主机智能巡检从事后救火转向事前防护。
140 10
|
2月前
|
存储 人工智能 运维
让 Agent 越用越准、成本越来越低:AgentLoop 的 Agent 经验自进化闭环
本文介绍 AgentLoop 如何基于真实运行轨迹自动挖掘和召回经验,在不重新训练模型的情况下,帮助企业提升 Agent 的准确率与稳定性,并降低 Token、工具调用和人工调优成本。
|
2月前
|
人工智能 自然语言处理 数据挖掘
通义千问 Token Plan 重磅上新!2.4T 参数 Qwen3.8-Max 抢先体验,夜间调用 0.2 折
千问AI推出Token Plan订阅计划,以统一Credits体系覆盖文本、图像、视频全模态,首发2.4万亿参数Qwen3.8-Max与HappyHorse1.1视频引擎;支持日间1折、夜间0.2折潮汐算力,含Harness全套工具;个人/企业双版本,大幅降低多模型调用成本与使用门槛。
|
17天前
|
人工智能 缓存 安全
模型这么多,请求该交给谁?阿里云 AI 网关智能路由,正式上线!
模型越来越多,每次请求该交给谁?AI 网关智能路由已上线:能力够是前提,更省、更快还是更适合由你选,Agent 干活中途不换脑。
|
1月前
|
消息中间件 存储 人工智能
免费送 10 张三天通票!邀你共赴 ApacheCon 2026
Community Over Code 是 Apache 软件基金会(ASF)官方全球系列大会,今年,Community Over Code Asia 2026 将于 8 月 7-9 日在北京市海淀区中关村国家自主创新示范区会议中心举行,覆盖 AI、云原生、大数据、开源社区治理等热点领域。阿里云云原生应用平台团队将携手开源社区贡献者和用户们,在消息、微服务、Web 应用与框架三大领域带来 11 个议题,欢迎大家报名参加。关注阿里云云原生公众号,在本文章评论区留言回复 ASFC+你想听的议题,前 10 名参与互动的用户将获得大会三天通票一张(价值 999 元)。
|
1月前
|
人工智能 自然语言处理 开发者
阿里云千问大模型Qwen3.8-Max、Qwen3.7-Plus、Qwen3.7-Max、Qwen3.7-Flash区别与选择参考
阿里云通义千问Qwen3.8-Max与Qwen3.7全系列核心模型展开解析,从推理能力、响应速度、上下文窗口、成本等多维度完成横向对比,清晰呈现了四款模型的能力边界与适配场景差异。文中给出了“分级路由”的实用选型策略,帮助用户避免盲目追求顶配,通过不同模型的混合部署实现体验与成本的最优平衡,同时同步了当前平台的限时5折、低门槛Token Plan订阅、新用户专属权益及最高百万级企业创新补贴等福利,为开发者与企业落地高性价比AI应用提供了完整参考指南。
|
2月前
|
人工智能 安全 调度
一周上线!信永中和基于阿里云 AgentTeams + AI 网关打造多智能体 AI 平台
信永中和携手阿里云,基于 AgentTeams 与 AI 网关搭建企业级多智能体平台,一周内完成上线!本文将完整介绍这段从知识问答走向任务执行的企业 AI 落地路径。

热门文章

最新文章