让运维更高效:关于ECS系统事件-阿里云开发者社区

开发者社区> 践远> 正文

让运维更高效:关于ECS系统事件

简介: 阿里云会针对ECS实例发布系统事件,当您收到阿里云计划维护的通知时,可以利用ECS系统计划事件了解与实例相关的计划维护操作,并根据您的业务特性选择合适的时间安排运维操作进行故障转移,减少对系统可靠性和业务连续性的影响。
+关注继续查看
       阿里云作为领先和值得信赖的云计算服务提供商,提供和保障计算、存储、网络资源以及底层基础设施的可用性、稳定性、安全性。根据自身战略发展和业务需求,您可以设计高可用的云上IT架构,在阿里云上选择合适的产品、服务来搭建部署业务系统,并管理其中的数据。在此基础上,通过阿里云提供的API、监控、编排等多样化手段实现快速配置资源,搭建多套环境,自动化部署等IT运维能力。

       相较于普通的IDC机房以及服务器厂商,阿里云会使用更严格的IDC标准、服务器准入标准以及运维标准,以保证云计算整个基础框架的高可用性、数据的可靠性以及云服务器的高可用性。在此基础之上,阿里云在各地域提供多可用区服务,当您需要更高的可用性时,可以利用阿里云的多可用区搭建自己的主备服务或者双活服务。对于金融等对业务连续性有更高要求的行业领域,还可以通过多地域和多可用区搭建出更高的可用性服务,并实现更高的RTO、RPO数据保障能力。对于单台ECS实例, 阿里云承诺一个服务周期内单台ECS实例的服务可用性不低于99.95%;对于单地域多可用区,阿里云承诺一个服务周期内该单地域多可用区的服务可用性不低于99.99%。为了保障高水平的服务可用性,阿里云会主动对承载ECS实例运行的物理服务器做日常维护并修复潜在的软硬件等系统故障,以持续提升系统可靠性、性能和安全防护能力,并在探测到物理服务器存在故障隐患时在线热迁移实例至健康的服务器之上,保持ECS实例的健康运行状态。

       但作为阿里云的用户,您仍有可能会收到这样的消息通知,提醒您的ECS实例由于所在物理服务器存在故障风险需要维护,阿里云设定了一个实例重启的系统计划事件,将在大约2天后重启该实例并迁移至安全的物理机运行。

       您可能会疑惑,为什么还会受到这样的信息呢?其实,这是由阿里云平台主动运维自动触发的维护通知。在主动运维过程上,某些软硬件故障会导致实例无法在线迁移,这样的情况下,阿里云会向用户发送上述通知,提醒您系统即将通过重启实例执行迁移操作。为了提升您运维ECS实例的效率和体验,阿里云会发布ECS实例系统事件功能,当您接收到通知时,可以在ECS控制台或使用OpenAPI查看系统计划事件,并根据业务的需要选择合适的时间点执行系统事件(某些情况下只能等待系统事件按计划时间执行)。这样便免去了通过工单联系客服人工介入的过程,减少风险的同时,也为基于系统事件实现自动化故障转移提供了基础,让运维更高效。

       那么ECS实例会存在哪些类型的系统事件呢?阿里云会优先发布系统主动运维触发的实例重启(Reboot)类型事件,随后会给大家提供更丰富的事件类型来满足多种运维场景。如果存在系统计划事件,ECS 控制台待处理事件按钮上会出现显著标示提醒您查看。点击该按键后进入 待处理事件 > 系统计划事件 页面,在这里您可以看到实例 ID、地域、运行状态等实例相关信息,计划执行的系统事件相关信息,推荐的用户操作和可执行操作按键。您也可以通过调用OpenAPI DescribeInstanceFullStatus手动查询或自动轮询实例的系统计划事件。

       可以想象,当ECS实例承载关键业务时,任何非预期的实例重启都有可能对系统可用性和业务连续性造成威胁或严重影响,因此我们建议您在搭建应用系统时能充分利用可用区、负载均衡等功能和服务来提升架构和服务的整体可用性。在此基础上,对于阿里云主动修复系统故障触发的系统事件,通常系统会提前48小时给您发送通知,因此您可以利用事件计划时间之前的这段用户操作窗口期,做有准备的负载和故障转移操作并重启实例,比如,在集群环境中及时将负载从有计划事件的实例上转移到其他实例,或提前备份、转移本地磁盘的数据,或主动调整负载均衡和弹性伸缩的配置,以及基于业务逻辑做有顺序的启停实例等主动运维操作,最大限度地降低实例重启对业务连续性的冲击。

       对于系统事件生命周期的状态变化和ECS实例重启系统事件的来龙去脉,用两张图来说明:
187cd426e1e911c5a6cc8f44c0d14e6e0f171e72
daaa555152c93b257a794a988b87bb245a51a837

       ECS系统事件的类型和场景会不断完善和扩展,我们希望通过这样的方式,逐步提升您在阿里云上的运维效率和体验,提供更完备的接口和服务来支持用户在阿里云上实现无忧运维和业务永续。

       关于实例系统事件的更多信息,可以参考帮助文档。对于如何在控制台和OpenAPI处理系统事件,请参阅:
       ECS主动运维事件--让你HOLD住全场,收到主动运维通知怎么办,不用工单,控制台上全搞定

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
开启预警系统 让ESET也来玩“云安全”
本文讲的是开启预警系统 让ESET也来玩“云安全”,很多用户都在使用ESET NOD32杀毒软件,其自带的强大实时监控和“启发式”杀毒技术使得用户不用担心电脑遭遇病毒、木马侵袭,为系统安全运行提供有力保障,同时,对于目前较为流行的“云安全”技术,其实细心的用户也许会发现,在ESET NOD32杀毒软件中,也同样可以实现。
913 0
企业中直播系统的融入,让办公处理更加便利
如今的互联网发展非常快,人们的起居生活出行方式与互联网都息息相关,其中也囊括了办公环节。企业需要一个多样化沟通的需求,而近年来盛行的直播系统就恰好可以满足企业这样的需求,可有效地提高办公间的沟通和办公效率。
71 0
SQL Server自动化运维系列——关于邮件通知那点事(.Net开发人员的福利)
原文:SQL Server自动化运维系列——关于邮件通知那点事(.Net开发人员的福利) 需求描述 在我们的生产环境中,大部分情况下需要有自己的运维体制,包括自己健康状态的检测等。如果发生异常,需要提前预警的,通知形式一般为发邮件告知。
1843 0
《计算机网络课程设计(第2版)》——1.2节计算机网络课程的实验教学与课程设计的关系
本节书摘来自华章社区《计算机网络课程设计(第2版)》一书中的第1章,第1.2节计算机网络课程的实验教学与课程设计的关系,作者:吴功宜 吴 英 ,更多章节内容可以访问云栖社区“华章社区”公众号查看
1296 0
业务应用系统运维服务
为客户的大型、专业的业务系统提供专业运维服务,客户将其业务系统运维工作全部或者部分交给广东励康来完成,广东励康派驻专业工程师在客户现场来完成运维工作,提高客户业务系统平台的整体运行质量和运维水平。业务范围包括大型企业、国家机关等大型业务管理软件系统。
1599 0
函数计算自动化运维实战2 -- 事件触发eip自动转移
函数计算 阿里云函数计算是一个事件驱动的全托管计算服务。通过函数计算,您无需管理服务器等基础设施,只需编写代码并上传。函数计算会为您准备好计算资源,以弹性、可靠的方式运行您的代码,并提供日志查询,性能监控,报警等功能。
1780 0
CEGUI的事件系统分析
当客户向事件系统发送了一个事件之后,即是执行EventSet::fireEvent. EventSet::fireEvent首先执行了GlobalEventSet:: fireEvent,而后才执行其自身的一个方法EventSet::fireEvent_impl,该方法才是真正进行事件处理的方法,由该方法的后缀impl即可得知了.
1389 0
+关注
践远
践行见远
6
文章
0
问答
来源圈子
更多
+ 订阅
文章排行榜
最热
最新
相关电子书
更多
《2021云上架构与运维峰会演讲合集》
立即下载
《零基础CSS入门教程》
立即下载
《零基础HTML入门教程》
立即下载