两招玩转阿里云系统事件监控

本文涉及的产品
性能测试 PTS,5000VUM额度
注册配置 MSE Nacos/ZooKeeper,118元/月
服务治理 MSE Sentinel/OpenSergo,Agent数量 不受限
简介: 两招玩转阿里云系统事件监控,教你如何快速使用云监控监控阿里云重要系统事件。

作者:田异常(昔今)


背景介绍


在当今快速发展的数字化时代,IT 系统和应用程序对业务运营至关重要。为了确保顺畅的性能、可靠性和安全性,IT 团队依靠监控事件来实时检测、分析和响应问题。监控事件是指任何影响 IT 系统正常运作的事件,例如服务器崩溃、网络中断或应用程序错误。这些事件可能对业务连续性、客户满意度和收入产生重大影响。


具体来说,作为阿里云监控系统中的重要组成部分,与监控指标不同,监控指标一般指一种数值型的监控纬度,一般需要配合设置阈值来进行监控来表达某一个监控含义,比如 CPU 使用率超过 60%。但是系统事件一般情况下具有完备的上下文信息,在阿里云体系中常用以描述服务的状态或者状态变化,常见如以下场景:


1. 系统运行中的一些关键状态事件,比如 ECS 系统错误重启、弹性伸缩失败、IOT QPS 达到上限。

2. 记录和审计,比如投递 OSS 失败。

3. 系统连续性问题,比如 DDos 黑洞进行中。

4. 重要安全事件,比如 安全告警:异常网络连接(提醒)。


目前大部分的云服务服务已经完成接入云监控,具体详情可以参加下面文档:https://help.aliyun.com/zh/cms/user-guide/appendix-2-system-events?spm=5176.2020520111.console-base_help.dexternal.3d6d6610UEXzUw#concept-2500373


监控好这些系统事件对于用户是一件非常重要的事情。


云监控事件订阅设计初衷


在系统事件订阅功能上线之前,云监控是通过设置报警规则来实现对系统事件的监控,但是在使用中,慢慢透露出一些不足,包括:监控方式的不灵活、不能支持黑名单、通知内容格式僵化等等。


通过对之前的用户需求分析,我们设计了新的云监控事件订阅用来以实现以下功能:


1. 通过灵活的订阅配置,支持系统事件或阈值事件,支持从产品、事件级别、事件名称、事件资源,事件内容的筛选;支持筛选的黑白名单操作等等;

2. 通过分组合并降噪,可以实现产品级,事件级,资源级等等级别的报警合并,然后通过条件降噪(固定时长内发生超过某个阈值事件数量)来控制报警的有效性,避免大量重复报警造成报警风暴;

3. 对于合并降噪后的有效报警通知,云监控可以直接推送到邮件、电话、短信、钉钉、企业微信等

4. 支持通过灵活定制通知模版来满足用户自身的业务需求,用户可以通过配置自己的模版,来实现个性化的通知格式定制;

5. 定制了自定义的通知模版,可以在订阅规则上通过自定义通知方式,给具体的通知渠道指定通知的级别和模板;

6. 还可以通过通知模板自定义推送的数据格式,通过我们在集成与推送,直接讲报警数据转换为用户需要的格式,推送到消息服务 MNS、日志服务 SLS、函数计算 FC 和 Webhook。


典型云监控场景介绍


下面,我们通过两个典型的用户场景来介绍如何使用云监控事件订阅:


场景 1:多运维团队场景

1. 用户使用了阿里云 ECS RDS REDIS SLB 等云服务;

2. 用户有两个独立运维团队,分别运维 ECS SLB 和 RDS REDIS;

3. 用户希望监控每个团队监控团队自己独立的服务;

4. 对于紧急的电话报警,两个团队需要相互 backup,当一个团队电话打不通的时候,通知另外一个团队;

5. 需要排除掉一些预发和测试环境的实例。


具体的操作步骤如下:

1. 进入事件中心界面,点击创建订阅策略。

image.png

2. 在弹出的窗口中,按照需求设置我们的订阅配置。

image.png

我们这里设置了订阅的说明如下:

1 ) 范围是 ECS 和 RDS 的所有 CRTICAL 级别事件,再排除掉其中的测试和预发的相关资源(根据资源名称排除);

2) 订阅好的报警,我们希望按照不同的产品来进行合并通知,这样 RDS 的事件和 ECS 的事件会被作为独立的报警发送通知给用户;

3) 设置了 5 分钟内,每个产品(我们选择的合并字段)下需要连续收到 5 个事件才会通知,通知一次之后 5 分钟内不再重复通知。


3. 设置好了订阅配置,下面我们来配置通知。

image.png

在下面的通知配置中,我们可以选择已经有的通知配置,也可以选择创建一个新的通知配置,这里我们以创建新的通知配置为例,点击创建通知配置之后,弹出如下对话框:

image.png

最简单的情况,我们可以直接选择通知到某一个组。


对于一些非常关键的报警,为了防止电话拨打没有接通的情况,我们还可以配置电话报警备选通知组,当上面配置的所有电话报警联系人都没有接通电话的情况下,将按照定义的备份电话报警联系组顺序,每三分钟逐个通知备份电话联系组,直到电话接通或者所有备份联系组都通知完成。


如果用户需要按照不同严重级别发送给不同的人,也可以选择按照严重级别独立通知联系组,如下图:

image.png

4. 设置好了通知接受对象后,我们还可以继续对通知方式进行定制。


如果用户希望对于报警方式进行进一步的定制,可以通过自定义通知方式来实现。

image.png

这里,我们可以对报警通知的消息模版进行选择,可以定义每个报警级别通知的渠道,来实现用户定制化报警的需求。


5. 设置好了通知后,如果对于一些报警,我们希望推送到我们自己的系统中,我们可以使用推送和集成来进行配置。

image.png

点击添加渠道,在弹出的对话框中选择我们对应的渠道进行推送,我们这里以 webhook 为例。

image.png

通过设置具体的推送目标和方式,可以实现数据推送到用户服务的需求。


6. 到这里订阅和通知的配置基本就完成了,但是用户如果有需要自定义通知模板的情况,来满足自定义的通知需求,配置通知模版的方式如下:


进入通知模版界面,点击创建通知模版。

image.png

模板配置相对比较复杂,建议参考我们预先提供的模板,在基础上修改,然后通过我们的预览功能来验证配置模版是否符合预期,预览完成后,还可以用右上角的小飞机按钮来发送一次测试通知,最终效果发送到用户的真实接收方来验证最终效果。


模版修改好后,可以在订阅界面的自定义通知方式的位置,修改通知方式,然后选择通知模版即可。

image.png

场景 2:使用应用分组实现灵活订阅能力

应用分组是云监控里面的一个重要监控概念,用来描述一组有关联的云资源,比如 ECS 实例、RDS 实例、SLB 实例等。应用分组可以监控应用组中资源的状态,当资源状态发生变化时,应用组会收到通知。我们就以应用组为例,介绍如何使用应用组监控阿里云系统事件。


进入云资源监控 -> 应用分组

然后点击你需要进行监控的分组,出现如下界面:

image.png

1. 先设置这个分组的联系人组;

2. 点击开启系统事件订阅;两步操作,非常简单。


至此,一个最简单的应用分组订阅已经完成,它会监控当前分组下资源上报的所有 CRTICAL 和 WARNING 的资源,并通知设置的联系组。


3. 如果我们还需要把事件推送到用户服务,通过点击事件订阅后的通知详情,然后在弹出窗口中添加渠道即可把已经定义好的推送渠道引用进来。

image.png

写在最后


上面是两种典型的订阅系统事件的场景介绍,在这个场景的基础上,用户可以扩展到自己的场景中,来实现灵活的订阅通知能力,通过我们的模版,订阅来满足自己的监控需求。


点击此处,体验云监控产品。

相关实践学习
2分钟自动化部署人生模拟器
本场景将带你借助云效流水线Flow实现人生模拟器小游戏的自动化部署
7天玩转云服务器
云服务器ECS(Elastic Compute Service)是一种弹性可伸缩的计算服务,可降低 IT 成本,提升运维效率。本课程手把手带你了解ECS、掌握基本操作、动手实操快照管理、镜像管理等。了解产品详情: https://www.aliyun.com/product/ecs
相关文章
|
7月前
|
弹性计算 运维 监控
动态服务器监控与通知系统
【4月更文挑战第30天】
68 0
|
7月前
|
监控 数据安全/隐私保护 iOS开发
服务器监控新利器:ServerBee带你看透服务器运行状态
服务器监控新利器:ServerBee带你看透服务器运行状态
173 0
|
7月前
|
安全 前端开发 PHP
医院安全不良事件报告管理系统源码 包括护理相关事件、医疗相关事件、药件相关事件、设备相关事件、院感相关事件、输血相关事件、医技相关事件、安保后勤事件、信息相关事件
医院安全不良事件报告管理系统源码 包括护理相关事件、医疗相关事件、药件相关事件、设备相关事件、院感相关事件、输血相关事件、医技相关事件、安保后勤事件、信息相关事件
88 0
|
存储 安全 数据安全/隐私保护
医院不良事件系统源码:支持11大类不良事件上报、审核处理、分析改进
医疗相关事件:(手术事件,麻醉事件,诊疗相关事件,医德医风相关,病案管理事件,院内不预期心跳停止事件, 给药错误,近似给药错误,医嘱或处方错误)
118 0
|
安全 数据挖掘 BI
医疗安全(不良)事件管理系统源码 不良事件上报系统
医疗安全(不良)事件管理系统,主要包括对上报事件的保存、审批、修改及基本事件的统计分析等功能。 随着对患者安全关注度的逐渐提高,对于医院可能存在的各类不良事件进行上报和处理,对数据进行统计和分析,完成对事件的持续改进和整体风险评估,有效预防不良事件再次发生。 医疗安全(不良)事件管理,让上报者更加准确、快捷的将不良事件内容报告给相关管理人员,使管理者系统地收集资料,并通过深入分析和学习,寻找管理中的薄弱环节,完善系统结构,最终有效预防不良事件再次发生。
145 0
|
运维 监控 算法
事件日志分析算法:提升上网行为管理软件的智能监控
随着互联网的快速发展,网络安全和上网行为管理变得越来越重要了。不少企业和组织为了维护网络的安全、稳定性,还有员工的工作效率,都开始使用上网行为管理软件。这些软件的作用就是监控、分析和控制员工的上网行为,帮助组织管理网络资源,以免潜在的网络威胁和数据泄漏。其中,事件日志分析算法发挥了关键作用,它们有各种各样的优点和用途,真的非常实用。接下来,就让我们来看看,事件日志分析算法在这方面有哪些厉害的地方以及怎么用吧!
209 0
|
编解码 计算机视觉 Python
2023年电赛---运动目标控制与自动追踪系统(E题)关于网友的问题回复
2023年电赛---运动目标控制与自动追踪系统(E题)关于网友的问题回复
433 0
|
安全 BI
不良事件上报系统源码,医院不良事件管理系统源码
技术架构:前后端分离,仓储模式,BS架构,有演示,已在多家医院完美运营。 相关技术:PHP+vscode+vue2+element+laravel8+mysql5.7 覆盖了医院内部所有不良事件种类的上报,包括医疗、药品、护理、设备、院感、输血、医技、安保后勤、信息等。同时是对各类医院安全不良事件进行分类统计,系统采用大量的预设项,提升报告效率。实现对不良事件的有效监营和控制。
289 0
不良事件上报系统源码,医院不良事件管理系统源码
|
人工智能 运维 Prometheus
搞定监控!我全靠这个超牛逼的告警管理平台
你可能也遇到过这样的场景: 在一个惬意的周六夜里,运维郭哥正在梦里神游,正美着呢,然而领导突然一通电话打过来,说服务器崩了,给你5分钟时间马上恢复! 毫无疑问,服务器出问题了,但郭哥没收到告警,错过了黄金抢救时间!还被领导先发现了问题! 于是郭哥背了锅,开始修复问题,时间一点一滴地逝去,领导时不时催一下进度,一个愉快的周末就这样没了! 试想一下,如果郭哥及时收到告警会怎么样?也许可以把故障影响降到最低,甚至可以在故障没发生前把服务器重启一下,神不知鬼不觉,然后悠闲地度过周末!
|
消息中间件 Prometheus 监控
监控、链路追踪、日志的区别,傻傻分不清?
对于一个系统来说,监控、链路追踪、日志的这三者需求都是必然存在的,而有的时候我们会搞不清楚这三者相互之间是什么关系。 我之前在做系统设计的时候也考虑过,是不是有必要引入那么多组件,毕竟如果这三者完全分开每一个一项的话,就有三个组件了(事实上就是:Prometheus+Grafana、Jaeger、ELK)。
643 0