在 HBase 集群中,Prometheus 通常监控哪些类型的性能指标?

本文涉及的产品
可观测监控 Prometheus 版,每月50GB免费额度
简介: 在 HBase 集群中,Prometheus 监控关注的核心指标包括 Master 和 RegionServer 的进程存在性、RPC 请求数、JVM 内存使用率、磁盘和网络错误、延迟和吞吐量、资源利用率及 JVM 使用信息。通过 Grafana 可视化和告警规则,帮助管理员实时监控集群性能和健康状况。

在 HBase 集群中,使用 Prometheus 监控时通常会关注以下类型的性能指标:

  1. Master 核心指标

    • 进程存在性(进程必须存在且运行正常)
    • Master 进程启动时间(masterStartTime,应大于10秒)
    • 主备状态(haState,应为1表示主或0表示备)
    • 通用队列 RPC 请求数(numCallsInPriorityQueue,应小于或等于1000)
    • 复制队列 RPC 请求数(numCallsInReplicationQueue,同上)
    • 当前打开的连接个数(numOpenConnections,应小于或等于1000)
    • 当前 Dead 的 RegionServer 个数(numDeadRegionServers,应小于或等于0)
  2. RegionServer 核心指标

    • 进程存在性(进程必须存在且运行正常)
    • 通用队列 RPC 请求数(同 Master 指标)
    • JVM 堆内内存使用率(MemHeapUsedM/MemHeapMaxM,应小于60%)
    • 可用的 VCore 占比(AvailableVCores / (AllocatedVCores + AvailableVCores ),应小于90%)
    • 可用的内存占比(AvailableGB / (AllocatedGB + AvailableGB ),同上)
    • 写入 DN 的字节速率(BytesWrittenMB,根据机器网卡带宽调整)
    • 读取 DN 的字节速率(BytesReadMB,同上)
    • 磁盘故障次数(VolumeFailures,应小于或等于0)
    • 网络错误统计(DatanodeNetworkErrors,应小于或等于0)
    • 磁盘使用率(应小于70%)
    • 磁盘读写的 await(应小于1ms)
  3. 延迟和吞吐量指标

    • 读延迟(Read Latency)和写延迟(Write Latency):衡量从 HBase 读取或写入数据所需的时间
    • RPC 延迟(RPC Latency):衡量 HBase 与客户端之间 RPC 调用所需的时间
    • 读吞吐量(Read Throughput)和写吞吐量(Write Throughput):衡量从 HBase 读取或写入数据的速率
  4. 资源利用率指标

    • 存储空间利用率(Storage Utilization)和内存利用率(Memory Utilization):衡量 HBase 存储集群中使用的存储或内存占总资源的比例
  5. JVM 使用信息

    • 监控 JVM 的堆内存使用情况,包括堆内存使用量和最大堆内存大小
  6. 功能性信息

    • 比如 Compaction Queue、Store Files 个数等

通过 Prometheus 抓取这些指标后,可以使用 Grafana 进行数据可视化,帮助管理员实时监控 HBase 集群的性能和健康状况。同时,可以设置告警规则,当某些关键指标超出预设阈值时及时通知管理员采取措施。

相关实践学习
lindorm多模间数据无缝流转
展现了Lindorm多模融合能力——用kafka API写入,无缝流转在各引擎内进行数据存储和计算的实验。
云数据库HBase版使用教程
  相关的阿里云产品:云数据库 HBase 版 面向大数据领域的一站式NoSQL服务,100%兼容开源HBase并深度扩展,支持海量数据下的实时存储、高并发吞吐、轻SQL分析、全文检索、时序时空查询等能力,是风控、推荐、广告、物联网、车联网、Feeds流、数据大屏等场景首选数据库,是为淘宝、支付宝、菜鸟等众多阿里核心业务提供关键支撑的数据库。 了解产品详情: https://cn.aliyun.com/product/hbase   ------------------------------------------------------------------------- 阿里云数据库体验:数据库上云实战 开发者云会免费提供一台带自建MySQL的源数据库 ECS 实例和一台目标数据库 RDS实例。跟着指引,您可以一步步实现将ECS自建数据库迁移到目标数据库RDS。 点击下方链接,领取免费ECS&RDS资源,30分钟完成数据库上云实战!https://developer.aliyun.com/adc/scenario/51eefbd1894e42f6bb9acacadd3f9121?spm=a2c6h.13788135.J_3257954370.9.4ba85f24utseFl
相关文章
|
1月前
|
Prometheus 运维 监控
智能运维实战:Prometheus与Grafana的监控与告警体系
【10月更文挑战第26天】Prometheus与Grafana是智能运维中的强大组合,前者是开源的系统监控和警报工具,后者是数据可视化平台。Prometheus具备时间序列数据库、多维数据模型、PromQL查询语言等特性,而Grafana支持多数据源、丰富的可视化选项和告警功能。两者结合可实现实时监控、灵活告警和高度定制化的仪表板,广泛应用于服务器、应用和数据库的监控。
158 3
|
6天前
|
Prometheus 监控 Cloud Native
如何使用Prometheus监控Docker Swarm集群的资源使用情况?
还可以根据实际需求进行进一步的配置和优化,如设置告警规则,当资源使用超出阈值时及时发出警报。通过这些步骤,能够有效地使用 Prometheus 对 Docker Swarm 集群的资源进行监控和管理。
26 8
|
2月前
|
SQL 分布式计算 Hadoop
Hadoop-37 HBase集群 JavaAPI 操作3台云服务器 POM 实现增删改查调用操作 列族信息 扫描全表
Hadoop-37 HBase集群 JavaAPI 操作3台云服务器 POM 实现增删改查调用操作 列族信息 扫描全表
33 3
|
2月前
|
分布式计算 Hadoop Shell
Hadoop-36 HBase 3节点云服务器集群 HBase Shell 增删改查 全程多图详细 列族 row key value filter
Hadoop-36 HBase 3节点云服务器集群 HBase Shell 增删改查 全程多图详细 列族 row key value filter
58 3
|
1月前
|
Prometheus 运维 监控
智能运维实战:Prometheus与Grafana的监控与告警体系
【10月更文挑战第27天】在智能运维中,Prometheus和Grafana的组合已成为监控和告警体系的事实标准。Prometheus负责数据收集和存储,支持灵活的查询语言PromQL;Grafana提供数据的可视化展示和告警功能。本文介绍如何配置Prometheus监控目标、Grafana数据源及告警规则,帮助运维团队实时监控系统状态,确保稳定性和可靠性。
140 0
|
4月前
|
Prometheus 监控 Cloud Native
【监控】prometheus传统环境监控告警常用配置
【监控】prometheus传统环境监控告警常用配置
【监控】prometheus传统环境监控告警常用配置
|
3月前
|
Prometheus 监控 Cloud Native
介绍如何使用Prometheus进行监控
介绍如何使用Prometheus进行监控
242 3
|
3月前
|
Prometheus 监控 Cloud Native
docker安装prometheus+Granfan并监控容器
【9月更文挑战第14天】本文介绍了在Docker中安装Prometheus与Grafana并监控容器的步骤,包括创建配置文件、运行Prometheus与Grafana容器,以及在Grafana中配置数据源和创建监控仪表盘,展示了如何通过Prometheus抓取数据并利用Grafana展示容器的CPU使用率等关键指标。
109 1
|
4月前
|
存储 Prometheus 监控
Grafana 与 Prometheus 集成:打造高效监控系统
【8月更文第29天】在现代软件开发和运维领域,监控系统已成为不可或缺的一部分。Prometheus 和 Grafana 作为两个非常流行且互补的开源工具,可以协同工作来构建强大的实时监控解决方案。Prometheus 负责收集和存储时间序列数据,而 Grafana 则提供直观的数据可视化功能。本文将详细介绍如何集成这两个工具,构建一个高效、灵活的监控系统。
460 1
|
4月前
|
Prometheus 监控 Cloud Native
使用Prometheus搞定微服务监控
使用Prometheus搞定微服务监控
使用Prometheus搞定微服务监控