在 HBase 集群中,Prometheus 通常监控哪些类型的性能指标?

本文涉及的产品
可观测监控 Prometheus 版,每月50GB免费额度
简介: 在 HBase 集群中,Prometheus 通常监控哪些类型的性能指标?

在 HBase 集群中,使用 Prometheus 监控时通常会关注以下类型的性能指标:

  1. Master 核心指标

    • 进程存在性(进程必须存在且运行正常)
    • Master 进程启动时间(masterStartTime,应大于10秒)
    • 主备状态(haState,应为1表示主或0表示备)
    • 通用队列 RPC 请求数(numCallsInPriorityQueue,应小于或等于1000)
    • 复制队列 RPC 请求数(numCallsInReplicationQueue,同上)
    • 当前打开的连接个数(numOpenConnections,应小于或等于1000)
    • 当前 Dead 的 RegionServer 个数(numDeadRegionServers,应小于或等于0)
  2. RegionServer 核心指标

    • 进程存在性(进程必须存在且运行正常)
    • 通用队列 RPC 请求数(同 Master 指标)
    • JVM 堆内内存使用率(MemHeapUsedM/MemHeapMaxM,应小于60%)
    • 可用的 VCore 占比(AvailableVCores / (AllocatedVCores + AvailableVCores ),应小于90%)
    • 可用的内存占比(AvailableGB / (AllocatedGB + AvailableGB ),同上)
    • 写入 DN 的字节速率(BytesWrittenMB,根据机器网卡带宽调整)
    • 读取 DN 的字节速率(BytesReadMB,同上)
    • 磁盘故障次数(VolumeFailures,应小于或等于0)
    • 网络错误统计(DatanodeNetworkErrors,应小于或等于0)
    • 磁盘使用率(应小于70%)
    • 磁盘读写的 await(应小于1ms)
  3. 延迟和吞吐量指标

    • 读延迟(Read Latency)和写延迟(Write Latency):衡量从 HBase 读取或写入数据所需的时间
    • RPC 延迟(RPC Latency):衡量 HBase 与客户端之间 RPC 调用所需的时间
    • 读吞吐量(Read Throughput)和写吞吐量(Write Throughput):衡量从 HBase 读取或写入数据的速率
  4. 资源利用率指标

    • 存储空间利用率(Storage Utilization)和内存利用率(Memory Utilization):衡量 HBase 存储集群中使用的存储或内存占总资源的比例
  5. JVM 使用信息

    • 监控 JVM 的堆内存使用情况,包括堆内存使用量和最大堆内存大小
  6. 功能性信息

    • 比如 Compaction Queue、Store Files 个数等

通过 Prometheus 抓取这些指标后,可以使用 Grafana 进行数据可视化,帮助管理员实时监控 HBase 集群的性能和健康状况。同时,可以设置告警规则,当某些关键指标超出预设阈值时及时通知管理员采取措施。

相关实践学习
lindorm多模间数据无缝流转
展现了Lindorm多模融合能力——用kafka API写入,无缝流转在各引擎内进行数据存储和计算的实验。
云数据库HBase版使用教程
  相关的阿里云产品:云数据库 HBase 版 面向大数据领域的一站式NoSQL服务,100%兼容开源HBase并深度扩展,支持海量数据下的实时存储、高并发吞吐、轻SQL分析、全文检索、时序时空查询等能力,是风控、推荐、广告、物联网、车联网、Feeds流、数据大屏等场景首选数据库,是为淘宝、支付宝、菜鸟等众多阿里核心业务提供关键支撑的数据库。 了解产品详情: https://cn.aliyun.com/product/hbase   ------------------------------------------------------------------------- 阿里云数据库体验:数据库上云实战 开发者云会免费提供一台带自建MySQL的源数据库 ECS 实例和一台目标数据库 RDS实例。跟着指引,您可以一步步实现将ECS自建数据库迁移到目标数据库RDS。 点击下方链接,领取免费ECS&RDS资源,30分钟完成数据库上云实战!https://developer.aliyun.com/adc/scenario/51eefbd1894e42f6bb9acacadd3f9121?spm=a2c6h.13788135.J_3257954370.9.4ba85f24utseFl
相关文章
|
14天前
|
Prometheus 运维 监控
智能运维实战:Prometheus与Grafana的监控与告警体系
【10月更文挑战第26天】Prometheus与Grafana是智能运维中的强大组合,前者是开源的系统监控和警报工具,后者是数据可视化平台。Prometheus具备时间序列数据库、多维数据模型、PromQL查询语言等特性,而Grafana支持多数据源、丰富的可视化选项和告警功能。两者结合可实现实时监控、灵活告警和高度定制化的仪表板,广泛应用于服务器、应用和数据库的监控。
84 3
|
5天前
|
Prometheus 监控 Cloud Native
在 HBase 集群中,Prometheus 通常监控哪些类型的性能指标?
在 HBase 集群中,Prometheus 监控关注的核心指标包括 Master 和 RegionServer 的进程存在性、RPC 请求数、JVM 内存使用率、磁盘和网络错误、延迟和吞吐量、资源利用率及 JVM 使用信息。通过 Grafana 可视化和告警规则,帮助管理员实时监控集群性能和健康状况。
|
1月前
|
分布式计算 Hadoop Shell
Hadoop-35 HBase 集群配置和启动 3节点云服务器 集群效果测试 Shell测试
Hadoop-35 HBase 集群配置和启动 3节点云服务器 集群效果测试 Shell测试
68 4
|
13天前
|
Prometheus 运维 监控
智能运维实战:Prometheus与Grafana的监控与告警体系
【10月更文挑战第27天】在智能运维中,Prometheus和Grafana的组合已成为监控和告警体系的事实标准。Prometheus负责数据收集和存储,支持灵活的查询语言PromQL;Grafana提供数据的可视化展示和告警功能。本文介绍如何配置Prometheus监控目标、Grafana数据源及告警规则,帮助运维团队实时监控系统状态,确保稳定性和可靠性。
74 0
|
1月前
|
SQL 分布式计算 Hadoop
Hadoop-37 HBase集群 JavaAPI 操作3台云服务器 POM 实现增删改查调用操作 列族信息 扫描全表
Hadoop-37 HBase集群 JavaAPI 操作3台云服务器 POM 实现增删改查调用操作 列族信息 扫描全表
32 3
|
1月前
|
分布式计算 Hadoop Shell
Hadoop-36 HBase 3节点云服务器集群 HBase Shell 增删改查 全程多图详细 列族 row key value filter
Hadoop-36 HBase 3节点云服务器集群 HBase Shell 增删改查 全程多图详细 列族 row key value filter
56 3
|
2月前
|
Prometheus 监控 Cloud Native
介绍如何使用Prometheus进行监控
介绍如何使用Prometheus进行监控
196 3
|
2月前
|
Prometheus Kubernetes 监控
prometheus学习笔记之集群内服务发现环境准备
本文介绍了在Kubernetes集群中部署Prometheus监控系统的详细步骤。首先创建用于监控的命名空间,并配置Docker以顺利下载镜像。接着,通过DaemonSet方式在集群中部署Node Exporter,确保每个节点上的指标都能被收集。然后,安装并配置NFS存储类别,以便为Prometheus提供持久化存储。最后,详细展示了如何在Kubernetes中部署Prometheus服务器,包括创建相关的配置文件、部署服务、设置角色权限以及暴露服务等
|
2月前
|
Prometheus 监控 Cloud Native
docker安装prometheus+Granfan并监控容器
【9月更文挑战第14天】本文介绍了在Docker中安装Prometheus与Grafana并监控容器的步骤,包括创建配置文件、运行Prometheus与Grafana容器,以及在Grafana中配置数据源和创建监控仪表盘,展示了如何通过Prometheus抓取数据并利用Grafana展示容器的CPU使用率等关键指标。
|
2月前
|
Prometheus 监控 Cloud Native
prometheus监控ceph集群环境
文章介绍了如何使用Prometheus监控Ceph集群环境,包括启用Prometheus模块、验证模块启用成功、访问Ceph的exporter、修改Prometheus配置文件、热加载配置,以及Grafana采集数据的方法。同时,还涵盖了监控Ceph集群宿主机的步骤,如在所有节点安装node-exporter、修改Prometheus配置文件、热加载配置,以及Grafana采集数据。
142 6