文档备案控制台

开发者社区数据库文章正文

Hbase 之 HBase 的整体架构

2017-11-12 996

版权

版权声明：

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

HBase 系统架构图

组成部件说明
　　Client：
使用HBase RPC机制与HMaster和HRegionServer进行通信
Client与HMaster进行通信进行管理类操作
Client与HRegionServer进行数据读写类操作
　　Zookeeper：
Zookeeper Quorum存储-ROOT-表地址、HMaster地址
HRegionServer把自己以Ephedral方式注册到Zookeeper中，HMaster随时感知各个HRegionServer的健康状况
Zookeeper避免HMaster单点问题
　　HMaster：
HMaster没有单点问题，HBase中可以启动多个HMaster，通过Zookeeper的Master Election机制保证总有一个Master在运行
主要负责Table和Region的管理工作：
1 管理用户对表的增删改查操作
2 管理HRegionServer的负载均衡，调整Region分布
3 Region Split后，负责新Region的分布
4 在HRegionServer停机后，负责失效HRegionServer上Region迁移
　　HRegionServer：
HBase中最核心的模块，主要负责响应用户I/O请求，向HDFS文件系统中读写数据

　　

　　HRegionServer管理一些列HRegion对象；
每个HRegion对应Table中一个Region，HRegion由多个HStore组成；
每个HStore对应Table中一个Column Family的存储；
Column Family就是一个集中的存储单元，故将具有相同IO特性的Column放在一个Column Family会更高效

　　HStore：
HBase存储的核心。由MemStore和StoreFile组成。
MemStore是Sorted Memory Buffer。用户写入数据的流程：

　　

　　Client写入 -> 存入MemStore，一直到MemStore满 -> Flush成一个StoreFile，直至增长到一定阈值 -> 触发Compact合并操作 -> 多个StoreFile合并成一个StoreFile，同时进行版本合并和数据删除 -> 当StoreFiles Compact后，逐步形成越来越大的StoreFile -> 单个StoreFile大小超过一定阈值后，触发Split操作，把当前Region Split成2个Region，Region会下线，新Split出的2个孩子Region会被HMaster分配到相应的HRegionServer上，使得原先1个Region的压力得以分流到2个Region上。
由此过程可知，HBase只是增加数据，有所得更新和删除操作，都是在Compact阶段做的，所以，用户写操作只需要进入到内存即可立即返回，从而保证I/O高性能。

　　HLog
引入HLog原因：
在分布式系统环境中，无法避免系统出错或者宕机，一旦HRegionServer意外退出，MemStore中的内存数据就会丢失，引入HLog就是防止这种情况
工作机制：
每个HRegionServer中都会有一个HLog对象，HLog是一个实现Write Ahead Log的类，每次用户操作写入Memstore的同时，也会写一份数据到HLog文件，HLog文件定期会滚动出新，并删除旧的文件(已持久化到StoreFile中的数据)。当HRegionServer意外终止后，HMaster会通过Zookeeper感知，HMaster首先处理遗留的HLog文件，将不同region的log数据拆分，分别放到相应region目录下，然后再将失效的region重新分配，领取到这些region的HRegionServer在Load Region的过程中，会发现有历史HLog需要处理，因此会Replay HLog中的数据到MemStore中，然后flush到StoreFiles，完成数据恢复。

　　HBase存储格式
HBase中的所有数据文件都存储在Hadoop HDFS文件系统上，格式主要有两种：
1 HFile HBase中KeyValue数据的存储格式，HFile是Hadoop的二进制格式文件，实际上StoreFile就是对HFile做了轻量级包装，即StoreFile底层就是HFile
2 HLog File，HBase中WAL（Write Ahead Log）的存储格式，物理上是Hadoop的Sequence File

　　HFile

　　

　　图片解释：
HFile文件不定长，长度固定的块只有两个：Trailer和FileInfo
Trailer中指针指向其他数据块的起始点
File Info中记录了文件的一些Meta信息，例如：AVG_KEY_LEN, AVG_VALUE_LEN, LAST_KEY, COMPARATOR, MAX_SEQ_ID_KEY等
Data Index和Meta Index块记录了每个Data块和Meta块的起始点
Data Block是HBase I/O的基本单元，为了提高效率，HRegionServer中有基于LRU的Block Cache机制
每个Data块的大小可以在创建一个Table的时候通过参数指定，大号的Block有利于顺序Scan，小号Block利于随机查询
每个Data块除了开头的Magic以外就是一个个KeyValue对拼接而成, Magic内容就是一些随机数字，目的是防止数据损坏

　　HFile里面的每个KeyValue对就是一个简单的byte数组。这个byte数组里面包含了很多项，并且有固定的结构。

　　

　　KeyLength和ValueLength：两个固定的长度，分别代表Key和Value的长度
Key部分：Row Length是固定长度的数值，表示RowKey的长度，Row 就是RowKey
Column Family Length是固定长度的数值，表示Family的长度
接着就是Column Family，再接着是Qualifier，然后是两个固定长度的数值，表示Time Stamp和Key Type（Put/Delete）
Value部分没有这么复杂的结构，就是纯粹的二进制数据

　　HLog File

　　

　　HLog文件就是一个普通的Hadoop Sequence File，Sequence File 的Key是HLogKey对象，HLogKey中记录了写入数据的归属信息，除了table和region名字外，同时还包括 sequence number和timestamp，timestamp是“写入时间”，sequence number的起始值为0，或者是最近一次存入文件系统中sequence number。
HLog Sequece File的Value是HBase的KeyValue对象，即对应HFile中的KeyValue 。

文章可以转载，必须以链接形式标明出处。

分类: hadoop

本文转自张冲andy 博客园博客，原文链接： http://www.cnblogs.com/andy6/p/7452381.html ，如需转载请自行联系原作者

文章标签：

云数据库HBase版

微服务引擎

分布式数据库

Hbase

存储

分布式计算

Hadoop

负载均衡

关键词：

hbase架构

云数据库HBase版架构

架构整体

云数据库HBase版整体

技术小美

目录

相关文章

赵渝强老师

|

存储缓存分布式数据库

【赵渝强老师】HBase的体系架构

HBase是一种基于BigTable思想的列式存储NoSQL数据库，适合数据分析与处理。其主从架构包含HBase HMaster、Region Server和ZooKeeper。HMaster负责Region分配及表管理；Region Server执行数据读写操作，并包含WAL预写日志、Block Cache读缓存和MemStore写缓存；ZooKeeper维护集群状态并协调分布式系统工作。通过视频讲解与架构图示，详细解析各组件功能与协作机制。

赵渝强老师

828 11 12

未来AI笔记

|

存储分布式数据库数据库

Hbase学习二：Hbase数据特点和架构特点

Hbase学习二：Hbase数据特点和架构特点

未来AI笔记

771 0 0

技术自由圈/原疯狂创客圈

|

存储监控分布式数据库

百亿级存储架构： ElasticSearch+HBase 海量存储架构与实现

本文介绍了百亿级数据存储架构的设计与实现，重点探讨了ElasticSearch和HBase的结合使用。通过ElasticSearch实现快速检索，HBase实现海量数据存储，解决了大规模数据的高效存储与查询问题。文章详细讲解了数据统一接入、元数据管理、数据一致性及平台监控等关键模块的设计思路和技术细节，帮助读者理解和掌握构建高性能数据存储系统的方法。

技术自由圈/原疯狂创客圈

2224 0 0

百亿级存储架构： ElasticSearch+HBase 海量存储架构与实现

武子康

|

存储分布式计算 Hadoop

Hadoop-33 HBase 初识简介项目简介整体架构 HMaster HRegionServer Region

Hadoop-33 HBase 初识简介项目简介整体架构 HMaster HRegionServer Region

武子康

271 2 3

赵渝强老师

|

存储缓存监控

【赵渝强老师】HBase的体系架构

本文介绍了HBase的体系架构，包括HMaster、RegionServer和ZooKeeper的主要功能。HMaster负责Region的分配和管理，RegionServer处理数据的读写操作，ZooKeeper维护集群状态并协调分布式系统的运行。文章还详细解释了Region、WAL预写日志、Block Cache读缓存和MemStore写缓存的作用。

赵渝强老师

870 0 0

穿过生命散发芬芳

|

监控 Kubernetes 安全

Istio整体架构解析

【7月更文挑战第17天】Istio整体架构分为数据平面（Data Plane）和控制平面（Control Plane）两部分

穿过生命散发芬芳

563 2 2

游客zn7mvnkypuy76

|

存储 SQL 分布式计算

技术心得记录：深入学习HBase架构原理

技术心得记录：深入学习HBase架构原理

游客zn7mvnkypuy76

461 0 0

蒋星熠Jaxonic

|

8月前

|

Cloud Native Serverless API

微服务架构实战指南：从单体应用到云原生的蜕变之路

🌟蒋星熠Jaxonic，代码为舟的星际旅人。深耕微服务架构，擅以DDD拆分服务、构建高可用通信与治理体系。分享从单体到云原生的实战经验，探索技术演进的无限可能。

蒋星熠Jaxonic

810 4 6

微服务架构实战指南：从单体应用到云原生的蜕变之路

无糖可乐嘟嘟

|

弹性计算 API 持续交付

后端服务架构的微服务化转型

本文旨在探讨后端服务从单体架构向微服务架构转型的过程，分析微服务架构的优势和面临的挑战。文章首先介绍单体架构的局限性，然后详细阐述微服务架构的核心概念及其在现代软件开发中的应用。通过对比两种架构，指出微服务化转型的必要性和实施策略。最后，讨论了微服务架构实施过程中可能遇到的问题及解决方案。

无糖可乐嘟嘟

573 9 9

热门文章

最新文章

DNS的主从架构与数据同步

运维工程师面试题总结-MySQL企业级实战及集群架构07

小红书如何实现高效推荐？解密背后的大数据计算平台架构

一线架构师带你玩性能优化

在Spring Boot中实现多租户架构的数据隔离

微服务异步架构---MQ之RocketMQ（二）

适用于金融和交易应用的低延迟网络：技术、架构与应用

基于阿里云容器服务Kubernetes版（ACK）的微服务架构设计与实践

网站平台架构演变史（二）

GPU架构及异构计算介绍GPU硬件平台

【赵渝强老师】HBase的物理存储结构

【赵渝强老师】HBase的逻辑存储结构

Ubuntu22.04下搭建Hadoop3.3.6+Hbase2.5.6+Phoenix5.1.3开发环境的指南

【赵渝强老师】HBase的体系架构

分布式存储数据恢复—hbase和hive数据库数据恢复案例

在 HBase 集群中，Prometheus 通常监控哪些类型的性能指标？

如何使用 HBase Shell 进行数据的实时监控和备份？

如何使用 HBase Shell 进行数据的批量导入和导出？

【赵渝强老师】HBase的体系架构

【赵渝强老师】HBase的表结构

相关课程

更多

HBase入门教程

MySQL企业常见架构与调优经验分享

企业Web常用架构LAMP-LNMP实战

企业级互联网分布式系统应用架构学习

分布式数据库 HBase 快速入门

高校精品课-上海交通大学 -企业级应用体系架构

相关电子书

更多

大数据时代的存储 ——HBase的实践与探索

Hbase在滴滴出行的应用场景和最佳实践

阿里云HBase主备双活

下一篇

利用阿里云OSS（对象存储服务）快速搭建私人网盘