【HBase】(6)-Compact合并StoreFile流程

2023-01-18 309 发布于黑龙江

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 【HBase】(6)-Compact合并StoreFile流程

简介：HBase是谷歌BigData论文的一个代码实现，在大数据处理领域应用广泛。本文意在记录自己近期学习过程中的所学所得，如有错误，欢迎大家指正。

关键词：大数据组件、HBase、NoSQL

一、Compact合并StoreFile文件

我们每次put一条数据，都会将其写入到MemStore中，然后达到一定条件后，将其flush到HDFS中，久而久之这样就会产生过多的小文件，我们就需要定期或者按照一定约束进行合并，产生的多个StoreFile如下图：

此时可以看到有两个HFile文件，对应着MemStore刷写两次到HDFS中。

由于我们每个字段的不同版本可能在不同的HFile中，当我们查询时就要去遍历所有的HFile，拿到最新的data，这样效率就会较低，所以需要减少HFile的个数，清理掉过期不生效的数据，进行StoreFile Compaction合并。

从上图可以看出，合并分为两种，一种是Minor Compaction，另外一种是Major Compaction。

Minor Compaction：它会将临近的若干个较小的HFile合并成一个较大的HFile，但是它并不会清理过期和删除的数据。

Major Compaction：会将一个Store下的所有的HFile合并成一个大HFile，并且会清理掉过期和删除的数据。

这些定期合并以及相关的配置可以在配置文件中进行修改。

下面测试一下合并文件。

上图我们的HFile文件中有两个，我们尝试put两条新的数据，然后flush到磁盘中。

现在可以发现HDFS上存在4个HFile文件，我们用命令手动合并一下。

现在会比之前多一个文件，就是刚才的4个文件合并后的，但是并没有马上删除其它4个文件，可能是延迟或者是一种安全措施，并不会马上删除，过了一段时间还是会被删除的。

相关实践学习

云数据库HBase版使用教程

  相关的阿里云产品：云数据库 HBase 版面向大数据领域的一站式NoSQL服务，100%兼容开源HBase并深度扩展，支持海量数据下的实时存储、高并发吞吐、轻SQL分析、全文检索、时序时空查询等能力，是风控、推荐、广告、物联网、车联网、Feeds流、数据大屏等场景首选数据库，是为淘宝、支付宝、菜鸟等众多阿里核心业务提供关键支撑的数据库。了解产品详情: https://cn.aliyun.com/product/hbase   ------------------------------------------------------------------------- 阿里云数据库体验：数据库上云实战开发者云会免费提供一台带自建MySQL的源数据库 ECS 实例和一台目标数据库 RDS实例。跟着指引，您可以一步步实现将ECS自建数据库迁移到目标数据库RDS。点击下方链接，领取免费ECS&RDS资源，30分钟完成数据库上云实战！https://developer.aliyun.com/adc/scenario/51eefbd1894e42f6bb9acacadd3f9121?spm=a2c6h.13788135.J_3257954370.9.4ba85f24utseFl

【HBase】(6)-Compact合并StoreFile流程

一、Compact合并StoreFile文件

热门文章

最新文章

相关课程

相关电子书

探索云世界

热门

云计算

大数据

云原生

人工智能

数据库

开发与运维

活动广场

任务中心

训练营

直播

乘风者计划

下载

镜像站

技术资料

【HBase】(6)-Compact合并StoreFile流程

一、Compact合并StoreFile文件

热门文章

最新文章

相关课程

相关电子书