对 Hive 数仓表进行高效小文件合并 | 学习笔记

本文涉及的产品
云原生数据仓库AnalyticDB MySQL版,基础版 8ACU 100GB 1个月
简介: 快速学习对 Hive 数仓表进行高效小文件合并。

开发者学堂课程【数据湖 JindoFS + OSS 实操干货36讲对 Hive 数仓表进行高效小文件合并】学习笔记,与课程紧密联系,让用户快速学习知识。

课程地址:https://developer.aliyun.com/learning/course/833/detail/13982


Hive 数仓表进行高效小文件合并

 

内容介绍

一、背景介绍

二、主要功能


一、背景介绍

1)小文件如何产生

l  动态分区插入数据,产生大的小文件,从而导致 map 数剧增。

l  reduce 数量越多,小文件也越多(r educe 的个数和输出文件是对应的)

l  数据源本身就包含大量的小文件。

2)小文件带来的问题

l  小文件会开很多 map, 一个 map 开一个 JVM 去执行,所以这些任务的初始化,启动,执行会浪费大量的资源,严重影响性能。

l  小文件会给底层文件系统带来很大压力,如在在 HDFS 中,每个小文件对象约占150byte,如果小文件过多会占用大量内存。这样 NameNode 内存容量严重制约了集群的扩展

3)小文件解决方案

l  从小文件产生的途经就可以从源头上控制小文件数量

l  使用 Sequencefile 作 为表存储格式,不要用 textfile,在一定程度上可以减少小文件。

l  减少 reduce 的 数量(可以使用参数进行控制)

l  少用动态分区,用时记得按 distribute by 分区。

l  对于已有的小文件,我们可以通过以下几种方案解决

l  通过参数进行调节,设置 map/reduce 端的相关参数。

l  重建表,建表时减少 reduce 数量。

l  使用 hadoop archive 命令把小文件进行归档。

 

二、主要功能

1JindoTable

l  JindoTable 提供表或分区级别的热度统计、存储分层和表文件优化的功能,常见命令如下:

l  -accessStat/-leastUseStat

l  -cache/-uncache/-archive/-unarchive/-archiveTable/-unarchiveTable/ -status

l  -optimize

l  -showTable/-showPartition/-listTables

l  -dumpmc

l  -moveTo

2Hive 数仓表小文件合并

l  Jindo table- -showTable/-showPartition -t  -p

l  显示表格或者分区的状态,如果表文件过小会提示文件过小

l  Jindo table - optimize  优化表存储层的数据组织

 

相关实践学习
AnalyticDB MySQL海量数据秒级分析体验
快速上手AnalyticDB MySQL,玩转SQL开发等功能!本教程介绍如何在AnalyticDB MySQL中,一键加载内置数据集,并基于自动生成的查询脚本,运行复杂查询语句,秒级生成查询结果。
阿里云云原生数据仓库AnalyticDB MySQL版 使用教程
云原生数据仓库AnalyticDB MySQL版是一种支持高并发低延时查询的新一代云原生数据仓库,高度兼容MySQL协议以及SQL:92、SQL:99、SQL:2003标准,可以对海量数据进行即时的多维分析透视和业务探索,快速构建企业云上数据仓库。 了解产品 https://www.aliyun.com/product/ApsaraDB/ads
相关文章
|
21天前
|
SQL 数据库 HIVE
hive数仓 ods层增量数据导入
根据业务需求,当表数据量超过10万条时采用增量数据导入,否则全量导入。增量导入基于`create_date`和`modify_date`字段进行,并确保时间字段已建立索引以提升查询效率。避免在索引字段上执行函数操作。创建增量表和全量表,并按日期进行分区。首次导入全量数据,后续每日新增或变更数据保存在增量表中,通过全量表与增量表的合并保持数据一致性。
43 13
|
4月前
|
SQL 缓存 关系型数据库
ClickHouse(19)ClickHouse集成Hive表引擎详细解析
Hive引擎允许对HDFS Hive表执行 `SELECT` 查询。目前它支持如下输入格式: -文本:只支持简单的标量列类型,除了 `Binary` - ORC:支持简单的标量列类型,除了`char`; 只支持 `array` 这样的复杂类型 - Parquet:支持所有简单标量列类型;只支持 `array` 这样的复杂类型
165 1
|
5月前
|
SQL 数据采集 分布式计算
Hive 数仓及数仓设计方案
数仓整合企业数据,提供统一出口,用于数据治理。其特点包括面向主题集成和主要支持查询操作。数仓设计涉及需求分析(如咨询老板、运营人员和行业专家)、确定主题指标(如电商的转化率)、数据标准设定、规模与成本计算、技术选型(如Hadoop生态组件)以及数据采集和操作。设计流程涵盖从理解需求到实施SQL函数和存储过程的全过程。
85 3
|
5月前
|
SQL 关系型数据库 MySQL
Hive 表注释乱码解决
Hive元数据在MySQL默认使用`latin1`字符集导致注释乱码。可通过修改MySQL配置文件`/etc/my.cnf`,在`[mysqld]`和末尾添加`character-set-server=utf8`等设置,重启MySQL。然后在Hive数据库中调整表字段、分区字段、索引注释的字符集。注意,这仅对新表生效。测试创建带注释的Hive表,问题解决。
|
5月前
|
SQL HIVE
Hive表删除数据不支持使用Delete From...
Hive表删除数据不支持使用Delete From...
161 0
|
5月前
|
SQL 存储 分布式计算
【Hive】hive内部表和外部表的区别
【4月更文挑战第14天】【Hive】hive内部表和外部表的区别
|
5月前
|
SQL 存储 分布式计算
Hive【基础 01】核心概念+体系架构+数据类型+内容格式+存储格式+内外部表(部分图片来源于网络)
【4月更文挑战第6天】Hive【基础 01】核心概念+体系架构+数据类型+内容格式+存储格式+内外部表(部分图片来源于网络)
110 1
|
5月前
|
SQL 数据库 HIVE
Hive【基础知识 05】常用DDL操作(数据库操作+创建表+修改表+清空删除表+其他命令)
【4月更文挑战第8天】Hive【基础知识 05】常用DDL操作(数据库操作+创建表+修改表+清空删除表+其他命令)
80 0
|
5月前
|
SQL 消息中间件 Kafka
Flink部署问题之hive表没有数据如何解决
Apache Flink是由Apache软件基金会开发的开源流处理框架,其核心是用Java和Scala编写的分布式流数据流引擎。本合集提供有关Apache Flink相关技术、使用技巧和最佳实践的资源。
|
5月前
|
SQL JSON 算法
hive学习笔记
hive学习笔记
下一篇
无影云桌面