大数据入门-五分钟读懂Hive

简介: 大数据入门-五分钟读懂Hive

一、概念


Hive是基于Hadoop的一个数据仓库工具,用来进行数据抽取,转化,加载,这是一种可以存储,查询和分析存储在Hadoop中的大规模数据的机制。Hive数据仓库工具能将结构化的数据文件映射成一张表,并提供SQL查询功能,能将SQL语句转化成为MapReduce来执行。Hive的优点是学习成本低,可以通过类SQL语句实现快速MapReduce统计,使MapReduce变得更加简单,而不必开发专门的MapReduce任务。Hive十分适合对数据仓库进行分析。


二、架构


fba7b3ef7a234aec80715a5dbb75afc0.jpg


三、表分类


内部表:未被External修饰的是内部表(Managed Table),数据由自身管理,数据存储的位置是hive.metastore.warehouse.dir,(默认:/user/hive/warehouse)删除内部表会直接删除元数据(Metadata)及存储数据;对内部表的修改会将修改直接同步给元数据。


外部表:被External修饰的是外部表(External Table),数据由HDFS管理,部表数据的存储位置由自己制定(如果没有LOCATION,Hive将在HDFS上的/user/hive/warehouse文件夹下以外部表的表名创建一个文件夹,并将属于这个表的数据存放在这里),删除外部表仅仅会删除元数据,HDFS上的文件并不会被删除,而对外部表的表结构和分区进行修改,则需要修复(MSCK REPAIR TABLE table_name)。


四、Hive常用语句


1.Hive建表语句

create table t1( id int,
name string ,
hobby array<string> ,
add map<String,
string> ) 
row format delimited 
fields terminated by ',' 
collection items terminated by '-' 
map keys terminated by ':' ;


2.Hive新增列


alter table test.t1 add columns(a string);


3.Hive删除列


alter table test.t1 replace columns(id int,name string,hobby array<string>,add map<string,


4.Hive修改列


alter table test.t1 change a b int;


5.Hive清空表


truncate table test.t1;


6.Hive加载数据


load data local inpath '/home/hadoopap/desktop/data' overwrite into table t1;


7.HDFS删除文件操作


sudo -u hdfs hadoop fs -rm -r -f /user/hive/warehouse/db名/表名/分区名


五、存储格式


1.Textfile


Hive数据表的默认格式,数据不做压缩,磁盘开销大,数据解析开销大。存储方式:行存储。


可以使用Gzip压缩算法,但压缩后的文件不支持split。


在反序列化过程中,必须逐个字符判断是不是分隔符和行结束符,因此反序列化开销会比SequenceFile高几十倍。


2.RCFile


存储方式:数据按行分块,每块按列存储。结合了行存储和列存储的优点:


首先,RCFile 保证同一行的数据位于同一节点,因此元组重构的开销很低。其次,像列存储一样,RCFile 能够利用列维度的数据压缩,并且能跳过不必要的列读取。


数据追加:RCFile不支持任意方式的数据写操作,仅提供一种追加接口,这是因为底层的 HDFS当前仅仅支持数据追加写文件尾部。


行组大小:行组变大有助于提高数据压缩的效率,但是可能会损害数据的读取性能,因为这样增加了 Lazy 解压性能的消耗。而且行组变大会占用更多的内存,这会影响并发执行的其他MR作业。 考虑到存储空间和查询效率两个方面,Facebook 选择 4MB 作为默认的行组大小,当然也允许用户自行选择参数进行配置。


3.ORCFile


存储方式:数据按行分块,每块按照列存储。


压缩快,可切分,快速列存取。效率比Rcfile高,是Rcfile的改良版本。


支持各种复杂的数据类型,比如datetime,decimal,以及复杂的struct。


4.Parquet


Parquet能够很好的压缩,有很好的查询性能,支持有限的模式演进。但是写速度通常比较慢。这中文件格式主要是用在Cloudera Impala上面的。


六、大白话


Hive就是一个存储数据的库,你可以理解它是一个仓库,里面放了各种各样的东西,这个东西就是数据。多种存储格式是不同的算法设计的,底层有不同的执行方法。对应有不同的压缩比和反压缩比。


七、其他


下一篇:介绍存储引擎Kudu。


鸡汤:如果您心情不好,就回家躺几天。人生在世,开心最重要。做了决定不要后悔,一直向前走。我们唯一的目的就是活下去,然后活的好。


备注:以上资料来自网络,侵删。


相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
SQL 分布式计算 大数据
大数据新视界 --大数据大厂之Hive与大数据融合:构建强大数据仓库实战指南
本文深入介绍 Hive 与大数据融合构建强大数据仓库的实战指南。涵盖 Hive 简介、优势、安装配置、数据处理、性能优化及安全管理等内容,并通过互联网广告和物流行业案例分析,展示其实际应用。具有专业性、可操作性和参考价值。
大数据新视界 --大数据大厂之Hive与大数据融合:构建强大数据仓库实战指南
|
SQL 存储 分布式计算
ODPS开发大全:入门篇(3)
ODPS开发大全:入门篇
1346 19
|
SQL 存储 分布式计算
ODPS开发大全:入门篇(1)
ODPS开发大全:入门篇
2126 14
|
数据采集 分布式计算 大数据
不会Python,还敢说搞大数据?一文带你入门大数据编程的“硬核”真相
不会Python,还敢说搞大数据?一文带你入门大数据编程的“硬核”真相
328 1
|
SQL 分布式计算 大数据
SparkSQL 入门指南:小白也能懂的大数据 SQL 处理神器
在大数据处理的领域,SparkSQL 是一种非常强大的工具,它可以让开发人员以 SQL 的方式处理和查询大规模数据集。SparkSQL 集成了 SQL 查询引擎和 Spark 的分布式计算引擎,使得我们可以在分布式环境下执行 SQL 查询,并能利用 Spark 的强大计算能力进行数据分析。
|
数据采集 数据可视化 大数据
Python入门修炼:开启你在大数据世界的第一个脚本
Python入门修炼:开启你在大数据世界的第一个脚本
314 6
|
SQL 分布式计算 MaxCompute
ODPS开发大全:入门篇(2)
ODPS开发大全:入门篇
1291 14
|
分布式计算 资源调度 Hadoop
Hadoop入门基础(五):Hadoop 常用 Shell 命令一网打尽,提升你的大数据技能!
Hadoop入门基础(五):Hadoop 常用 Shell 命令一网打尽,提升你的大数据技能!
|
SQL 分布式计算 大数据
大数据处理平台Hive详解
【7月更文挑战第15天】Hive作为基于Hadoop的数据仓库工具,在大数据处理和分析领域发挥着重要作用。通过提供类SQL的查询语言,Hive降低了数据处理的门槛,使得具有SQL背景的开发者可以轻松地处理大规模数据。然而,Hive也存在查询延迟高、表达能力有限等缺点,需要在实际应用中根据具体场景和需求进行选择和优化。
1426 6
|
SQL 分布式计算 Java
大数据-96 Spark 集群 SparkSQL Scala编写SQL操作SparkSQL的数据源:JSON、CSV、JDBC、Hive
大数据-96 Spark 集群 SparkSQL Scala编写SQL操作SparkSQL的数据源:JSON、CSV、JDBC、Hive
519 0