《CDP企业数据云平台从入门到实践》——Hive 迁移到 CDP(4)

简介: 《CDP企业数据云平台从入门到实践》——Hive 迁移到 CDP(4)

《CDP企业数据云平台从入门到实践》——Hive 迁移到 CDP(3) https://developer.aliyun.com/article/1227681?groupCode=ClouderaCDP


三、使用DistCP+HMS Mirror迁移数据

DistCP迁移HDFS分的数据,它支持增量和全迁移方式,支持非KerberosKerberosKerberosKerberos的数据迁移


HMS Mirror弥补两个群之间的差异迁移Hive数据,数据移动不是该工具能,需要DistCP来完成。


HMSMirror在两个群之间迁移HiveMetastore,可以使用SQLEXPORT_IMPORT数据策略。也可以做一数据移动较小的数据,在大数据集场效率。此数据迁移里也有不的策略,比如SchemaRead-only

image.png

上图为HMS-Mirror迁移,此方式对来制,Hive可以是EMRHDP、CDHApache HadoopCDP,目CDP


程中通过YARN来调HDFS,将数据入,此通过DistCPYARN来执HDFS数据的迁移。然Hive Metastore数据进行复制,并通过YARN入到HiveMetastore数据库,终通过标集访问。


1.使用DistCPHMS Mirror迁移Hive演示

demo使用的环境下:CDH5.1.6Kerberos使用Hive1.1;CDP 7.1.7Kerberos使用Hive3.1.3

image.png

CDH 5.1.6test_db库下有示将的数据

image.png

CDHDB录创建Snapshot创建完其对应

image.png

到目标集数据创建针对user/hdfs,该赋予

etl_user户,并通过数据。

image.png

CDP里使用etl_user户做数据利用DistCP进行数据迁移

DistCP使用方式和对应手册

image.png

数据录里的数据,可以表已经同

image.png

github上提供了非常整的HMS Mirror进行下载安装即可。安可以user/local创建了新的目binlib参考文件。根目创建文件HMSMirror于存放对应的目,将hive-jdbcstandalone.jar文件该目下,cdhstandalone.jar文件放至该目下并创建对应置文件。


信息transfer提供了一些参数,左右群分置了HDFS

NameSpaceurijar文件的目

image.png

HMS Mirror的命来同数据。

image.png

,可以了一个数据库和对应数据库是test_db,temp下生成了若干文件。


image.png

temp下的文件结比较要的是标集群的行文件。

image.png

此文件,可以已经对应取出CDH,在CDP转成。此location对应的根目替换,保存文件。


image.png

在环境中创建test_db

image.png

Hive户,beeline生成DDL语句

image.png

Hive,可以已经存在查询parquet数据总条数为20004

image.png

对表做更新,2数据,增量

后查询parquet数据更新为20006

面为使用方式迁移数据,接下使用UI工具

image.png

text_db所在目摄快创建完后即可在页面上

image.png

切换etl户,做DistCP增量数据

image.png

切换CDP群,将工具切换Hive数据总条数,结20006








目录
相关文章
|
30天前
|
SQL 关系型数据库 MySQL
Hive跨集群和版本迁移
Hive跨集群和版本迁移
|
2月前
|
SQL 分布式计算 Hadoop
创建hive表并关联数据
创建hive表并关联数据
27 0
|
4月前
|
SQL 分布式计算 大数据
黑马程序员-大数据入门到实战-分布式SQL计算 Hive 入门
黑马程序员-大数据入门到实战-分布式SQL计算 Hive 入门
50 0
|
4月前
|
SQL Java 大数据
Hive实战(03)-深入了解Hive JDBC:在大数据世界中实现数据交互
Hive实战(03)-深入了解Hive JDBC:在大数据世界中实现数据交互
84 1
|
5月前
|
SQL 分布式计算 算法
大数据Hive数据查询语言DQL
大数据Hive数据查询语言DQL
54 0
|
20天前
|
机器学习/深度学习 算法 数据可视化
基于Google Earth Engine云平台构建的多源遥感数据森林地上生物量AGB估算模型含生物量模型应用APP
基于Google Earth Engine云平台构建的多源遥感数据森林地上生物量AGB估算模型含生物量模型应用APP
32 0
|
4月前
|
SQL 存储 大数据
黑马程序员-大数据入门到实战-分布式SQL计算 Hive 语法与概念
黑马程序员-大数据入门到实战-分布式SQL计算 Hive 语法与概念
58 0
|
4月前
|
SQL 存储 分布式数据库
【通过Hive清洗、处理和计算原始数据,Hive清洗处理后的结果,将存入Hbase,海量数据随机查询场景从HBase查询数据 】
【通过Hive清洗、处理和计算原始数据,Hive清洗处理后的结果,将存入Hbase,海量数据随机查询场景从HBase查询数据 】
|
3天前
|
SQL 消息中间件 Kafka
Flink部署问题之hive表没有数据如何解决
Apache Flink是由Apache软件基金会开发的开源流处理框架,其核心是用Java和Scala编写的分布式流数据流引擎。本合集提供有关Apache Flink相关技术、使用技巧和最佳实践的资源。
|
2月前
|
SQL 消息中间件 存储
案例:Flume消费Kafka数据保存Hive
案例:Flume消费Kafka数据保存Hive
36 0

热门文章

最新文章