自建Hadoop数据迁移到阿里云EMR

本文涉及的产品
EMR Serverless StarRocks,5000CU*H 48000GB*H
简介: 客户在IDC或者公有云环境自建Hadoop集群,数据集中保存在HDFS文件系统用于数据分析任务。客户在决定上云之后,会将自建Hadoop集群的数据迁移到阿里云自建部署架构图 Hadoop集群或者EMR集群。本实践方案提供安全和低成本的HDFS数据迁移方案。

作者:云魁、连辙

最佳实践概述

应用场景

客户在IDC或者公有云环境自建Hadoop集群,数据集中保存在HDFS文件系统用于数据分析任务。但是由于自建HDFS空间限制无法保存长期数据,或者客户有Hadoop集群迁移上云的需求。本实践方案提供如下场景的最佳实践:

基于IPSec VPN隧道 + DistCp(Hadoop原生工具),将数据迁移到阿里云EMR集群,目标存储包括HDFS,阿里云OSS和阿里云EMR的Jindo

技术架构

本实践方案基于如下图所示的技术架构和主要流程编写操作步骤:
image.png

方案优势

  • 安全性
    基于IPSec VPN/专线的方式进行数据安全传输。
  • 低成本
    在阿里云创建Hadoop类型的EMR集群和自建Hadoop集群相比有一定成本优势,同时阿里云EMR可以使用OSS作为底层存储空间,进一步降低成本。

在进行本文操作之前,您需要完成以下准备工作:

  • 拥有阿里云实名认证账号。
  • 拥有已经通过备案的域名。
  • 保证账号余额大于100元人民币。
  • 开通ECS、OSS、EMR和VPN网关等服务。

资源规划说明

  • 本方案实践的资源规划仅作为实践演示,实际业务场景资源以用户实际需求为准。
  • 本实践方案中,涉及到阿里云资源开通和购买,本文后续实例中不单独展示服务开通相关操作,请使用者自行完成。
  • 本实践方案在使用过程中,大致流程和实际操作所需的时长如下(不包含文档阅读时间),供使用者参考:
    image.png

1. 自建Hadoop集群环境搭建

本实践方案中,使用上海VPC环境模拟客户IDC网络,主要安装以下组件:

(1) 在ECS上安装FlexGW VPN,用于模拟客户IDC网络中的VPN网关;
(2) 在ECS上安装Apache日志模拟器,用于生成Apache格式的日志信息;
(3) 在ECS上安装Kafka,用于集中存储Flume发送的日志;
(4) 在ECS上安装3节点的Hadoop集群,其中的HDFS用于集中保存日志数据信息。

1.1. 创建VPC网络

步骤1 登录专有网络VPC产品控制台
步骤2 单击创建专有网络。
image.png
步骤3 在创建专有网络页面,参考下表,配置专有网络和交换机相关参数,并单击确定。
image.png
image.png
image.png
步骤4 等待专有网络和交换机创建成功后,单击完成。

1.2. 批量创建ECS实例

创建ECS实例
步骤1 登录上海区域的ECS产品控制台
步骤2 单击右上角的创建实例。
步骤3自定义购买模式下,配置相关参数。
参考下表,配置基础配置相关内容。
image.png
配置完成,单击下一步:网络和安全组
image.png
单击查看历史价格 ,在抢占式实例历史价格走势图中,可以看到可用区F的实例当前市场价格为0.034,因此,我们设置单台上限价为0.04,要求略高于当前市场价格。
image.png
image.png
步骤4 在网络和安全组页面,参考下表,配置相关参数。
image.png
配置完成,单击下一步:系统配置。
image.png
步骤5 在系统配置页面,参考下表,配置相关参数。
image.png
配置完成,单击确认订单
image.png
步骤6 在确认订单页面,确认各项参数信息。确认无误,阅读、同意并勾选《云服务器ECS服务条款》和《镜像商品使用条款》,并单击创建实例。
image.png
步骤7 创建任务提交成功后,单击管理控制台前往ECS实例列表页面查看详情。为了在控制台便于识别ECS的用途,首先将实例名称修改为如下图所示:image.png
image.png
步骤8 将Kafka队列和FlexGW VPN这两个实例关机,将系统盘更换为云市场的镜像,节省基础环境部署时间。
image.png
image.png
步骤9 首先为FlexGW VPN网关实例更换系统盘。

  1. 单击实例操作列下的更多 > 磁盘和镜像 > 更换操作系统。
    image.png
  2. 单击右下角确定,更换系统盘按钮。
    image.png
  3. 选择镜像市场,单击从镜像市场选择(含操作系统)。
    image.png
  4. 在搜索框中输入flexgw,定位到FlexGW IPsec VPN服务器企业版,并单击使用。
    image.png
  5. 选择自定义密码,并设置登录密码。
    image.png

步骤10 参考步骤9为Kafka队列实例更换系统盘,选择下面的镜像。
image.png

(可选)配置安全组

在实例所在安全组中确认22、80和443端口的放通情况,如果有未放通端口,请按照下面步骤进行放通。
步骤1 在ECS控制台,单击FlexGW VPN网关实例操作列下的管理 。
步骤2 在左侧导航栏单击本实例安全组。
image.png
步骤3 单击对应安全组操作列下的配置规则。
image.png
步骤4 在入方向页签下,单击快速创建规则。
image.png
步骤5 在快速创建规则对话框中,根据下图配置相关参数,并单击确定 。
image.png

因篇幅原因,余下内容请点击原文链接阅读


阿里巴巴开源大数据技术团队成立Apache Spark中国技术社区,定期推送精彩案例,技术专家直播,问答区数个Spark技术同学每日在线答疑,只为营造纯粹的Spark氛围,欢迎钉钉扫码加入!
image.png

相关实践学习
基于EMR Serverless StarRocks一键玩转世界杯
基于StarRocks构建极速统一OLAP平台
快速掌握阿里云 E-MapReduce
E-MapReduce 是构建于阿里云 ECS 弹性虚拟机之上,利用开源大数据生态系统,包括 Hadoop、Spark、HBase,为用户提供集群、作业、数据等管理的一站式大数据处理分析服务。 本课程主要介绍阿里云 E-MapReduce 的使用方法。
相关文章
|
1月前
|
SQL 存储 缓存
阿里云EMR StarRocks X Paimon创建 Streaming Lakehouse
本文介绍了阿里云EMR StarRocks在数据湖分析领域的应用,涵盖StarRocks的数据湖能力、如何构建基于Paimon的实时湖仓、StarRocks与Paimon的最新进展及未来规划。文章强调了StarRocks在极速统一、简单易用方面的优势,以及在数据湖分析加速、湖仓分层建模、冷热融合及全链路ETL等场景的应用。
271 2
阿里云EMR StarRocks X Paimon创建 Streaming Lakehouse
|
29天前
|
SQL 存储 缓存
降本60% ,阿里云 EMR StarRocks 全新发布存算分离版本
阿里云 EMR Serverless StarRocks 现已推出全新存算分离版本,该版本不仅基于开源 StarRocks 进行了全面优化,实现了存储与计算解耦架构,还在性能、弹性伸缩以及多计算组隔离能力方面取得了显著进展。
260 6
|
1月前
|
SQL 存储 缓存
阿里云EMR StarRocks X Paimon创建 Streaming Lakehouse
讲师焦明烨介绍了StarRocks的数据湖能力,如何使用阿里云EMR StarRocks构建基于Paimon的极速实时湖仓,StarRocks与Paimon的最新进展及未来规划。
122 3
|
2月前
|
SQL 分布式计算 Serverless
阿里云 EMR Serverless Spark 版正式开启商业化
阿里云 EMR Serverless Spark 版正式开启商业化,内置 Fusion Engine,100% 兼容开源 Spark 编程接口,相比于开源 Spark 性能提升300%;提供 Notebook 及 SQL 开发、调试、发布、调度、监控诊断等一站式数据开发体验!
151 3
阿里云 EMR Serverless Spark 版正式开启商业化
|
1月前
|
SQL 分布式计算 关系型数据库
Hadoop-21 Sqoop 数据迁移工具 简介与环境配置 云服务器 ETL工具 MySQL与Hive数据互相迁移 导入导出
Hadoop-21 Sqoop 数据迁移工具 简介与环境配置 云服务器 ETL工具 MySQL与Hive数据互相迁移 导入导出
53 3
|
2月前
|
SQL 存储 NoSQL
阿里云 EMR StarRocks 在七猫的应用和实践
本文整理自七猫资深大数据架构师蒋乾老师在 《阿里云 x StarRocks:极速湖仓第二季—上海站》的分享。
262 2
|
3月前
|
存储 分布式计算 大数据
大数据革新在即,阿里云EMR如何布局DeltaLake引领行业潮流?
【8月更文挑战第26天】大数据时代,实时处理与分析能力对企业至关重要。Delta Lake 作为高性能、可靠且支持 ACID 事务的开源存储层,已成为业界焦点。阿里云 EMR 深度布局 Delta Lake,计划深化集成、强化数据安全、优化实时性能,并加强生态建设与社区贡献。通过与 Spark 的无缝对接及持续的技术创新,阿里云 EMR 致力于提供更高效、安全的数据湖解决方案,引领大数据处理领域的发展新方向。
50 3
|
3月前
|
存储 分布式计算 监控
揭秘阿里云EMR:如何巧妙降低你的数据湖成本,让大数据不再昂贵?
【8月更文挑战第26天】阿里云EMR是一种高效的大数据处理服务,助力企业优化数据湖的成本效益。它提供弹性计算资源,支持根据需求调整规模;兼容并优化了Hadoop、Spark等开源工具,提升性能同时降低资源消耗。借助DataWorks及Data Lake Formation等工具,EMR简化了数据湖构建与管理流程,实现了数据的统一化治理。此外,EMR还支持OSS、Table Store等多种存储选项,并配备监控优化工具,确保数据处理流程高效稳定。通过这些措施,EMR帮助企业显著降低了数据处理和存储成本。
130 3
|
3月前
|
安全 数据管理 大数据
数据湖的未来已来:EMR DeltaLake携手阿里云DLF,重塑企业级数据处理格局
【8月更文挑战第26天】在大数据处理领域,阿里云EMR与DeltaLake的集成增强了数据处理能力。进一步结合阿里云DLF服务,实现了数据湖的一站式管理,自动化处理元数据及权限控制,简化管理流程。集成后的方案提升了数据安全性、可靠性和性能优化水平,让用户更专注业务价值。这一集成标志着数据湖技术向着自动化、安全和高效的未来迈出重要一步。
77 2
|
3月前
|
存储 分布式计算 大数据
阿里云 EMR 强势助力,与阿里云大数据体系共创辉煌,把握时代热点,开启生态建设之旅
【8月更文挑战第26天】阿里云EMR(Elastic MapReduce)是一种大数据处理服务,与阿里云的多个服务紧密结合,共同构建了完善的大数据生态系统。EMR与对象存储服务(OSS)集成,利用OSS提供可靠、低成本且可扩展的数据存储;与MaxCompute集成,实现深度数据分析和挖掘;还支持数据湖构建服务,加速数据湖的搭建并简化数据管理与分析过程。EMR提供多种编程接口及工具,如Hive、Spark和Flink等,帮助用户高效完成大数据处理任务。
102 2
下一篇
无影云桌面