玩转阿里云EMR三部曲-入门篇

本文涉及的产品
EMR Serverless StarRocks,5000CU*H 48000GB*H
简介: 优异的自动化创建集群让小伙伴可以专心于业务开发,不再纠结于hadoop版本,spark版本,甚至某些jar版本引发的各种奇怪问题,按需集群按小时计费模式替小伙伴们极大节省了开支,可以50个节点执行1小时,也可以3个节点执行5小时,非常灵活。
+关注继续查看

作者:邓力,entobit技术总监,八年大数据从业经历,由一代hadoop入坑,深耕云计算应用领域,由从事AmazonEMR和阿里云EMR应用开发逐步转入大数据架构领域,对大数据生态及框架应用有深刻理解。

引言
笔者近几年工作以架构为主,本系列文章旨在从系统架构层面提供一定参考和帮助。
本文默认阅读文章的小伙伴们有MR/SPARK等基础,文中不再重复介绍相关知识

为什么选择阿里云EMR?

最近几年云计算行业发展迅猛,云计算服务商有诸如 阿里云,亚马逊,谷歌,微软,金山云,腾讯云,华为云。其中阿里云和亚马逊最亮眼。

亚马逊是云计算行业领头羊,文档全面,社区活跃,但是本地化做的很差,并且有跨时区交流障碍。

后起之秀阿里云在国内多城市拥有数据中心,优异的技术和快速的迭代能力能保证至少在大数据领域追上并反超亚马逊。

OSS和EMR

阿里云OSS全称是对象存储服务(object storage service),兼容hdfs存储服务,支持json,文本等类型。

详情可以查看官方文档

mapreduce是计算框架,hadoop自带的hdfs可以作为存储,但是hdfs是公有云存储方案的最优解吗?

传统hdfs缺点:

  • 难以扩展
  • 昂贵的SSD
  • 受限的并发能力
  • 需要自己维护

1/2/3可以用更多的投入解决,4需要更优秀的人才...,俨然HDFS并不是云计算服务下的最优解

OSS优点:

  • 无限的扩展能力
  • 按量付费和多种存储模式
  • 原生高并发支持
  • 不需要参与维护

基于以上优缺点,在公有云计算服务下,可以使用OSS替代HDFS作为文件存储服务

: 可以使用osscmd/ossutil/restAPI/kafka等方式同步数据至OSS

阿里云EMR全称是阿里云elastic mapreduce,各位不要被字面疑惑只是和mapduce相关,实际阿里云EMR包含yarn,zk,spark等诸多组件,并且能融合flink,kafka等最新的开源框架,结合OSS服务可以产生1+1>2的效果

EMR优点:

  • 托管集群
  • 自动化运维
  • 网页组件控制
    (类cloudera)
  • 配套集群监控
  • 完美兼容OSS
  • 多样集群类别

EMR详细可以参考官方文档

EMR集群收费模式

简单来说分为两种模式包月和按需**

包月集群
集群按月/年付费,和传统自建集群类似。兼容OSS。

按需集群
按需集群,按照实际使用时长付费,目前收费单位为小时。

按需集群不再长时间持有造成空负载浪费,用户根据需要可以合理的启动按需集群执行mr/spark/hive等任务。易于用户节省开支。

EMR按需集群实战

1.创建集群模板

进入新版控制台,选择 数据开发->创建集群模板,提示如下页面
image
默认配置,进入下一步如图
image

选择北京C区-专有网络 并 设置 VPC和交换机(没有可以创建默尔值),安全组设置后继续机器配置选项,默认3台机器(masterx1,slavex2),进入下一步添加集群模板名,忽略高级配置,确认后成功创建集群模板

返回集群模板页面可以查看到刚才创建的集群
image

2.上传文件至OSS

本文以pi举例不用OSS文件。有需要(比如wordcount样例)可以借助与ossutil或者控制台上传

3.编写作业

本文以spark pi为例

进入 数据开发->新建项目 保存后 点击该项目名称进入 作业编辑页面

在左侧job栏内右键创建作业,作业类型为spark其他随意,作业内容为将要运行的spark命令参数

--class org.apache.spark.examples.SparkPi --master yarn-client --driver-memory 512m --num-executors 1 --executor-memory 1g --executor-cores 2 /usr/lib/spark-current/examples/jars/spark-examples_2.11-2.1.1.jar 10

点击保存作业为pi_test
image

4.创建并执行作业流

在左侧 选择 工作流设计->新建工作流,选择执行集群为创建的集群模板。
image

拖动spark并关联已保存的作业pi_test,拖动end,并按顺序链接start->pi_test->end节点。
image
保存并执行

5.查看集群和日志

在控制概览/集群管理可以查看启动中的集群,也可以查看 运行记录 中的作业日志

总结

优异的自动化创建集群让小伙伴可以专心于业务开发,不再纠结于hadoop版本,spark版本,甚至某些jar版本引发的各种奇怪问题,按需集群按小时计费模式替小伙伴们极大节省了开支,可以50个节点执行1小时,也可以3个节点执行5小时,非常灵活。可以保留更多精力和成本用于业务开发和维护,而把集群运维/存储(oss)问题托管给阿里云。

本文是一篇入门文章分享,后续还会有更多结合阿里云生态(不仅仅是EMR)的介绍和实践。

欢迎对EMR及相关技术感兴趣的同学进钉钉群一起讨论 :)

IMG_6672

相关实践学习
EMR数据湖开发治理之用户画像分析
通过本场景,你可以基于E-MapReduce + DLF + OSS-HDFS + DataWorks在云上快速体验完整的数据湖开发治理方案。
快速掌握阿里云 E-MapReduce
E-MapReduce 是构建于阿里云 ECS 弹性虚拟机之上,利用开源大数据生态系统,包括 Hadoop、Spark、HBase,为用户提供集群、作业、数据等管理的一站式大数据处理分析服务。 本课程主要介绍阿里云 E-MapReduce 的使用方法。
相关文章
|
4月前
|
存储 分布式计算 大数据
CommunityOverCode Asia 精彩回顾|阿里云开源大数据 EMR 技术实践分享
阿里云开源大数据 EMR 在 CommunityOverCode Asia 的精彩分享。
468 0
|
4月前
|
存储 SQL 分布式计算
阿里云全托管flink-vvp平台hudi connector实践(基于emr集群oss-hdfs存储)
阿里云全托管flink-vvp平台hudi sink connector实践,本文数据湖hudi基于阿里云E-MapReduce产品,以云对象存储oss-hdfs作为存储
|
7月前
|
SQL 存储 监控
水滴筹基于阿里云 EMR StarRocks 实战分享
水滴筹大数据部门的数据开发工程师韩园园老师为大家分享水滴筹基于阿里云EMR StarRocks的实战经验。
5470 3
水滴筹基于阿里云 EMR StarRocks 实战分享
|
8月前
|
存储 人工智能 运维
免费公测|阿里云EMR Serverless StarRocks 公测正式开启!
阿里云EMR Serverless StarRocks 免费公测已开启,向所有用户开放!您可通过EMR控制台直接创建实例,轻松体验全托管、免运维的服务。
2454 1
免费公测|阿里云EMR Serverless StarRocks 公测正式开启!
|
9月前
|
SQL 分布式计算 监控
阿里云EMR自定义日志投递与使用实践分享
EMR目前支持了日志管理,即日志客户SLS投递的功能,基于此功能,客户可以将需要的各种大数据组件日志收集到自身SLS中,做查询和分析。基于此功能,客户可以自定义日志路径、规则,对集群设备上的日志自行接收和消费。本文以采集指标文件为例,帮助您快速上手自定义日志投递与使用。
291 0
阿里云EMR自定义日志投递与使用实践分享
|
9月前
|
SQL 消息中间件 分布式计算
基于阿里云 CloudMonitor云监控自定义监控大盘对 EMR 自定义监控实践
本文旨在分享 EMR 平台大数据服务基于阿里云 CloudMonitor 的监控实践,给客户提供除了 EMR 平台默认监控以外,自建监控方式,适用于统一多个阿里云服务的监控监控场景。
610 1
基于阿里云 CloudMonitor云监控自定义监控大盘对 EMR 自定义监控实践
|
9月前
|
存储 SQL 缓存
阿里云EMR 2.0:定义下一代云原生智能数据湖
本次分享主要介绍了阿里云云原生数据湖分析解决方案的三个核心要素:全托管,湖存储;一站式,湖管理;多模态,湖计算。
29470 0
阿里云EMR 2.0:定义下一代云原生智能数据湖
|
9月前
|
存储 分布式计算 Cloud Native
阿里云 EMR 基于 Apache DolphinScheduler 产品技术实践和社区贡献
本文整理自阿里云 EMR 数据开发团队负责人孙一凡(Evans 忆梵),在 Apache Spark & DS Meetup 的分享
阿里云 EMR 基于 Apache DolphinScheduler 产品技术实践和社区贡献
|
10月前
|
SQL 存储 分布式计算
阿里云EMR 2.0:兼容开源,贡献开源,超越开源
本文整理自阿里云资深技术专家吴威(无谓)在 阿里云EMR2.0线上发布会 的分享。本文从开源的角度出发,分享了阿里云EMR团队的工作。
770 0
阿里云EMR 2.0:兼容开源,贡献开源,超越开源
|
10月前
|
存储 SQL 分布式计算
StarRocks 2.5 LTS 版本新特性介绍及阿里云EMR Serverless StarRocks火热邀测中
StarRocks 2.5 LTS 版本于近期发布,阿里云EMR Serverless StarRocks也在火热邀测中。本文将重点介绍StarRocks 2.5版本核心功能以及阿里云EMR Serverless StarRocks特性。
759 0
StarRocks 2.5 LTS 版本新特性介绍及阿里云EMR Serverless StarRocks火热邀测中
相关产品
开源大数据平台 E-MapReduce
推荐文章
更多