EMR:一体化Hadoop云上工作平台

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: Hadoop生态体系日臻完善,如何利用Hadoop生态各项技术与阿里云更好的服务于企业。EMR最新发布的工作流管理、弹性伸缩、异构计算多项功能,更好的助力用户在阿里云上利用Hadoop、Spark生态体系解决企业大数据问题。

Hadoop生态体系日臻完善,如何利用Hadoop生态各项技术与阿里云更好的服务于企业。EMR最新发布的工作流管理、弹性伸缩、异构计算多项功能,更好的助力用户在阿里云上利用Hadoop、Spark生态体系解决企业大数据问题。

EMR数据开发工作台
EMR数据开发工作台集成了作业编辑、工作编辑和临时查询等功能,能更好的满足用户云上离线数据处理、数据分析和探索挖掘等场景。主要特点在于:

  1. 支持多样化的大数据作业,支持shell,Hive,MapReduce,Spark,SparkStreaming等多种离线,实时类型作业,企业数据开发人员可在线编辑,调试。
  2. 更低的数据开发门槛,用户通过拖拽式的大数据开发完成数据的接入,相较于Oozie、Azkaban等开源解决方案,运营人员,数据科学家可以更直观的进行大数据开发。
  3. 交互式数据探索,为用户提供交互式Hive、SparkSQL查询、分析,快速提取海量数据价值。

集群弹性伸缩
EMR弹性伸缩能更好的缝合公有云计算资源弹性和Hadoop生态体系开放的两大优势,实现计算资源根据集群繁忙程度弹性伸缩,帮助企业降低Hadoop资源的使用成本。

  1. 定时扩缩容集群,用户设置在制定时间对集群进行扩容、缩容,满足日报、周报、月报等需临时追加计算资源的场景。
  2. 支持多种ECS实例,受ECS库存影响,弹性伸缩会由于库存不足造成执行失败,为提升伸缩动作执行成功概率,弹性伸缩可同时支持多种ECS实例,且能一次性把尽量多的库存资源全部买出,保证集群资源。

EMR Learning
深度学习、AI以成为目前炙手可热的词汇,EMR Learning将深度学习和开源大数据技术深度结合,提供一体化的大数据+深度学习服务。利用一个集群,构建企业数据湖,同时进行机器学习和深度学习。

  1. 支持ECS CPU+GPU的异构计算,通过Hadoop YARN调度集群GPU资源
  2. 支持Horvod,TensorFlow,SparkML等计算框架,一个集群内进行机器学习和深度学习。
  3. 可采用PS、MPI等数据通信模式,解决深度学习的通信瓶颈
  4. 支持Docker,Muti-Env多运行环境隔离

了解更多大数据家族产品详情,欢迎点击:
https://et.aliyun.com/bigdatarelease
点击观看大数据家族产品发布会:
https://yq.aliyun.com/webinar/play/508
【阿里云新品发布】开启新一代数据智能开发之路:
https://yq.aliyun.com/roundtable/325525

相关文章
|
存储 机器学习/深度学习 SQL
图解大数据 | 分布式平台Hadoop与Map-Reduce详解
Hadoop是最基础和场景的开源分布式计算平台,ShowMeAI在本节内容中给大家讲解Hadoop相关知识。
451 0
图解大数据 | 分布式平台Hadoop与Map-Reduce详解
|
4月前
|
存储 分布式计算 Hadoop
阿里巴巴飞天大数据架构体系与Hadoop生态系统的深度融合:构建高效、可扩展的数据处理平台
技术持续创新:随着新技术的不断涌现和应用场景的复杂化,阿里巴巴将继续投入研发力量推动技术创新和升级换代。 生态系统更加完善:Hadoop生态系统将继续扩展和完善,为用户提供更多元化、更灵活的数据处理工具和服务。
|
4月前
|
存储 分布式计算 并行计算
使用Hadoop构建Java大数据分析平台
使用Hadoop构建Java大数据分析平台
|
6月前
|
分布式计算 资源调度 Hadoop
Apache Hadoop入门指南:搭建分布式大数据处理平台
【4月更文挑战第6天】本文介绍了Apache Hadoop在大数据处理中的关键作用,并引导初学者了解Hadoop的基本概念、核心组件(HDFS、YARN、MapReduce)及如何搭建分布式环境。通过配置Hadoop、格式化HDFS、启动服务和验证环境,学习者可掌握基本操作。此外,文章还提及了开发MapReduce程序、学习Hadoop生态系统和性能调优的重要性,旨在为读者提供Hadoop入门指导,助其踏入大数据处理的旅程。
885 0
|
SQL 存储 消息中间件
一面数据: Hadoop 迁移云上架构设计与实践
Hadoop 技术栈,一直是企业自建大数据平台的首选。随着企业数据量的指数级增长,云计算时代的到来,企业对存储的弹性、运维及 TCO 都提出了更高要求。曾经自建 Hadoop 大数据平台的企业正逐步将大数据平台迁移至云上。
781 1
一面数据: Hadoop 迁移云上架构设计与实践
|
存储 分布式计算 资源调度
平台服务 开源 Hadoop|学习笔记
快速学习平台服务 开源 Hadoop
平台服务 开源 Hadoop|学习笔记
|
分布式计算 Hadoop 大数据
第3期:自建Hadoop集群 VS 阿里云EMR,差距居然这么大?
本期将为大家带来开源大数据平台E-MapReduce与自建Hadoop集群对比,一起来看看吧~
901 1
第3期:自建Hadoop集群 VS 阿里云EMR,差距居然这么大?
|
分布式计算 Hadoop Java
Windows平台Hadoop环境安装配置
Windows平台Hadoop环境安装配置
144 0
|
存储 SQL 分布式计算
百草味基于“ EMR+Databricks+DLF ”构建云上数据湖的最佳实践
本文介绍了百草味大数据平台从 IDC 自建 Hadoop 到阿里云数据湖架构的迁移方案和落地过程。重点从 IDC 自建集群的痛点分析,云上大数据方案的选型以及核心模块的建设过程几个方面做了详细的介绍,希望给想了解和实践数据湖架构的企业和朋友一个参考。
百草味基于“ EMR+Databricks+DLF ”构建云上数据湖的最佳实践
|
分布式计算 Hadoop 大数据
自建Hadoop集群 VS 阿里云EMR,差距居然这么大?
本期将为大家带来开源大数据平台E-MapReduce与自建Hadoop集群对比,一起来看看吧~
1062 0
自建Hadoop集群 VS 阿里云EMR,差距居然这么大?