开发者社区> 大数据与机器学习> 开源大数据平台 E-MapReduce

开源大数据平台 E-MapReduce

关注

阿里云EMR是云原生开源大数据平台,为客户提供简单易集成的Hadoop、Hive、Spark、Flink、Presto、ClickHouse、StarRocks、Delta、Hudi等开源大数据计算和存储引擎,计算资源可以根据业务的需要调整。EMR可以部署在阿里云公有云的ECS和ACK平台。

0
今日
1662
内容
13
活动
5431
关注
|
存储 缓存 分布式计算
|

10亿+文件数压测,阿里云JindoFS轻松应对

Apache Hadoop FileSystem (HDFS) 是被广为使用的大数据存储方案,其核心元数据服务 NameNode 将全部元数据存放在内存中,因此所能承载的元数据规模受限于内存,单个实例所能支撑的文件个数大约 4亿。JindoFS块模式是阿里云基于 OSS 海量存储自研的一个存储优化系统,提供了高效的数据读写加速能力和元数据优化能力。JindoFS 实际表现如何,我们在 10亿文件数规模下做了压测,验证 JindoFS 在达到这个规模的时候是否还可以保持稳定的性能。

1079 0
|
SQL 消息中间件 分布式计算
|

阿里云 EMR Delta Lake 在流利说数据接入中的架构和实践

为了消灭数据孤岛,企业往往会把各个组织的数据都接入到数据湖以提供统一的查询或分析。本文将介绍流利说当前数据接入的整个过程,期间遇到的挑战,以及delta在数据接入中产生的价值。

11697 0
|
存储 SQL 缓存
|

大数据和AI | 基于Spark的高性能向量化查询引擎

由阿里云策划并成功举办的BigData和AI 见面会2020第二季在上海落下帷幕。在此次见面会上,几位业界大咖分别分享了有关大数据和AI的见解、洞察和领先技术等内容。本篇内容是由开源界知名的Databricks公司的技术主管范文臣分享的关于《基于Spark的高性能向量化查询引擎》。

2838 0
|
存储 分布式计算 资源调度
|

降本增效利器!趣头条Spark Remote Shuffle Service最佳实践

趣头条是一家依赖大数据的科技公司,在2018-2019年经历了业务的高速发展,主App和其他创新App的日活增加了10倍以上,相应的大数据系统也从最初的100台机器增加到了千台规模。面对业务和数据的日益增长,如何优化大数据平台,真正实现降本增效,技术人也面临着非常大的挑战,近半年趣头条和阿里云一起合作,通过Spark Remote Shuffle Service取得了较大的进展,在这里大家可以更加详细地了解这套方案。

12332 2
|
SQL 机器学习/深度学习 人工智能
|

2020收官行—BIGDATA + AI Meetup 2020第三站·北京站开启报名!

始于开源,精于实践,作为2020年收官之战,本次 Meetup 又将让大数据和 AI 擦出怎样的技术花火?开源届冉冉升起的新星和风光无限的老将们将会用哪些精彩案例作为年度收尾?来自阿里云、滴滴出行、微博、Databricks、汇量科技、 Zilliz 等知名企业的技术大咖将以实践案例深度解读大数据+AI的现在与未来。落地到出行、应用于医疗、服务在社交媒体,我们从声音、影像、图片、数字···交织的信息巨网中撕出一道道出口,透出属于大数据人的科技之光。

3736 0
|
存储 缓存 人工智能
|

数据湖存储架构选型

阿里巴巴计算平台事业部郑锴为大家带来数据湖存储架构选型的介绍

4150 0
|
存储 消息中间件 分布式计算
|

DeltaLake在工业大脑的实践分享

随着2020年云栖大工业大脑3.0的发布,工业大脑已经经历了多年的发展。本文将为大家分享,在工业数据中台建设中使用DeltaLake的优秀实践,主要包括: (1) 异地异构流消息的处理 (2) 流批融合的数据分析 (3) 对事务的处理和对算法的支持

4353 0
|
消息中间件 存储 人工智能
|

精彩回顾 | 大数据+AI Meetup 2020 第二季 ·上海站(附PPT下载)

开源届前浪后浪全员凶猛,合体也成为主流。此次 Meetup 分享了 Flink 和 Iceberg,Flink 和 Hologres,Flink 和 Pulsar 的深度融合探索实践、Spark 高性能向量化查询引擎解析、热度冲天的数据湖存储架构选型、bilibili 和滴滴的 kafka 平台优化方案;还 有Elasticsearch、开源流式存储系统 Pravega 的企业级实践。

4962 0
|
存储 机器学习/深度学习 分布式计算
|

10月29日社区直播【Spark Shuffle RPMem扩展: 借助持久内存与RDMA加速Spark 数据分析】

介绍如何利用持久化内存与高性能RDMA 网络来加速Spark Shuffle。

4679 0
|
消息中间件 存储 人工智能
|

下半年你关心的行业热点都在这里,BIGDATA+AI Meetup 2020第二站·上海站开启报名!

本次活动汇集2020年下半年开发者最关心的开源主题,搜罗了数据湖、数仓架构、实时计算等热门议题,9位行业资深专家,硬核输出,用实践说话。

5363 0
|
机器学习/深度学习 分布式计算 DataWorks
|

大数据上手实战!Spark 实战训练营第三季开启

首期大数据“9营齐开”计划吸引了10000+开发者报名参与,成为今夏最火爆的大数据训练营!伴随着第一季训练营的完美落幕,大数据训练营“九营齐开”第二季,暨Spark 实战训练营第三季开启!蓄势待发!

7131 0
|
机器学习/深度学习 分布式计算 并行计算
|

10月15日社区直播【Intel MLlib:构建平台优化的Spark机器学习】

Intel MLlib是一个为Apache Spark MLlib优化的软件包。它在保持和Spark MLlib兼容的同时,在底层利用原生算法库来实现在CPU和GPU上的最优化算法,同时使用Collective Communication来实现效率更高的节点间通信。我们的初步结果表明,该软件包在最小化应用改动的基础上,可以极大地提升MLlib算法的性能。

3148 0
|
SQL 弹性计算 分布式计算
|

E-MapReduce客户端安装和卸载工具,实现Gateway功能

E-MapReduce客户端安装和卸载工具,主要用于集群外的ECS(已经存在)中需要使用hadoop,hive等客户端命令工具。 目前云平台提供的gateway只能重新创建ECS进行部署,而不支持在已经创建的Ecs中部署。

3420 0
|
存储 SQL 分布式计算
|

如何实现Spark on Kubernetes?

大数据时代,以Oracle为代表的数据库中间件已经逐渐无法适应企业数字化转型的需求,Spark将会是比较好的大数据批处理引擎。而随着Kubernetes越来越火,很多数字化企业已经把在线业务搬到了Kubernetes之上,并希望在此之上建设一套统一的、完整的大数据基础架构。那么Spark on Kubernetes面临哪些挑战?又该如何解决?

20897 0
|
存储 SQL 机器学习/深度学习
|

数据湖架构,为什么需要“湖加速”?

湖加速即为数据湖加速,是指在数据湖架构中,为了统一支持各种计算,对数据湖存储提供适配支持,进行优化和缓存加速的中间层技术。那么为什么需要湖加速?数据湖如何实现“加速”?本文将从三个方面来介绍湖加速背后的原因,分享阿里云在湖加速上的实践经验和技术方案。

35844 0
|
存储 缓存 分布式计算
|

重磅下载!首次揭秘如何构建阿里云云原生数据湖体系

《阿里云云原生数据湖体系全解读》涵盖数据湖存储、加速、构建、计算、治理,一站搭建全新云原生数据湖体系,完成企业大数据架构转型。速度下载收藏!

96599 6
|
分布式计算 大数据
|

欢迎加入 E- MapReduce 钉钉产品交流群

一起大数据吧

3233 0
|
存储 缓存 分布式计算
|

JindoFS 存储策略和读写优化

本次分享主要介绍数据读写在计算存储分离的场景下所面临的常见问题以及相关的优化手段,并结合JindoFS应用场景介绍对数据缓存加速的相关技术和策略。

2799 0
|
存储 SQL 分布式计算
|

官宣!阿里云重磅发布云原生数据湖体系

介绍如何基于阿里云 OSS 、JindoFS 和数据湖构建(Data Lake Formation,DLF)等基础服务,同时结合阿里云上丰富的计算引擎,打造一个全新云原生数据湖体系。

39845 0
|
存储 SQL 分布式计算
|

【数据湖开发治理篇】——数据湖开发治理平台DataWorks

元数据管理、数据集成、数据开发是数据湖需要解决的三大问题,阿里云的DataWorks作为一个通用的大数据平台,除了很好的解决了数仓场景的各类问题,也同样解决了数据湖场景中的核心痛点。

24474 0
|
存储 缓存 分布式计算
|

Serverless Spark的弹性利器 - EMR Shuffle Service

在传统计算存储混合的架构中,为了兼顾计算和存储,CPU和存储设备都不能太差,因此牺牲了灵活性,提高了成本。在计算存储分离架构中,可以独立配置计算机型和存储机型,具有极大的灵活性,从而降低成本。

19411 0
|
SQL 存储 分布式计算
|

云原生计算引擎挑战与解决方案

云原生比较有前景的实现就是Kubernetes,所以有时候我们一提到云原生,几乎就等价于是Kubernetes。

15681 0
|
SQL 存储 分布式计算
|

数据湖构建服务搭配Delta Lake玩转CDC实时入湖

Change Data Capture(CDC)用来跟踪捕获数据源的数据变化,并将这些变化同步到目标存储(如数据湖或数据仓库),用于数据备份或后续分析,同步过程可以是分钟/小时/天等粒度,也可以是实时同步。CDC方案分为侵入式(intrusive manner)和非倾入性(non-intrusive manner)两种。

12898 0
|
存储 SQL 分布式计算
|

多数据源一站式入湖

通过一站式入湖,将不同数据源的数据统一归并到以OSS对象存储为基础架构的集中式数据湖存储中,解决了企业面临的数据孤岛问题,为统一的数据分析打好了基础.

12711 0
|
存储 SQL 分布式计算
|

多引擎集成挖掘湖上数据价值

在 EMR 集群创建阶段已经自动安装了数据构建服务的相关SDK,同时EMR上的开源计算引擎 Spark、Hive 和 Presto 都完成了对数据湖构建服务的兼容支持,所以用户通过 EMR 引擎可获得数据湖分析的最佳体验。

5114 0
|
存储 SQL 分布式计算
|

数据湖元数据服务的实现和挑战

数据湖元数据服务为大数据而生,为互通生态而生,期望后续继续完善其服务能力和支撑更多的大数据引擎,通过开放的服务能力、存储能力、统一的权限及元数据管理能力,为客户节省管理/人力/存储等各项成本,实现客户自己的业务价值。

11588 0
|
存储 分布式计算 搜索推荐
|

JindoDistCp数据湖离线数据迁移最佳实践

JindoDistCp是阿里云E-MapReduce团队开发的大规模集群内部和集群之间分布式文件拷贝的工具

11830 0
|
存储 缓存 分布式计算
|

JindoTable数据湖优化与查询加速

近几年,数据湖架构的概念逐渐兴起,很多企业都在尝试构建数据湖。相比较大数据平台,数据湖在数据治理方面提出了更高的要求。对于数据湖场景所提出的新需求,“传统”的大数据工具在很多方面都面临着新的挑战。JindoTable 正是专为解决数据湖管理结构化数据甚至是半结构化数据的痛点而设计的,包括数据治理功能和查询加速功能。

10508 0
|
机器学习/深度学习 存储 缓存
|

JindoFS缓存加速数据湖上的机器学习训练

JindoFS提供了一个计算侧的分布式缓存系统,可以有效利用计算集群上的本地存储资源(磁盘或者内存)缓存OSS上的热数据,从而减少对OSS上数据的反复拉取,消耗网络带宽。

28818 0
|
存储 缓存 分布式计算
|

基于JindoFS+OSS构建高效数据湖

Jindo 是阿里云基于 Apache Spark / Apache Hadoop 在云上定制的分布式计算和存储引擎

31412 0
|
存储 分布式计算 安全
|

基于OSS的EB级数据湖

数据湖无缝对接多种计算分析平台,对Hadoop生态支持良好,存储在数据湖中的数据可以直接对其进行数据分析、处理、查询,通过对数据深入挖掘与分析,洞察数据中蕴含的价值。

10430 108
|
大数据 视频直播
|

阿里巴巴数据湖技术对外公布

数据湖构建·Data Lake Formation是阿里巴巴数据湖团队带来的最新一站式入湖解决方案,助力企业无缝对接多种计算引擎,打破孤岛,洞察业务价值。本技术圈会持续发布最新产品动向和技术解读,更有不定期视频直播,与您一起完成企业大数据架构转型。敬请关注

5695 0
|
人工智能 大数据 BI
|

阿里云 EMR 产品内部培训课程首次免费对外公开!

EMR产品技术团队将在这四节课中,循序渐进的为大家介绍一个开源大数据平台的产品产生背景、使用场景、操作规则等,更多的是面对企业实际需求时,阿里云大数据团队的一些思考方式。

2620 0
|
存储 SQL 分布式计算
|

9月10日 Spark 社区直播【利用持久内存提速Spark】

主要探讨如何在Spark上使用持久内存这一新技术来进一步提速性能。具体会介绍基于Plasma的共享内存方案来提速SQL数据源访问的性能以及利用持久内存扩展Spark现有内存磁盘存储层级来提速RDD cache在迭代式计算中的效果。

3473 0
|
SQL 存储 缓存
|

EMR Spark-SQL性能极致优化揭秘 Native Codegen Framework

EMR团队探索并开发了SparkSQL Native Codegen框架,为SparkSQL换了引擎,新引擎带来最高4倍性能提升,为EMR再次获取世界第一立下汗马功劳。来自阿里云EMR团队的周克勇将详细介绍Native Codegen框架。

4445 0
|
SQL 存储 缓存
|

8月27日 Spark 社区直播【OAP Spark 优化介绍: 通过索引和缓存优化交互式查询性能】

简单介绍OAP的总体蓝图。同时详细介绍其中的一个具体优化,使用索引和缓存来解决交互式查询性能挑战。

2017 0
|
存储 机器学习/深度学习 SQL
|

使用 E-MapReduce 构建云上数据湖

本篇来自于阿里巴巴E-MapReduce(简称为EMR)产品经理子关,分享云上使用E-MapReduce快速构建企业数据湖的落地方案以及客户最佳实践。

3835 0
|
分布式计算 大数据 Apache
|

文末有福利!Spark 实战训练营新增1000名额,8月24日正式开课

Spark 实战训练营新增1000名额,8月24日正式开课

3030 0
|
消息中间件 SQL 分布式计算
|

Apache Spark™ 3.0中全新的Structured Streaming UI

Spark 3.0中新的Structured Streaming UI会提供一些有用的信息和统计数据,以此来监视所有流作业,便于在开发调试过程中排除故障。同时,开发者还能够获得实时的监测数据,这能使生产流程更直观。

3980 0
|
机器学习/深度学习 分布式计算 DataWorks
|

9大训练营免费开营!阿里云大数据团队的独门绝学全在这了

阿里云智能高级研究员贾扬清出品,实时计算 Flink、Hologres、EMR、机器学习 PAI、MaxCompute、DataWorks、ElasticSearch 等多个技术/产品一线专家齐上阵,核心开发阵容在线直播教学。

3356 0
|
分布式计算 Spark Apache
|

限免首发 | Spark 企业级实战集锦,国内Spark开发者的进阶指南!

《Apache Spark 中文实战攻略》上下两册电子书重磅来袭,本书集结国内外顶级大厂技术专家,汇集多年实战经验,带你走进全球顶级开源社区之一 Apache Spark,探秘时下最流行的开源分布式内存式大数据处理引擎。

15676 0
|
SQL 分布式计算 Spark
|

国内Spark开发者的免费入门宝典!首发作者阵容高手云集!

《Apache Spark 中文实战攻略》上下两册电子书重磅来袭,本书集结国内外顶级大厂技术专家,汇集多年实战经验,带你走进全球顶级开源社区之一 Apache Spark,探秘时下最流行的开源分布式内存式大数据处理引擎。

43634 0
|
SQL 存储 分布式计算
|

Spark 3.0 对于 DATE 和 TIMESTAMP 的改进

本文将会深入介绍DATE和TIMESTAMP

8713 0
|
SQL 数据采集 分布式计算
|

深入研究Apache Spark 3.0的新功能

分享嘉宾 Apache Spark PMC李潇,就职于 Databricks,Spark 研发部主管,领导 Spark,Koalas,Databricks runtime,OEM 的研发团队,在直播中为大家深入讲解了Apache Spark 3.0的新功能。

3622 0
|
分布式计算 大数据 Apache
|

稳赚不赔~Spark社区招募志愿者!

可能是21世纪唯一不看颜值只看人品的招募

1164 0
|
机器学习/深度学习 人工智能 分布式计算
|

使用Ray将可扩展的自动化机器学习(AutoML)用于时序预测

机器学习和深度学习在时序预测上有更好的表现,前提是生成好的模型。但训练出好的模型并不是那么容易的,尤其是那些新手,这也就说明了为什么AutoML越来越火。在Analytics Zoo当中用户可以使用AutoML,在很短的时间内得到满足准确度要求的模型.在2020 Spark+AI峰会直播中,由Intel高级架构师黄晟盛为您介绍时序应用典型场景,基于AutoML的时序解决方案,同时结合实际案例与大家分享与客户的合作经验和反馈。

1607 0
|
分布式计算 大数据 Spark
|

7月30日产品直播【EMR Spark-SQL性能极致优化揭秘 Native Codegen Framework】

EMR团队探索并开发了SparkSQL Native Codegen框架,为SparkSQL换了引擎,新引擎带来最高4倍性能提升,为EMR再次获取世界第一立下汗马功劳,本次直播将详细介绍Native Codegen框架。

1619 0
|
机器学习/深度学习 人工智能 分布式计算
|

Analytics Zoo 入门 | Spark“数字人体”AI挑战赛赛题解析一

首届Spark“数字人体”AI挑战赛已开启,奖金高达46万,欢迎大家踊跃报名!本次直播将由英特尔高级软件工程师邱鑫为大家介绍如何使用Spark, Big DL及Analytics Zoo平台,分别从Analytics Zoo & BigDL简介、Analytics Zoo入门以及Analytics Zoo提供的End-to-End Pipelines和ML Workflow等方面详细展开讲解。

1646 0
|
SQL 消息中间件 分布式计算
|

领英如何应对Apache Spark的Scalability挑战

在集群计算引擎使用率快速增长的过程当中,会面对多维度的计算基础架构规模扩展性的挑战。同时由于Spark团队直接与Spark用户打交道,如何提升Spark用户生产力,避免“用户支持陷阱”,一直是较为头疼的问题。本次直播将由领英Spark团队软件工程师沈旻和林致远为您介绍,领英Spark 生态系统,构建多元化Spark 生态系统过程中遇到的挑战,如何提升Spark用户生成力以及如何优化Spark基础计算架构。

1251 0
我要发布