开发者社区> 大数据与机器学习> 开源大数据平台 E-MapReduce

开源大数据平台 E-MapReduce

关注

阿里云EMR是云原生开源大数据平台,为客户提供简单易集成的Hadoop、Hive、Spark、Flink、Presto、ClickHouse、StarRocks、Delta、Hudi等开源大数据计算和存储引擎,计算资源可以根据业务的需要调整。EMR可以部署在阿里云公有云的ECS和ACK平台。

0
今日
1662
内容
13
活动
5431
关注
|
存储 分布式计算 资源调度
|

赛题解析 | E-MapReduce 极客挑战赛

首届 E-MapReduce 极客挑战赛已开启,奖金高达26万,欢迎大家踊跃报名!本文主要讲解自测工具的使用以及代码的提交和评测,帮助选手更高效的解题。

1126 0
|
SQL 分布式计算 搜索推荐
|

《 Delta Lake 数据湖专题系列5讲》文章回顾

《Delta Lake 数据湖专题系列5讲》由阿里云 DDI 团队翻译整理自大数据技术公司 Databricks 针对数据湖 Delta Lake 系列技术文章。阅读完此系列文章可以帮助您达到入门级,对数据湖 Lakehouse 有整体上的认识和应用,掌握理论知识体系。

1458 0

E-MapReduce 数据湖 Meetup 8.7上海站延期

由于疫情防控的原因,原定 8 月 7 日的 E-MapReduce 数据湖 Meetup 延期。

476 0
|
存储 消息中间件 分布式计算
|

DLF +DDI 一站式数据湖构建与分析最佳实践

本文由阿里云数据湖构建 DLF 团队和 Databricks 数据洞察团队联合撰写,旨在帮助您更深入地了解阿里云数据湖构建(DLF)+Databricks 数据洞察(DDI)构建一站式云上数据入湖。

2406 0
|
SQL 存储 分布式计算
|

数据湖实操讲解【 JindoTable 计算加速】第二十二讲:对 Hive 数仓表进行高效小文件合并

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

1346 0
|
SQL 存储 缓存
|

数据湖实操讲解【 JindoTable 计算加速】第二十一讲:分层更高效,对 Hive 数仓进行热度/冷度统计

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

628 0
|
存储 SQL Cloud Native
|

高能预警! E-MapReduce 数据湖 Meetup · 上海站重磅来袭

8月7日,阿里云 E-MapReduce 数据湖首场 Meetup 重磅上线。来自 Intel、Cloudera、阿里巴巴的七位技术专家齐聚上海,为你带来超多数据湖干货和行业新动态~

699 0
|
分布式计算 Cloud Native 大数据
|

首届!E-MapReduce 极客挑战赛强势来袭,重磅奖项等你拿,快来组队报名啦

首届 E-MapReduce 极客挑战赛发布,聚焦.SparkSQL执行效率。结合阿里云 EMR和英特尔® 傲腾™ 数据中心级持久内存(以及Intel OAP软件包),优化软件系统和利用硬件的特征,追求TPC-DS测试集的最优性能。帮助参赛队伍实现Spark 代码优化和参数调优,完成性能的优化挑战。

672 0
|
机器学习/深度学习 存储 人工智能
|

Flink on Zeppelin 流计算处理最佳实践

欢迎钉钉扫描文章底部二维码进入 EMR Studio 用户交流群 直接和讲师交流讨论~ 点击以下链接直接观看直播回放:https://developer.aliyun.com/live/247106

981 0
|
SQL 存储 缓存
|

数据湖实操讲解【 JindoTable 计算加速】第二十讲:Spark 对 OSS 上的 ORC 数据进行查询加速

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

904 0
|
存储 SQL 分布式计算
|

数据湖实操讲解【 JindoTable 计算加速】第十九讲:Spark 对 OSS 上的 Parquet 数据进行查询加速

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

889 0
|
SQL 机器学习/深度学习 存储
|

Spark 大数据处理最佳实践

欢迎钉钉扫描文章底部二维码进入 EMR Studio 用户交流群 直接和讲师讨论交流~ 点击该链接直接观看直播回放:https://developer.aliyun.com/live/247072

3569 0
|
机器学习/深度学习 存储 缓存
|

数据湖实操讲解【 AI 训练加速】第十八讲:Fluid + JindoFS 对海量小文件的训练加速

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

1005 0
|
存储 机器学习/深度学习 人工智能
|

数据湖实操讲解【 AI 训练加速】第十七讲:Fluid + JindoFS 对 HDFS 上的数据进行训练加速

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

1035 0
|
机器学习/深度学习 存储 分布式计算
|

【详谈 Delta Lake 】系列技术专题 之 客户用例( Customer Use Case)

本文翻译自大数据技术公司 Databricks 针对数据湖 Delta Lake 的系列技术文章。众所周知,Databricks 主导着开源大数据社区 Apache Spark、Delta Lake 以及 ML Flow 等众多热门技术,而 Delta Lake 作为数据湖核心存储引擎方案给企业带来诸多的优势。本系列技术文章,将详细展开介绍 Delta Lake。

945 0
|
存储 缓存 人工智能
|

数据湖实操讲解【AI 训练加速】第十六讲:Fluid + JindoFS 对 OSS 上数据进行训练加速

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

1418 0
|
存储 机器学习/深度学习 JSON
|

【详谈 Delta Lake 】系列技术专题 之 Streaming(流式计算)

本文翻译自大数据技术公司 Databricks 针对数据湖 Delta Lake 的系列技术文章。众所周知,Databricks 主导着开源大数据社区 Apache Spark、Delta Lake 以及 ML Flow 等众多热门技术,而 Delta Lake 作为数据湖核心存储引擎方案给企业带来诸多的优势。本系列技术文章,将详细展开介绍 Delta Lake。

1950 0
|
SQL 缓存 分布式计算
|

数据湖实操讲解【JindoFS 缓存加速】第十五讲:云上计算云下数据:HDFS 缓存加速

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

5647 0
|
存储 缓存 分布式计算
|

数据湖实操讲解【JindoFS 缓存加速】第十四讲:指定表和分区来预先缓存,查询分析更高效

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

5374 0
|
存储 机器学习/深度学习 SQL
|

【详谈 Delta Lake 】系列技术专题 之 湖仓一体( Lakehouse )

本文翻译自大数据技术公司 Databricks 针对数据湖 Delta Lake 的系列技术文章。众所周知,Databricks 主导着开源大数据社区 Apache Spark、Delta Lake 以及 ML Flow 等众多热门技术,而 Delta Lake 作为数据湖核心存储引擎方案给企业带来诸多的优势。本系列技术文章,将详细展开介绍 Delta Lake。

2642 0
|
SQL 存储 分布式计算
|

【详谈 Delta Lake 】系列技术专题 之 特性(Features)

本文翻译自大数据技术公司 Databricks 针对数据湖 Delta Lake 的系列技术文章。众所周知,Databricks 主导着开源大数据社区 Apache Spark、Delta Lake 以及 ML Flow 等众多热门技术,而 Delta Lake 作为数据湖核心存储引擎方案给企业带来诸多的优势。本系列技术文章,将详细展开介绍 Delta Lake。

2069 0
|
SQL 存储 缓存
|

数据湖实操讲解【JindoFS 缓存加速】第十三讲:Presto 访问 OSS 透明缓存加速

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

11505 0
|
存储 SQL 缓存
|

数据湖实操讲解【JindoFS 缓存加速】第十二讲:Spark 访问 OSS 透明缓存加速

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

2159 0
|
存储 SQL 分布式计算
|

数据湖实操讲解【OSS 访问加速】第十一讲:打开 OSS 多版本-合规和分析两不误

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

2190 0
|
SQL 存储 数据采集
|

【详谈 Delta Lake 】系列技术专题 之 基础和性能(Fundamentals and Performance)

本文翻译自大数据技术公司 Databricks 针对数据湖 Delta Lake 的系列技术文章。众所周知,Databricks 主导着开源大数据社区 Apache Spark、Delta Lake 以及 ML Flow 等众多热门技术,而 Delta Lake 作为数据湖核心存储引擎方案给企业带来诸多的优势。本系列技术文章,将详细展开介绍 Delta Lake。

3360 0
|
存储 SQL 分布式计算
|

数据湖实操讲解【OSS 访问加速】第十讲:Impala 如何高效查询 OSS 数据

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

3642 0
|
SQL 存储 Java
|

数据湖实操讲解【OSS 访问加速】第九讲:Presto 如何高效查询 OSS 数据

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

2744 0
|
SQL 分布式计算 DataWorks
|

【月刊】E-MapReduce 2021-04/05 产品月刊

4-5月 E-MapReduce 上线EMR-3.35.x版本、EMR-4.9.x版本,同步对SmartData 3.5.x版本进行更新;客户实践案例发表《Databricks 数据洞察 Delta Lake 在基智科技(STEPONE)的应用实践》与《Databricks数据洞察在美的暖通与楼宇的应用实践》;【数据湖 JindoFS+OSS 实操干货36讲】 公开课重磅上线。欢迎持续关注更多精彩内容!

1687 0
|
存储 SQL 人工智能
|

StarLake:汇量科技云原生数据湖的探索和实践

快速了解汇量科技在云原生数据湖领域的探索和实践,详解 StarLake 的架构及业务应用案例。

1907 0
|
存储 缓存 分布式计算
|

阿里大数据云原生化实践,EMR Spark on ACK 产品介绍

欢迎钉钉扫描文章底部二维码进入 EMR钉钉交流群 直接和讲师讨论交流~ 点击该链接直接观看直播回放:https://developer.aliyun.com/live/246868

3355 0
|
存储 弹性计算 分布式计算
|

云原生数据湖构建、分析与开发治理最佳实践及案例分享

什么是数据湖?又如何对对数据湖进行分析与开发治理?本文深入浅出的介绍了云原生数据湖构建、分析与开发治理最佳实践及案例分享。

10251 1
|
SQL 消息中间件 存储
|

数据湖实操讲解【OSS 访问加速】第八讲:Flume 高效写入 OSS

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

2492 0
|
缓存 弹性计算 算法
|

数据湖实操讲解【OSS 访问加速】第七讲:Flink 高效 sink 写入 OSS

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播! 扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

2801 0
|
存储 传感器 消息中间件
|

【实践案例】Databricks 数据洞察在美的暖通与楼宇的应用实践

获取更详细的 Databricks 数据洞察相关信息,可至产品详情页查看:https://www.aliyun.com/product/bigdata/spark

2552 0
|
分布式计算 Hadoop Java
|

数据湖实操讲解【OSS 访问加速】第六讲:Hadoop/Spark 访问 OSS 加速

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播!扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

1824 0
|
存储 缓存 分布式计算
|

数据湖实操讲解【OSS 访问加速】第五讲:访问 OSS 这类对象存储最快的方式 - JindoFS SDK

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播!扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs

1429 0
|
SQL 弹性计算 分布式计算
|

实践体验的机会来了!产品免费体验活动——“基于EMR进行离线大数据分析”

听再多公开课,不如免费实操体验一把!

746 0
|
存储 机器学习/深度学习 人工智能
|

超详攻略!Databricks 数据洞察 - 企业级全托管 Spark 大数据分析平台及案例分析

5分钟读懂 Databricks 数据洞察 ~ 更多详细信息可登录 Databricks 数据洞察 产品链接:https://www.aliyun.com/product/bigdata/spark(当前产品提供¥599首购试用活动,欢迎试用!)

4744 0
|
存储 SQL 大数据
|

数据湖实操讲解【数据迁移】第四讲:如何将 Hive 数据按分区归档到 OSS

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播!扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs/blob/master/docs/jindo_distcp/jindo_distcp_overview.md

914 0
|
存储 弹性计算 分布式计算
|

数据湖实操讲解【数据迁移】第三讲:如何将 HDFS 海量文件归档到OSS

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播!扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs/blob/master/docs/jindo_distcp/jindo_distcp_overview.md

1249 1
|
SQL Java Apache
|

【阿里云EMR实战篇】以EMR测试集群版本为例,详解 Flink SQL Client 集成 Hive 使用步骤

以测试集群版本为例(EMR-4.4.1)—— Flink SQL Client 集成 Hive 使用文档

1315 0
|
存储 分布式计算 算法
|

数据湖实操讲解【数据迁移】第二讲:数据无忧 - 利用 checksum 迁移 HDFS 数据到 OSS

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播!扫文章底部二维码入钉群,线上准时观看~ Github链接: https://github.com/aliyun/alibabacloud-jindofs/blob/master/docs/jindo_distcp/jindo_distcp_overview.md

1219 0
|
SQL 存储 分布式计算
|

【实践案例】Databricks 数据洞察 Delta Lake 在基智科技(STEPONE)的应用实践

获取更详细的 Databricks 数据洞察相关信息,可至产品详情页查看:https://www.aliyun.com/product/bigdata/spark

6413 0
|
存储 分布式计算 资源调度
|

数据湖实操讲解【数据迁移】第一讲:高效迁移 HDFS 海量文件到 OSS

数据湖 JindoFS+OSS 实操干货 36讲 每周二16点准时直播!扫文章底部二维码入钉群,线上准时观看~

1253 0
|
存储 SQL 人工智能
|

干货满满!【数据湖 JindoFS+OSS 实操干货36讲】 直播预告来袭!

扫描海报上的钉钉群二维码入群,线上观看直播,每周二16:00 准时开播!

817 0
|
SQL 架构师 Java
|

一篇看懂!MLSQL 是如何作为一个可编程的 SQL 语言的?

重点讲解 MLSQL 的一些语法特性,通过这些特性的覆盖,我们可以看到 MLSQL 是怎么作为一个可编程的 SQL 语言的。

1448 0
|
SQL 消息中间件 JSON
|

Delta Lake在Soul的应用实践

传统离线数仓模式下,日志入库前首要阶段便是ETL,我们面临如下问题:天级ETL任务耗时久,影响下游依赖的产出时间;凌晨占用资源庞大,任务高峰期抢占大量集群资源;ETL任务稳定性不佳且出错需凌晨解决、影响范围大。为了解决天级ETL逐渐尖锐的问题,所以这次我们选择了近来逐渐进入大家视野的数据湖架构,基于阿里云EMR的Delta Lake,我们进一步打造优化实时数仓结构,提升部分业务指标实时性,满足更多更实时的业务需求。

7479 0
|
SQL 分布式计算 Kubernetes
|

阿里云EMR实习生招聘

阿里云EMR团队等你来加盟

1015 0
|
人工智能 大数据
|

Databricks数据洞察公开课!精彩案例,成功实践,技术解读都在这里!

欢迎观看Databricks数据洞察公开课,Databricks专注三个场景:🤗大数据和AI一体化,数据/模型开发与计算;😄商业版Delta Lake 流批一体解决方案;😊全托管、高性能spark,优于开源数十倍。此公开课从2021年1月开始,每月更新课程视频,希望帮助企业快速搭建数智基建。

920 0
|
存储 缓存 分布式计算
|

拥抱云原生,Fluid结合JindoFS :阿里云OSS加速利器

Fluid 是一个开源的 Kubernetes 原生的分布式数据集编排和加速引擎,主要服务于云原生场景下的数据密集型应用。在 Fluid 上使用和部署 JindoRuntime 实现数据集的可见性、弹性伸缩、数据迁移、计算加速等,并流程简单、兼容原生 k8s 环境、可以开箱即用。同时深度结合对象存储特性,使用navite框架优化性能,并支持免密、checksum校验等云上数据安全功能。

988 0
我要发布