阿里云E-MapReduce产品新动态及开源大数据前沿技术 2023-3月刊

本文涉及的产品
EMR Serverless StarRocks,5000CU*H 48000GB*H
简介: 开源大数据EMR产品技术月刊,涵盖本月技术速递、产品和功能发布、市场和客户应用实践等内容,帮助您快速了解开源大数据最新动态。

E-MapReduce & DLF 产品新进展

一、EMR&DLF 新平台功能发布

1、EMR 发布 Spark Native Engine

EMR 发布 Spark Native Engine 对外公测版(EMR-3.45.1和EMR-5.11.1),Spark3 服务可一键开启 Native Engine,支持 SparkSQL、DataFrame 和 PySpark 等应用程序,在标准化测试集 TPC-DS 中, Spark Native Engine 相对于 Java Engine 可提升30%以上。



2、支持默认创建存算分离集群

适用客户:希望使用存算分离集群的客户。


发布功能:创建集群时,可以选择 Hive 存储模式和 Hive 数据仓库路径。


相关文档:https://help.aliyun.com/document_detail/343457.html


3、按负载弹性伸缩规则支持设置多指标触发条件

适用客户:希望使用EMR弹性伸缩功能的客户


发布功能:用户配置按负载弹性伸缩规则时,可以选择多个系统定义的负载指标。通过多个负载指标衡量集群负载情况,可以降低节点数量变化频率,增加硬件资源利用率。


相关文档:https://help.aliyun.com/document_detail/445658.htm


4、数据湖构建(DLF)生命周期支持 OSS-HDFS

适用客户:使用 OSS-HDFS 作为大数据存储,有自动存储降本等需求通过生命周期管理对数据湖中的数据库、数据表配置数据管理规则,对数据定期进行存储类型转换,从而节省数据存储成本。


发布功能:数据湖构建(DLF)生命周期支持OSS-HDFS


相关文档:https://help.aliyun.com/document_detail/426233.html



5、数据湖构建(DLF)增加Flink入湖、EMR统一权限最佳实践

适用客户:所有DLF用户


发布功能:数据湖构建(DLF)增加Flink入湖、EMR统一权限最佳实践。


相关文档:



二、E-MapReduce&DLF国际站

1、数据湖构建(DLF)支持印尼Region

适用客户:国际站印尼客户


发布功能:数据湖构建(DLF)产品在印尼正式发布上线。



三、EMR Doctor 智能运维系统

1、EMR Doctor 新增三处地域发布

适用客户:所有 EMR Doctor 用户


发布功能:EMR Doctor 产品在印尼Region、张家口Region,弗吉尼亚 Region正式发布上线。



E-MapReduce 产品活动

1、阿里云 E-MapReduce Serverless StarRocks 开启全面公测

EMR Serverless StarRocks 是由阿里云EMR全新推出的 Serverless StarRocks 服务,StarRocks 是一款高性能分析型数据仓库,使用向量化、MPP 架构、可实时更新的列式存储引擎等技术实现多维、实时、高并发的数据分析。可广泛应用于BI报表分析、OLAP 报表、数据湖分析、实时数据接入及分析等场景。  

   

EMR Serverless StarRocks 相较于开源 StarRocks 产品特性包括:

  • 提供免运维,全托管的 StarRocks 实例管理服务,提升服务的稳定性,可运维性,降低您的运维成本。        
  • 提供可视化,高效率的实例管理,监控告警,配置管理能力。        
  • 专业的 StarRocks Manager,为 StarRocks 管理提供便捷的,可视化的元数据管理,诊断与优化,以及用户管理和授权能力。  


阿里云 EMR Serverless StarRocks 公测入口: https://help.aliyun.com/document_detail/475867.htm



最佳技术实践

1、阿里云EMR 2.0:定义下一代云原生智能数据湖

本次分享主要介绍了阿里云云原生数据湖分析解决方案的三个核心要素:全托管,湖存储;一站式,湖管理;多模态,湖计算。


文章详情:https://developer.aliyun.com/article/1174063


2、基于阿里云 CloudMonitor云监控自定义监控大盘对 EMR 自定义监控实践

本文旨在分享 EMR 平台大数据服务基于阿里云 CloudMonitor 的监控实践,给客户提供除了 EMR 平台默认监控以外,自建监控方式,适用于统一多个阿里云服务的监控监控场景。


文章详情:https://developer.aliyun.com/article/1174779



3、数据湖存储的安全写入之道

本文以 Hadoop 社区中的 S3A Connector 的实现为切入,分析了数据湖写入路径的安全性。


文章详情:https://developer.aliyun.com/article/1175339



4、通过云监控CloudMonitor实时捕获EMR集群的状态变化

通过结合CloudMonitor以及FC,可以实时捕获EMR集群的生命周期变化,如集群的创建和停止,扩容和缩容以及其他类型的集群状态变更等。


文章详情:https://developer.aliyun.com/article/1179796



5、阿里云EMR自定义日志投递与使用实践分享

EMR目前支持了日志管理,即日志客户SLS投递的功能,基于此功能,客户可以将需要的各种大数据组件日志收集到自身SLS中,做查询和分析。基于此功能,客户可以自定义日志路径、规则,对集群设备上的日志自行接收和消费。本文以采集指标文件为例,帮助您快速上手自定义日志投递与使用。


文章详情:https://developer.aliyun.com/article/1181210




钉钉扫码进群,欢迎咨询与交流前沿开源大数据

image.png

相关实践学习
数据湖构建DLF快速入门
本教程通过使⽤数据湖构建DLF产品对于淘宝用户行为样例数据的分析,介绍数据湖构建DLF产品的数据发现和数据探索功能。
目录
相关文章
|
7天前
|
存储 机器学习/深度学习 SQL
大数据处理与分析技术
大数据处理与分析技术
34 2
|
9天前
|
存储 分布式计算 NoSQL
【赵渝强老师】大数据技术的理论基础
本文介绍了大数据平台的核心思想,包括Google的三篇重要论文:Google文件系统(GFS)、MapReduce分布式计算模型和BigTable大表。这些论文奠定了大数据生态圈的技术基础,进而发展出了Hadoop、Spark和Flink等生态系统。文章详细解释了GFS的架构、MapReduce的计算过程以及BigTable的思想和HBase的实现。
|
10天前
|
SQL 存储 算法
比 SQL 快出数量级的大数据计算技术
SQL 是大数据计算中最常用的工具,但在实际应用中,SQL 经常跑得很慢,浪费大量硬件资源。例如,某银行的反洗钱计算在 11 节点的 Vertica 集群上跑了 1.5 小时,而用 SPL 重写后,单机只需 26 秒。类似地,电商漏斗运算和时空碰撞任务在使用 SPL 后,性能也大幅提升。这是因为 SQL 无法写出低复杂度的算法,而 SPL 提供了更强大的数据类型和基础运算,能够实现高效计算。
|
13天前
|
存储 人工智能 分布式计算
大数据& AI 产品月刊【2024年10月】
大数据& AI 产品技术月刊【2024年10月】,涵盖本月技术速递、产品和功能发布、市场和客户应用实践等内容,帮助您快速了解阿里云大数据& AI 方面最新动态。
|
13天前
|
存储 大数据 定位技术
大数据 数据索引技术
【10月更文挑战第26天】
32 3
|
13天前
|
存储 大数据 OLAP
大数据数据分区技术
【10月更文挑战第26天】
45 2
|
16天前
|
消息中间件 分布式计算 大数据
数据为王:大数据处理与分析技术在企业决策中的力量
【10月更文挑战第29天】在信息爆炸的时代,大数据处理与分析技术为企业提供了前所未有的洞察力和决策支持。本文探讨了大数据技术在企业决策中的重要性和实际应用,包括数据的力量、实时分析、数据驱动的决策以及数据安全与隐私保护。通过这些技术,企业能够从海量数据中提取有价值的信息,预测市场趋势,优化业务流程,从而在竞争中占据优势。
51 2
zdl
|
5天前
|
消息中间件 运维 大数据
大数据实时计算产品的对比测评:实时计算Flink版 VS 自建Flink集群
本文介绍了实时计算Flink版与自建Flink集群的对比,涵盖部署成本、性能表现、易用性和企业级能力等方面。实时计算Flink版作为全托管服务,显著降低了运维成本,提供了强大的集成能力和弹性扩展,特别适合中小型团队和业务波动大的场景。文中还提出了改进建议,并探讨了与其他产品的联动可能性。总结指出,实时计算Flink版在简化运维、降低成本和提升易用性方面表现出色,是大数据实时计算的优选方案。
zdl
24 0
|
1月前
|
存储 机器学习/深度学习 分布式计算
大数据技术——解锁数据的力量,引领未来趋势
【10月更文挑战第5天】大数据技术——解锁数据的力量,引领未来趋势
|
6天前
|
存储 分布式计算 数据挖掘
数据架构 ODPS 是什么?
数据架构 ODPS 是什么?
51 7

相关产品

  • 开源大数据平台 E-MapReduce