阿里云E-MapReduce产品新动态及开源大数据前沿技术 2023-3月刊

本文涉及的产品
EMR Serverless StarRocks,5000CU*H 48000GB*H
EMR Serverless Spark 免费试用,1000 CU*H 有效期3个月
简介: 开源大数据EMR产品技术月刊,涵盖本月技术速递、产品和功能发布、市场和客户应用实践等内容,帮助您快速了解开源大数据最新动态。

E-MapReduce & DLF 产品新进展

一、EMR&DLF 新平台功能发布

1、EMR 发布 Spark Native Engine

EMR 发布 Spark Native Engine 对外公测版(EMR-3.45.1和EMR-5.11.1),Spark3 服务可一键开启 Native Engine,支持 SparkSQL、DataFrame 和 PySpark 等应用程序,在标准化测试集 TPC-DS 中, Spark Native Engine 相对于 Java Engine 可提升30%以上。



2、支持默认创建存算分离集群

适用客户:希望使用存算分离集群的客户。


发布功能:创建集群时,可以选择 Hive 存储模式和 Hive 数据仓库路径。


相关文档:https://help.aliyun.com/document_detail/343457.html


3、按负载弹性伸缩规则支持设置多指标触发条件

适用客户:希望使用EMR弹性伸缩功能的客户


发布功能:用户配置按负载弹性伸缩规则时,可以选择多个系统定义的负载指标。通过多个负载指标衡量集群负载情况,可以降低节点数量变化频率,增加硬件资源利用率。


相关文档:https://help.aliyun.com/document_detail/445658.htm


4、数据湖构建(DLF)生命周期支持 OSS-HDFS

适用客户:使用 OSS-HDFS 作为大数据存储,有自动存储降本等需求通过生命周期管理对数据湖中的数据库、数据表配置数据管理规则,对数据定期进行存储类型转换,从而节省数据存储成本。


发布功能:数据湖构建(DLF)生命周期支持OSS-HDFS


相关文档:https://help.aliyun.com/document_detail/426233.html



5、数据湖构建(DLF)增加Flink入湖、EMR统一权限最佳实践

适用客户:所有DLF用户


发布功能:数据湖构建(DLF)增加Flink入湖、EMR统一权限最佳实践。


相关文档:



二、E-MapReduce&DLF国际站

1、数据湖构建(DLF)支持印尼Region

适用客户:国际站印尼客户


发布功能:数据湖构建(DLF)产品在印尼正式发布上线。



三、EMR Doctor 智能运维系统

1、EMR Doctor 新增三处地域发布

适用客户:所有 EMR Doctor 用户


发布功能:EMR Doctor 产品在印尼Region、张家口Region,弗吉尼亚 Region正式发布上线。



E-MapReduce 产品活动

1、阿里云 E-MapReduce Serverless StarRocks 开启全面公测

EMR Serverless StarRocks 是由阿里云EMR全新推出的 Serverless StarRocks 服务,StarRocks 是一款高性能分析型数据仓库,使用向量化、MPP 架构、可实时更新的列式存储引擎等技术实现多维、实时、高并发的数据分析。可广泛应用于BI报表分析、OLAP 报表、数据湖分析、实时数据接入及分析等场景。  

   

EMR Serverless StarRocks 相较于开源 StarRocks 产品特性包括:

  • 提供免运维,全托管的 StarRocks 实例管理服务,提升服务的稳定性,可运维性,降低您的运维成本。        
  • 提供可视化,高效率的实例管理,监控告警,配置管理能力。        
  • 专业的 StarRocks Manager,为 StarRocks 管理提供便捷的,可视化的元数据管理,诊断与优化,以及用户管理和授权能力。  


阿里云 EMR Serverless StarRocks 公测入口: https://help.aliyun.com/document_detail/475867.htm



最佳技术实践

1、阿里云EMR 2.0:定义下一代云原生智能数据湖

本次分享主要介绍了阿里云云原生数据湖分析解决方案的三个核心要素:全托管,湖存储;一站式,湖管理;多模态,湖计算。


文章详情:https://developer.aliyun.com/article/1174063


2、基于阿里云 CloudMonitor云监控自定义监控大盘对 EMR 自定义监控实践

本文旨在分享 EMR 平台大数据服务基于阿里云 CloudMonitor 的监控实践,给客户提供除了 EMR 平台默认监控以外,自建监控方式,适用于统一多个阿里云服务的监控监控场景。


文章详情:https://developer.aliyun.com/article/1174779



3、数据湖存储的安全写入之道

本文以 Hadoop 社区中的 S3A Connector 的实现为切入,分析了数据湖写入路径的安全性。


文章详情:https://developer.aliyun.com/article/1175339



4、通过云监控CloudMonitor实时捕获EMR集群的状态变化

通过结合CloudMonitor以及FC,可以实时捕获EMR集群的生命周期变化,如集群的创建和停止,扩容和缩容以及其他类型的集群状态变更等。


文章详情:https://developer.aliyun.com/article/1179796



5、阿里云EMR自定义日志投递与使用实践分享

EMR目前支持了日志管理,即日志客户SLS投递的功能,基于此功能,客户可以将需要的各种大数据组件日志收集到自身SLS中,做查询和分析。基于此功能,客户可以自定义日志路径、规则,对集群设备上的日志自行接收和消费。本文以采集指标文件为例,帮助您快速上手自定义日志投递与使用。


文章详情:https://developer.aliyun.com/article/1181210




钉钉扫码进群,欢迎咨询与交流前沿开源大数据

image.png

目录
相关文章
|
1月前
|
存储 人工智能 大数据
云栖2025|阿里云开源大数据发布新一代“湖流一体”数智平台及全栈技术升级
阿里云在云栖大会发布“湖流一体”数智平台,推出DLF-3.0全模态湖仓、实时计算Flink版升级及EMR系列新品,融合实时化、多模态、智能化技术,打造AI时代高效开放的数据底座,赋能企业数字化转型。
505 0
|
3月前
|
数据采集 人工智能 分布式计算
ODPS在AI时代的发展战略与技术演进分析报告
ODPS(现MaxCompute)历经十五年发展,从分布式计算平台演进为AI时代的数据基础设施,以超大规模处理、多模态融合与Data+AI协同为核心竞争力,支撑大模型训练与实时分析等前沿场景,助力企业实现数据驱动与智能化转型。
353 4
|
26天前
|
数据可视化 大数据 关系型数据库
基于python大数据技术的医疗数据分析与研究
在数字化时代,医疗数据呈爆炸式增长,涵盖患者信息、检查指标、生活方式等。大数据技术助力疾病预测、资源优化与智慧医疗发展,结合Python、MySQL与B/S架构,推动医疗系统高效实现。
|
2月前
|
人工智能 分布式计算 DataWorks
阿里云大数据AI产品月刊-2025年8月
阿里云大数据& AI 产品技术月刊【2025年 8 月】,涵盖 8 月技术速递、产品和功能发布、市场和客户应用实践等内容,帮助您快速了解阿里云大数据& AI 方面最新动态。
284 1
|
2月前
|
存储 分布式计算 资源调度
【赵渝强老师】阿里云大数据MaxCompute的体系架构
阿里云MaxCompute是快速、全托管的EB级数据仓库解决方案,适用于离线计算场景。它由计算与存储层、逻辑层、接入层和客户端四部分组成,支持多种计算任务的统一调度与管理。
264 1
|
3月前
|
SQL 分布式计算 大数据
我与ODPS的十年技术共生之路
ODPS十年相伴,从初识的分布式计算到共生进化,突破架构边界,推动数据价值深挖。其湖仓一体、隐私计算与Serverless能力,助力企业降本增效,赋能政务与商业场景,成为数字化转型的“数字神经系统”。
|
2月前
|
机器学习/深度学习 传感器 分布式计算
数据才是真救命的:聊聊如何用大数据提升灾难预警的精准度
数据才是真救命的:聊聊如何用大数据提升灾难预警的精准度
178 14
|
4月前
|
数据采集 分布式计算 DataWorks
ODPS在某公共数据项目上的实践
本项目基于公共数据定义及ODPS与DataWorks技术,构建一体化智能化数据平台,涵盖数据目录、归集、治理、共享与开放六大目标。通过十大子系统实现全流程管理,强化数据安全与流通,提升业务效率与决策能力,助力数字化改革。
156 4
|
3月前
|
机器学习/深度学习 运维 监控
运维不怕事多,就怕没数据——用大数据喂饱你的运维策略
运维不怕事多,就怕没数据——用大数据喂饱你的运维策略
144 0

相关产品

  • 开源大数据平台 E-MapReduce