文档备案控制台

开发者社区问答正文

spark中为什么要使用map-side预聚合的shuffle操作？

spark中为什么要使用map-side预聚合的shuffle操作？

展开

收起

游客ahv54x37wvm7u 2021-12-07 20:31:06 633 版权

版权声明：本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

1 条回答

写回答

取消提交回答

游客lu6fsp6mkfgcm

如果因为业务需要，一定要使用shuffle操作，无法用map类的算子来替代，那么尽量使用可以map-side预聚合的算子，类似于MapReduce中的本地combiner。map-side预聚合之后，每个节点本地就只会有一条相同的key，因为多条相同的key都被聚合起来了。其他节点在拉取所有节点上的相同key时，就会大大减少需要拉取的数据数量，从而也就减少了磁盘IO以及网络传输开销。建议使用reduceByKey或者aggregateByKey算子来替代掉groupByKey算子

2021-12-07 20:37:45

赞同展开评论

问答分类：

分布式计算 Spark

问答标签：

apache spark shuffle apache spark map spark Map apache spark操作 apache spark聚合

问答地址：

开发者社区 > 大数据 > 问答

相关问答

DataWorks最近有新增spark SQL相关支持，是需要重新初始化吗？有相关的操作文档吗？

163

1

0

在 Spark Structured 中，为什么全局水印的设计可能会导致不正确的聚合结果？

137

1

0

大数据计算MaxCompute在spark程序里面操作表数据，应该一次查询多少条 ?

256

1

0

DataWorks中spark操作odps，写入时报的错，哪位给看看什么原因引起的？

393

2

0

我根据操作maxcompute spark 在idea调试，不能正常执行，这个是什么情况呢？

313

1

0

DataWorks里，odps spark支持操作redis吗，如何操作？

384

2

0

DataWorks怎么操作ODPS Spark节点？

395

1

0

spark 执行RDD操作中的Lazy Calculate有什么好处吗？

2509

1

0

spark 执行RDD操作的过程要注意什么吗？

2482

1

0

通过 Spark 实时写入数据至 Hologres 应该如何操作？

1218

1

0

问答排行榜

最热

最新

【大咖问答】对话PostgreSQL 中国社区发起人之一，阿里云数据库高级专家德哥

据说在家办公的程序员是这样写代码的？

如何升级配置

【藏经阁一起读（27）】本周推荐《Apache Flink案例集（2022版）》，你有哪些心得？

【精品问答】python技术1000问(1)

需要支持自定义Kimi k3 API

WordPress站点怎么进行速度优化？

电脑下载有https证书问题，浏览器有时加载不出网页显示ERR_SSL_VERSION_OR_CIP

Qoder如何自主打开浏览器？

关于国际版和国内版客户端购买套餐问题

相关文章

Search Lake：ES x Paimon 让湖上多模态数据可搜可用

【赵渝强老师】Hadoop HDFS的回收站和快照

阿里云服务器实例选择指南：经济型、通用型、计算型、内存型性能解析与场景解析

AutoMQ x 阿里云 OSS Tables：基于 Iceberg 构建流表一体的实时入湖

阿里云数据总线DataHub深度对接实战指南：从入门到生产级管道构建

还有其他疑问?