文档备案控制台

开发者社区问答正文

spark RDD collect()的缺点有哪些？

spark RDD collect()的缺点有哪些？

展开

收起

游客k7rjnht6hbtk6 2021-12-10 14:20:02 663 版权

版权声明：本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

1 条回答

写回答

取消提交回答

游客daliwbfb2wo66

1.首先，collect是Action里边的，根据RDD的惰性机制，真正的计算发生在RDD的Action操作。那么，一次collect就会导致一次Shuffle，而一次Shuffle调度一次stage，然而一次stage包含很多个已分解的任务碎片Task。这么一来，会导致程序运行时间大大增加，属于比较耗时的操作，即使是在local模式下也同样耗时。

2.其次，从环境上来讲，本机local模式下运行并无太大区别，可若放在分布式环境下运行，一次collect操作会将分布式各个节点上的数据汇聚到一个driver节点上，而这么一来，后续所执行的运算和操作就会脱离这个分布式环境而相当于单机环境下运行，这也与Spark的分布式理念不合。

3.最后，将大量数据汇集到一个driver节点上，并且像这样val arr = data.collect()，将数据用数组存放，占用了jvm堆内存，可想而知，是有多么轻松就会内存溢出。

2021-12-10 14:21:59

赞同展开评论

问答分类：

分布式计算 Spark

问答标签：

apache spark rdd apache spark缺点 apache spark rdd collect apache spark collect

问答地址：

开发者社区 > 大数据 > 问答

相关问答

Spark的RDD和DataFrame编程模式如何帮助提升核算效率？

184

1

0

spark 执行RDD操作中的Lazy Calculate有什么好处吗？

2505

1

0

spark 执行RDD操作的过程要注意什么吗？

2478

1

0

spark 中的RDD 有什么特点吗？

2462

1

0

Spark中对于key-value的RDD有什么特别的嘛？

596

1

0

Spark的缺点是什么？

987

1

0

批处理系统中计算过程中可以通过计算的什么来保证数据的一致性（如 Spark 中的 RDD 血缘）？

792

1

0

Spark RDD是具体怎么容错的，基本原理是什么？

4847

1

0

spark当中RDD 如何通过记录更新的方式容错？

1252

1

0

spark当中的 RDD算子是什么，如何理解？

870

1

0

问答排行榜

最热

最新

【大咖问答】对话PostgreSQL 中国社区发起人之一，阿里云数据库高级专家德哥

据说在家办公的程序员是这样写代码的？

如何升级配置

【藏经阁一起读（27）】本周推荐《Apache Flink案例集（2022版）》，你有哪些心得？

【精品问答】python技术1000问(1)

阿里云服务器多少钱一年？价格贵不贵？有优惠吗？

阿里云服务器问题解答，你关心的问题都在这！

阿里云 ECS 公网 IP有什么更换技巧？

idea 插件，更新记忆规则，经常死机

总是提示您已达到配额使用上限，请升级订阅计划，以获得更多使用资源。问题反馈。但已经购买了资源

相关文章

阿里云 EMR Serverless Spark 全托管 Ray 再进化：加速构建全模态数据处理新基建

阿里云MaxCompute海量数据离线分析完全指南：从架构原理到性能调优

阿里云智能决策平台对接使用完全指南：从架构解析到生产级集成实战

阿里云账号：计算型/通用型/内存型价格与场景区别

EMR Serverless Daft 如何简化多模态数据处理：视频抽帧、清洗、标注全流程与具身智能实践

还有其他疑问?