文档备案控制台

开发者社区问答正文

spark中如何划分stage？

spark中如何划分stage？

展开

收起

芯在这 2021-12-06 00:58:54 688 版权

版权声明：本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

1 条回答

写回答

取消提交回答

真的很搞笑

1.spark application中可以因为不同的action触发众多的job，一个Application中可以有很多job，每个job是有一个或多个stage构成的，后面的stage依赖于前面的stage，也就是说只有前面的stage计算完毕后，后面的stage才会运行。

2.stage划分的依据是宽依赖，何时产生宽依赖，例如ReduceBykey，GroupByKey的算子，会导致宽依赖的产生。

3.由Action算子(例如collect)导致了SparkContext.RunJob的执行，最终导致了DAGSchedular的submitJob的执行，其核心是通过发送一个case class Jobsubmitted对象给eventProcessLoop。

EventProcessLoop是DAGSchedularEventProcessLoop的具体事例，而DAGSchedularEventProcessLoop是eventLoop的子类，具体实现EventLoop的onReceiver方法，onReceiver方法转过来回调doOnReceive。

4.在handleJobSubmitted中首先创建finalStage，创建finalStage时候会建立父Stage的依赖链条。

2021-12-06 00:59:12

赞同展开评论

问答分类：

分布式计算 Spark

问答标签：

apache spark stage apache spark划分

问答地址：

开发者社区 > 大数据 > 问答

相关问答

spark当中的Stage具体是什么意思？

897

1

0

Spark中将DAG划分为Stage剖析是什么？

543

1

0

Spark中Application多个job多个Stage是什么？

603

1

0

Spark中将DAG划分为Stage的划分依据是什么？

920

1

0

Spark中将DAG划分为Stage核心算法是什么？

494

1

0

Spark中Stage是什么？

739

1

0

Spark中的Stage的作用是什么？

665

1

0

spark中的stage根据什么决定task个数？

855

1

0

spark的stage是怎样来划分的？

372

1

0

spark任务想完整的部署，发布，执行调度，仅仅maxcompute组件权限够么，还需要datawo

998

1

0

问答排行榜

最热

最新

【大咖问答】对话PostgreSQL 中国社区发起人之一，阿里云数据库高级专家德哥

据说在家办公的程序员是这样写代码的？

如何升级配置

【藏经阁一起读（27）】本周推荐《Apache Flink案例集（2022版）》，你有哪些心得？

【精品问答】python技术1000问(1)

需要支持自定义Kimi k3 API

WordPress站点怎么进行速度优化？

阿里云CDN如何加速配置？

建立的网站被DDoS攻击怎么排查？

电脑下载有https证书问题，浏览器有时加载不出网页显示ERR_SSL_VERSION_OR_CIP

相关文章

Lake Search：ES x Paimon 让湖上多模态数据可搜可用

【赵渝强老师】Hadoop HDFS的回收站和快照

阿里云服务器实例选择指南：经济型、通用型、计算型、内存型性能解析与场景解析

AutoMQ x 阿里云 OSS Tables：基于 Iceberg 构建流表一体的实时入湖

阿里云数据总线DataHub深度对接实战指南：从入门到生产级管道构建

还有其他疑问?