文档备案控制台

开发者社区问答正文

Spark RDD是具体怎么容错的，基本原理是什么？

Spark RDD是具体怎么容错的，基本原理是什么？

展开

收起

游客ahv54x37wvm7u 2021-12-13 19:38:34 4850 版权

版权声明：本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

1 条回答

写回答

取消提交回答

游客lu6fsp6mkfgcm

一般来说，分布式数据集的容错性有两种方式：数据检查点和记录数据的更新。

面向大规模数据分析，数据检查点操作成本很高，需要通过数据中心的网络连接在机器之间复制庞大的数据集，而网络带宽往往比内存带宽低得多，同时还需要消耗更多的存储资源。

因此，Spark选择记录更新的方式。但是，如果更新粒度太细太多，那么记录更新成本也不低。因此，RDD只支持粗粒度转换，即只记录单个块上执行的单个操作，然后将创建RDD的一系列变换序列（每个RDD都包含了他是如何由其他RDD变换过来的以及如何重建某一块数据的信息。因此RDD的容错机制又称“血统(Lineage)”容错）记录下来，以便恢复丢失的分区。

Lineage本质上很类似于数据库中的重做日志（Redo Log），只不过这个重做日志粒度很大，是对全局数据做同样的重做进而恢复数据。

2021-12-13 19:40:09

赞同展开评论

问答分类：

分布式计算 Spark

问答标签：

apache spark rdd apache spark原理 apache spark容错 apache spark基本原理 apache spark rdd容错

问答地址：

开发者社区 > 大数据 > 问答

相关问答

Spark的RDD和DataFrame编程模式如何帮助提升核算效率？

184

1

0

spark 执行RDD操作中的Lazy Calculate有什么好处吗？

2509

1

0

spark 执行RDD操作的过程要注意什么吗？

2481

1

0

spark 中的RDD 有什么特点吗？

2465

1

0

Spark中对于key-value的RDD有什么特别的嘛？

598

1

0

批处理系统中计算过程中可以通过计算的什么来保证数据的一致性（如 Spark 中的 RDD 血缘）？

795

1

0

Spark Streaming 原理是什么？

1858

1

0

Spark的高可用和容错是什么意思？

1060

1

0

Spark中RDD依赖关系宽依赖是什么？

478

1

0

Spark中RDD依赖关系窄依赖是什么？

465

1

0

问答排行榜

最热

最新

【大咖问答】对话PostgreSQL 中国社区发起人之一，阿里云数据库高级专家德哥

据说在家办公的程序员是这样写代码的？

如何升级配置

【藏经阁一起读（27）】本周推荐《Apache Flink案例集（2022版）》，你有哪些心得？

【精品问答】python技术1000问(1)

电脑下载有https证书问题，浏览器有时加载不出网页显示ERR_SSL_VERSION_OR_CIP

关于国际版和国内版客户端购买套餐问题

【Qoder CN】模型提供商：支持自定义第三方的URL

Pro试用版是只有300的Credits么？

Qoder REPO WIKI使用优化

相关文章

EMR Serverless Daft 如何简化多模态数据处理：视频抽帧、清洗、标注全流程与具身智能实践

【赵渝强老师】Hadoop HDFS的回收站和快照

阿里云服务器实例选择指南：经济型、通用型、计算型、内存型性能解析与场景解析

AutoMQ x 阿里云 OSS Tables：基于 Iceberg 构建流表一体的实时入湖

阿里云数据总线DataHub深度对接实战指南：从入门到生产级管道构建

还有其他疑问?