《Spark核心技术与高级应用》——导读

简介: 本节书摘来自华章社区《Spark核心技术与高级应用》一书中的目录,作者于俊 向海 代其锋 马海平,更多章节内容可以访问云栖社区“华章社区”公众号查看

本节书摘来自华章社区《Spark核心技术与高级应用》一书中的目录,作者于俊 向海 代其锋 马海平,更多章节内容可以访问云栖社区“华章社区”公众号查看


f57e8ba74c1787c075ae14aa4a3db88b07f17cc4

目  录

前 言
基 础 篇
第1章 Spark简介
1.1 什么是Spark
1.2 Spark的重要扩展
1.3 本章小结
第2章 Spark部署和运行
2.1 部署准备
2.2 Spark部署
2.3 运行Spark应用程序
2.4 本章小结
第3章 Spark程序开发
3.1 使用Spark Shell编写程序
3.2 构建Spark的开发环境
3.3 独立应用程序编程
3.4 本章小结
第4章 编程模型
4.1 RDD介绍
4.2 创建RDD
4.3 RDD操作
4.4 共享变量
4.5 本章小结
第5章 作业执行解析
5.1 基本概念
5.2 作业执行流程
5.3 运行时环境
5.4 应用程序运行实例
5.5 本章小结
第6章 Spark SQL与DataFrame
6.1 概述
6.2 DataFrame
6.3 数据源
6.4 分布式的SQL Engine
6.5 性能调优
6.6 数据类型
6.7 本章小结
第7章 深入了解Spark Streaming
7.1 基础知识
7.2 DStream操作
7.3 性能调优
7.4 容错处理
7.5 一个例子
7.6 本章小结
第8章 Spark MLlib与机器学习
8.1 机器学习概述
8.2 Spark MLlib介绍
8.3 Spark MLlib库
8.4 ML库
8.5 本章小结
第9章 GraphX图计算框架与应用
9.1 概述
9.2 Spark GraphX架构
9.3 GraphX编程
9.4 应用场景
9.5 本章小结
第10章 SparkR(R on Spark)
10.1 概述
10.2 安装SparkR
10.3 SparkR的运行与应用示例
10.4 本章小结
实 战 篇
第11章 大数据分析系统
11.1 背景
11.2 数据格式
11.3 应用架构
11.4 业务实现
11.5 本章小结
第12章 系统资源分析平台
12.1 业务背景
12.2 应用架构
12.3 代码实现
12.4 结果验证
12.5 本章小结
第13章 在Spark上训练LR模型
13.1 逻辑回归简介
13.2 数据格式
13.3 MLlib中LR模型源码介绍
13.4 实现案例
13.5 本章小结
第14章 获取二级邻居关系图
14.1 理解PageRank
14.2 PageRank算法基于Spark的实现
14.3 基于PageRank的二级邻居获取
14.4 本章小结
高 级 篇
第15章 调度管理
15.1 调度概述
15.2 调度器
15.3 本章小结
第16章 存储管理
16.1 硬件环境
16.2 Storage模块
16.3 Shuff?le数据持久化
16.4 本章小结
第17章 监控管理
17.1 Web界面
17.2 Spark UI历史监控
17.3 监控工具
17.4 本章小结
第18章 性能调优
18.1 文件的优化
18.2 序列化数据
18.3 缓存
18.4 共享变量
18.5 流水线优化
18.6 本章小结
扩 展 篇
第19章 Spark-jobserver实践
19.1 Spark-jobserver是什么
19.2 编译、部署及体验
19.3 Spark-jobserver程序实战
19.4 使用场景:用户属性分布计算
19.5 本章小结
第20章 Spark Tachyon实战
20.1 Tachyon文件系统
20.2 Tachyon入门
20.3  容错机制
20.4 本章小结

相关文章
|
分布式计算 数据处理 Apache
Spark和Flink的区别是什么?如何选择?都应用在哪些行业?
【10月更文挑战第10天】Spark和Flink的区别是什么?如何选择?都应用在哪些行业?
2402 1
|
SQL 分布式计算 Serverless
鹰角网络:EMR Serverless Spark 在《明日方舟》游戏业务的应用
鹰角网络为应对游戏业务高频活动带来的数据潮汐、资源弹性及稳定性需求,采用阿里云 EMR Serverless Spark 替代原有架构。迁移后实现研发效率提升,支持业务快速发展、计算效率提升,增强SLA保障,稳定性提升,降低运维成本,并支撑全球化数据架构部署。
1571 56
鹰角网络:EMR Serverless Spark 在《明日方舟》游戏业务的应用
|
机器学习/深度学习 分布式计算 大数据
阿里云 EMR Serverless Spark 在微财机器学习场景下的应用
面对机器学习场景下的训练瓶颈,微财选择基于阿里云 EMR Serverless Spark 建立数据平台。通过 EMR Serverless Spark,微财突破了单机训练使用的数据规模瓶颈,大幅提升了训练效率,解决了存算分离架构下 Shuffle 稳定性和性能困扰,为智能风控等业务提供了强有力的技术支撑。
858 15
|
SQL 分布式计算 Serverless
基于阿里云 EMR Serverless Spark 版快速搭建OSS日志分析应用
基于阿里云 EMR Serverless Spark 版快速搭建OSS日志分析应用
462 0
|
分布式计算 大数据 数据处理
Apache Spark的应用与优势:解锁大数据处理的无限潜能
【8月更文挑战第23天】Apache Spark以其卓越的性能、易用性、通用性、弹性与可扩展性以及丰富的生态系统,在大数据处理领域展现出了强大的竞争力和广泛的应用前景。随着大数据技术的不断发展和普及,Spark必将成为企业实现数字化转型和业务创新的重要工具。未来,我们有理由相信,Spark将继续引领大数据处理技术的发展潮流,为企业创造更大的价值。
|
分布式计算 资源调度 测试技术
“Spark Streaming异常处理秘籍:揭秘如何驯服实时数据流的猛兽,守护你的应用稳如泰山,不容错过!”
【8月更文挑战第7天】Spark Streaming 是 Apache Spark 中的关键组件,用于实时数据流处理。部署时可能遭遇数据问题、资源限制或逻辑错误等异常。合理处理这些异常对于保持应用稳定性至关重要。基础在于理解其异常处理机制,通过 DSC 将数据流切分为 RDD。对于数据异常,可采用 try-catch 结构捕获并处理;资源层面异常需优化 Spark 配置,如调整内存分配;逻辑异常则需加强单元测试及集成测试。结合监控工具,可全面提升应用的健壮性和可靠性。
421 3
|
分布式计算 Hadoop 大数据
大数据处理框架在零售业的应用:Apache Hadoop与Apache Spark
【8月更文挑战第20天】Apache Hadoop和Apache Spark为处理海量零售户数据提供了强大的支持
514 0
|
人工智能 分布式计算 大数据
大数据≠大样本:基于Spark的特征降维实战(提升10倍训练效率)
本文探讨了大数据场景下降维的核心问题与解决方案,重点分析了“维度灾难”对模型性能的影响及特征冗余的陷阱。通过数学证明与实际案例,揭示高维空间中样本稀疏性问题,并提出基于Spark的分布式降维技术选型与优化策略。文章详细展示了PCA在亿级用户画像中的应用,包括数据准备、核心实现与效果评估,同时深入探讨了协方差矩阵计算与特征值分解的并行优化方法。此外,还介绍了动态维度调整、非线性特征处理及降维与其他AI技术的协同效应,为生产环境提供了最佳实践指南。最终总结出降维的本质与工程实践原则,展望未来发展方向。
767 0
|
分布式计算 大数据 Apache
ClickHouse与大数据生态集成:Spark & Flink 实战
【10月更文挑战第26天】在当今这个数据爆炸的时代,能够高效地处理和分析海量数据成为了企业和组织提升竞争力的关键。作为一款高性能的列式数据库系统,ClickHouse 在大数据分析领域展现出了卓越的能力。然而,为了充分利用ClickHouse的优势,将其与现有的大数据处理框架(如Apache Spark和Apache Flink)进行集成变得尤为重要。本文将从我个人的角度出发,探讨如何通过这些技术的结合,实现对大规模数据的实时处理和分析。
1318 2
ClickHouse与大数据生态集成:Spark & Flink 实战
|
存储 分布式计算 Hadoop
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
857 79