《Spark Cookbook 中文版》一1.6 在集群上使用Mesos部署Spark

简介:

本节书摘来异步社区《Spark Cookbook 中文版》一书中的第1章,第1.6节,作者: 【印度】Rishi Yadav(亚达夫)译者: 顾星竹 , 刘见康 责编: 胡俊英,更多章节内容可以访问云栖社区“异步社区”公众号查看。

1.6 在集群上使用Mesos部署Spark

Mesos正慢慢崛起为跨数据中心管理所有计算资源的数据中心管理系统。Mesos可以运行在任意一台Linux操作系统的机器上。Mesos与Linux内核有着相同的配置原则。让我们看看如何安装Mesos。

具体步骤
Mesosphere提供Mesos的二进制安装包。最新的Mesos分布式安装包可以通过Mesosphere库按照如下步骤安装。

1.在Ubuntu操作系统的可靠版本上执行Mesos。

$ sudo apt-key adv --keyserver keyserver.ubuntu.com –recv
   E56151BF DISTRO=$(lsb_release -is | tr '[:upper:]' '[:lower:]')
   CODENAME=$(lsb_release -cs)
   $ sudo vi /etc/apt/sources.list.d/mesosphere.list

   deb http://repos.mesosphere.io/Ubuntu trusty main

2.更新库。

$ sudo apt-get -y update

3.安装Mesos。

$ sudo apt-get -y install mesos

4.连接Spark到Mesos上以整合Spark和Mesos,配置Spark二进制安装包以适应Mesos,并配置Spark驱动以连接Mesos。

5.把第一份教程中使用到的Spark二进制安装包上传到HDFS。

$ hdfs dfs -put spark-1.4.0-bin-hadoop2.4.tgz spark-1.4.0-bin-
hadoop2.4.tgz

6.Mesos单主节点的主URL是mesos://host:5050,如果使用ZooKeeper管理Mesos集群的话,URL是mesos://zk://host:2181。

7.配置spark-env.sh中的如下变量。

$ sudo vi spark-env.sh
   export MESOS_NATIVE_LIBRARY=/usr/local/lib/libmesos.so
   export SPARK_EXECUTOR_URI= hdfs://localhost:9000/user/hduser/
   spark-1.4.0-bin-hadoop2.4.tgz

8.通过Scala运行。

val conf = new SparkConf().setMaster("mesos://host:5050")
   val sparkContext = new SparkContext(conf)

9.通过Spark运行。

$ spark-shell --master mesos://host:5050

提示

Mesos有两种模式。

  • Fine-grained:在fine-grained模式(默认模式)下,每个Spark任务以独立的Mesos任务运行。
  • Coarse-grained:在此模式下,仅会在每个Mesos机器上发起一个长时间运行的Spark任务。

10.如果想要修改模式为coarse-grained,配置spark.mesos.coarse。

conf.set("spark.mesos.coarse","true")
相关文章
|
人工智能 分布式计算 调度
打破资源边界、告别资源浪费:ACK One 多集群Spark和AI作业调度
ACK One多集群Spark作业调度,可以帮助您在不影响集群中正在运行的在线业务的前提下,打破资源边界,根据各集群实际剩余资源来进行调度,最大化您多集群中闲置资源的利用率。
|
存储 分布式计算 调度
Spark Master HA 主从切换过程不会影响到集群已有作业的运行, 为什么?
Spark Master 的高可用性(HA)机制确保主节点故障时,备用主节点能无缝接管集群管理,保障稳定运行。关键在于: 1. **Driver 和 Executor 独立**:任务执行不依赖 Master。 2. **应用状态保持**:备用 Master 通过 ZooKeeper 恢复集群状态。 3. **ZooKeeper 协调**:快速选举新 Master 并同步状态。 4. **容错机制**:任务可在其他 Executor 上重新调度。 这些特性保证了集群在 Master 故障时仍能正常运行。
|
SQL 分布式计算 大数据
大数据-100 Spark 集群 Spark Streaming DStream转换 黑名单过滤的三种实现方式(一)
大数据-100 Spark 集群 Spark Streaming DStream转换 黑名单过滤的三种实现方式(一)
277 0
|
SQL 分布式计算 大数据
大数据-100 Spark 集群 Spark Streaming DStream转换 黑名单过滤的三种实现方式(二)
大数据-100 Spark 集群 Spark Streaming DStream转换 黑名单过滤的三种实现方式(二)
238 0
|
消息中间件 分布式计算 Kafka
大数据-99 Spark 集群 Spark Streaming DStream 文件数据流、Socket、RDD队列流
大数据-99 Spark 集群 Spark Streaming DStream 文件数据流、Socket、RDD队列流
363 0
|
消息中间件 分布式计算 Kafka
大数据-98 Spark 集群 Spark Streaming 基础概述 架构概念 执行流程 优缺点
大数据-98 Spark 集群 Spark Streaming 基础概述 架构概念 执行流程 优缺点
521 0
|
SQL 分布式计算 大数据
大数据-97 Spark 集群 SparkSQL 原理详细解析 Broadcast Shuffle SQL解析过程(一)
大数据-97 Spark 集群 SparkSQL 原理详细解析 Broadcast Shuffle SQL解析过程(一)
762 0
|
人工智能 分布式计算 大数据
大数据≠大样本:基于Spark的特征降维实战(提升10倍训练效率)
本文探讨了大数据场景下降维的核心问题与解决方案,重点分析了“维度灾难”对模型性能的影响及特征冗余的陷阱。通过数学证明与实际案例,揭示高维空间中样本稀疏性问题,并提出基于Spark的分布式降维技术选型与优化策略。文章详细展示了PCA在亿级用户画像中的应用,包括数据准备、核心实现与效果评估,同时深入探讨了协方差矩阵计算与特征值分解的并行优化方法。此外,还介绍了动态维度调整、非线性特征处理及降维与其他AI技术的协同效应,为生产环境提供了最佳实践指南。最终总结出降维的本质与工程实践原则,展望未来发展方向。
723 0
|
分布式计算 大数据 Apache
ClickHouse与大数据生态集成:Spark & Flink 实战
【10月更文挑战第26天】在当今这个数据爆炸的时代,能够高效地处理和分析海量数据成为了企业和组织提升竞争力的关键。作为一款高性能的列式数据库系统,ClickHouse 在大数据分析领域展现出了卓越的能力。然而,为了充分利用ClickHouse的优势,将其与现有的大数据处理框架(如Apache Spark和Apache Flink)进行集成变得尤为重要。本文将从我个人的角度出发,探讨如何通过这些技术的结合,实现对大规模数据的实时处理和分析。
1289 2
ClickHouse与大数据生态集成:Spark & Flink 实战