一键部署 spark

简介: 前言Spark简介Spark是整个BDAS的核心组件,是一个大数据分布式编程框架,不仅实现了MapReduce的算子map 函数和reduce函数及计算模型,还提供更为丰富的算子,如filter、join、groupByKey等。

前言

Spark简介

Spark是整个BDAS的核心组件,是一个大数据分布式编程框架,不仅实现了MapReduce的算子map 函数和reduce函数及计算模型,还提供更为丰富的算子,如filter、join、groupByKey等。是一个用来实现快速而同用的集群计算的平台。

Spark将分布式数据抽象为弹性分布式数据集(RDD),实现了应用任务调度、RPC、序列化和压缩,并为运行在其上的上层组件提供API。其底层采用Scala这种函数式语言书写而成,并且所提供的API深度借鉴Scala函数式的编程思想,提供与Scala类似的编程接口

1.准备工作

下载安装包

 scala-2.9.3:一种编程语言   Scala下载地址:http://www.scala-lang.org/download/
 spark-1.4.0:必须是编译好的Spark,如果下载的是Source,则需要自己根据环境使用SBT或者MAVEN重新编译才能使用。 Spark下载地址:http://spark.apache.org/downloads.html

如图所示:

wKioL1lfBBiik2_vAAAZRg6niHU987.png

wKiom1lfBCmjhMqvAAAeQhUK_IM727.png

2、安装scala-2.9.3

wKioL1lfBEWSf0nLAAAccT6w3M4907.png


3、安装spark-1.4.0

wKiom1lfBFqxE3aeAAAW06Lu99w381.png



4、修改Spark配置文件

wKioL1lfBKrjh8u1AAAO5hNpa9c856.png


在spark-env.sh末端添加如下几行:


wKiom1lfBNPjBC1YAABHeel1kCU965.png

  spark-defaults.conf中还有如下配置参数:



5、测试spark安装是否成功

wKioL1lfBO7TctxaAABUhkdJCs0891.png


6、使用wordcount例子测试,启动spark-shell之前先上传一份文件到hdfs
7、代码:
    val file = sc.textFile("hdfs://hadoop.master:9000/data/intput/wordcount.data")
    val count = file.flatMap(line=>(line.split(" "))).map(word=>(word,1)).reduceByKey(_+_)
    count.collect()
    count.textAsFile("hdfs://hadoop.master:9000/data/output")
理解上面的代码你需要学习scala语言。

wKiom1lfBRHydf_EAAAOvq4pqA4394.png-wh_50

总结:山不厌高,海不厌深。





相关文章
|
2月前
|
分布式计算 资源调度 监控
Spark学习--1、Spark入门(Spark概述、Spark部署、Local模式、Standalone模式、Yarn模式)(一)
Spark学习--1、Spark入门(Spark概述、Spark部署、Local模式、Standalone模式、Yarn模式)(一)
85 1
|
7月前
|
分布式计算 大数据 Spark
基于Docker搭建大数据集群(四)Spark部署
基于Docker搭建大数据集群(四)Spark部署
|
7月前
|
分布式计算 资源调度 监控
Spark Yarn模式部署集群
Spark Yarn模式部署集群
45 1
|
7月前
|
分布式计算 资源调度 Java
大数据Spark部署模式DeployMode
大数据Spark部署模式DeployMode
87 0
|
8月前
|
分布式计算 Apache Spark
Apache Doris Spark Load快速体验之Spark部署(1)2
Apache Doris Spark Load快速体验之Spark部署(1)2
97 0
|
8月前
|
SQL 机器学习/深度学习 分布式计算
Apache Doris Spark Load快速体验之Spark部署(1)1
Apache Doris Spark Load快速体验之Spark部署(1)1
91 0
|
8月前
|
存储 分布式计算 资源调度
Spark学习--1、Spark入门(Spark概述、Spark部署、Local模式、Standalone模式、Yarn模式)(二)
Spark学习--1、Spark入门(Spark概述、Spark部署、Local模式、Standalone模式、Yarn模式)(二)
|
8月前
|
SQL 分布式计算 资源调度
Spark学习--1、Spark入门(Spark概述、Spark部署、Local模式、Standalone模式、Yarn模式)(一)
Spark学习--1、Spark入门(Spark概述、Spark部署、Local模式、Standalone模式、Yarn模式)(一)
|
9月前
|
机器学习/深度学习 存储 分布式计算
spark集群 分类器 部署
spark集群 分类器 部署
|
9月前
|
分布式计算 Ubuntu 算法
Spark 3.x各模式部署 - Ubuntu(下)
Spark 3.x各模式部署 - Ubuntu(下)
198 0

相关实验场景

更多