开发者社区> 周志湖> 正文

Spark修炼之道(基础篇)——Linux大数据开发基础:第一节、Linux介绍、安装及使用初步

简介: 本节主要内容 Linux简史 Linux系统整体介绍 Ubuntu Linux安装 Linux使用初步 1. Linux简史 要讲述大名鼎鼎的Linux,必然要先从UNIX系统谈起,下面这幅图给出了Unix系统的进化图: 图片来源:http://baike.baidu.com/link?url=QfoqWtWGs-BjpnfEy_AUk7Bm3XHuf6JbN92H
+关注继续查看

本节主要内容

  1. Linux简史
  2. Linux系统整体介绍
  3. Ubuntu Linux安装
  4. Linux使用初步

1. Linux简史

要讲述大名鼎鼎的Linux,必然要先从UNIX系统谈起,下面这幅图给出了Unix系统的进化图:
这里写图片描述
图片来源:http://baike.baidu.com/link?url=QfoqWtWGs-BjpnfEy_AUk7Bm3XHuf6JbN92HCOoUBfFfj8BuSDkbwmldtmUEmGRDUwqsQMIV4jCKHvdkSPr3Lq

从进化图中可以看到,目前所有的主流操作系统都源自Unix 6(1976),我们要讲的Linux系统只是类UNIX系统中的一种,它源自于Minix系统,由Linus Torvalds于1991年开发,那时候Linus Torvalds还是芬兰大学的一名学生,其信奉开源精神,将代码分布可互联网上,可以免费获取,自从该操作系统问世后,世界各地的程序员加入到该操作系统的维护、内核升级等工作中来,进行了大量艰辛的工作以使该操作系统能够与BSD版的Unix及System V Unix(SVR4)等商用操作系统的功能与新功能进行匹配。

Linux开源后也源生出了多种版本,从性质上划分,大体分为由商业公司维护的商业版本与由开源社区维护的免费发行版本。常用的Linux操作系统有三种,它们分别是Redhat、 debian及Ubuntu:

  1. Ubuntu Linux。Ubuntu最大的特点在于其有着漂亮的GUI界面,包管理系统较为完善的,软件源比较丰富,技术社区资源及文档比较齐全,因此Ubuntu有着漂亮的用户界面,完善的包管理系统,强大的软件源支持,丰富的技术社区,良好的硬件兼容性,它有两种版本,分别是Desktop版本及Server版。Ubuntu比较适合初学者,因为Ubuntu的GUI界面的原因,它的大众化方向比较明显,当然因为GUI的原因,它非常消耗内存对机器的配置要求较高
    这里写图片描述
  2. CentOS。CentOS是生产环境使用最广泛的Linux操作系统,它是Red Hat Enterprise Linux(简称RHEL)源代码编译后的社区重新发布版,它是一个非常成熟的Linux发行版,它虽然也有图形用户界面,但不像Ubuntu那样强大。
    这里写图片描述
  3. Debian。Debian也比较适合用于服务器的操作系统,它比Ubuntu要更加稳定,它的内核比较简洁,只需要128M内存就可以流畅地运行,据说Debian可以几年不重启。Debian的技术资料、文档等相对于Ubuntu、CentOS等要少,它更适合Linux的高级用户使用。
    这里写图片描述

由于本课程针对想从事大数据开发的初学者,后期也需要在Ubuntu中配置Intellij IDEA Spark、Scala开发环境,在Linux系统上进行Spark、Scala应用程序开发,因此之故本教程决定采用Ubuntu Desktop版本进行教学。

2. Linux系统整体介绍

下图给出的是Linux操作系统分层视图:

这里写图片描述
引自:A Practical Guide to Linux Commands, Editors and Shell Programming

从上图可以看到,Linux大致可以分为四层,分别是硬件、内核、系统应用及用户软件层,分层结构具有较强的安全性,也为我们屏蔽了底层硬件的复杂性。所有的系统应用都是通过内核来与底层硬件打交道的。Linux主要有如下特点:

  • 提供内核编程接口,为用户操纵内核实现硬件资源访问提供了通道
  • 它是一种多用户的操作系统
  • 它是一种多任务的操作系统
  • 强大的文件系统
  • 提供Shell脚本
  • 丰富的系统命令

3. Ubuntu Linux安装

对于初学者,为方便Linux的学习,可以采用安装虚拟机的方式进行,目前流行的虚拟机有:

  1. Xen。Xen出身名门,起源于剑桥大学,后来被开源出来,它可以让多个虚拟机在单独一台机器上运行各自的操作系统。
  2. VMware。由VMware公司开发,功能强大,软件比较成熟,本课程采用VMWare作为虚拟机的容器
  3. KVM,基于Kernel的虚拟机,它也是一个开源的产品,只不过它运行在Linux上,作为Linux内核的一部分
  4. Virtual Box。Sun公司的大作,可以在Windows上运行。

由于后期需要在本机上搭建Spark集群,建议机器配置内存12G以上,一般集群至少三台,SparkMaster 4G,SparkSlave01 2G,SparkSlave02 2G,本机4G,这样整体机器运行起来才会比较流畅。现在Ubuntu版本已经升到了ubuntu 15.04,但它太耗内存了,出于机器性能考虑,本教程采用Ubuntu 10.04版,VMware版本是8.0.0

VMWare下载后按默认安装即可,下面讲解一下如何安装Ubuntu 10.04
1 File->New Virtual Machine
这里写图片描述

2 选择typical,然后next
这里写图片描述

3 选择Installer disc image file(ISO),选择Ubuntu 10.04 ISO文件
这里写图片描述

4 Personlize Linux,Full Name表示安装好的Linux hostname,Username,Password可以根据自己的需要做任意设置,然后下一步
这里写图片描述
5 设置虚拟机名称,然后next
这里写图片描述
6 设置磁盘容量,默认为20G,建议选择split virtual disk into multiple files,然后next
这里写图片描述
7 其它默认设置就可以,然后Finish
这里写图片描述
8 如此便完成Linux的配置,接下来便是系统安装过程,整个安装过程中无需人工干预,大约30分钟
这里写图片描述
这里写图片描述
这里写图片描述
这里写图片描述

4. Linux使用初步

1 命令行终端的使用
可以直接在图形用户界面上进行命令行的使用,Applications->Accessories->Terminal
这里写图片描述
这里写图片描述

也可以按Ctr+ALT+F1进入CLI(Command Line Interface)模式,
这里写图片描述
输入用户名和密码,可以得到如下界面:
这里写图片描述

切换回图形用户界面,用CTR+ALT+F8

2 超级用户root密码的设置

//采用sudo passwd命令修改root密码
xtwy@ubuntu:~$ sudo passwd
[sudo] password for xtwy: 
Enter new UNIX password: 
Retype new UNIX password: 
passwd: password updated successfully

3 切换用户

//采用su(switch user)命令切换用户
xtwy@ubuntu:~$ su root
Password: 
root@ubuntu:/home/xtwy# 
//切换回xtwy
root@ubuntu:/home/xtwy# su xtwy
xtwy@ubuntu:~$ 

4 当前用户工作目录与根目录

//~表示用户当前工作目录
xtwy@ubuntu:~$ 
//可以用pwd(Print Working Directory)命令查看完整路径
xtwy@ubuntu:~$ pwd
/home/xtwy
//用cd(change directory)命令改变工作目录,例如切换到根目录
//在linux中,/表示根目录
xtwy@ubuntu:~$ cd /
xtwy@ubuntu:/$ 
//切换回当前用户的工作目录,可以用cd ~命令(~表示当前用户默认的工作目录)
xtwy@ubuntu:/$ cd ~
xtwy@ubuntu:~$ 

5 列出文件目录 ls命令的使用

//不加任何参数的ls命令,简易列出目录中的所有文件和目录
xtwy@ubuntu:~$ ls
Desktop    Downloads         Music     Public     Videos
Documents  examples.desktop  Pictures  Templates
//ls -a 列出目录下的所有文件包括隐含文件
xtwy@ubuntu:~$ ls -a
.             Downloads         .gvfs          .pulse-cookie
..            .esd_auth         .ICEauthority  .recently-used.xbel
.bash_logout  examples.desktop  .local         .ssh
.bashrc       .gconf            Music          .sudo_as_admin_successful
.cache        .gconfd           .nautilus      Templates
.config       .gnome2           Pictures       .update-notifier
.dbus         .gnome2_private   .profile       Videos
Desktop       .gnupg            Public         .xsession-errors
Documents     .gtk-bookmarks    .pulse         .xsession-errors.old

//列出目录下所有文件和目录的详细信息
xtwy@ubuntu:~$ ls -al
total 136
drwxr-xr-x 24 xtwy xtwy 4096 2015-08-20 23:58 .
drwxr-xr-x  3 root root 4096 2015-08-20 21:53 ..
-rw-r--r--  1 xtwy xtwy  220 2015-08-20 21:53 .bash_logout
-rw-r--r--  1 xtwy xtwy 3103 2015-08-20 21:53 .bashrc
drwx------  4 xtwy xtwy 4096 2015-08-20 23:48 .cache
drwxr-xr-x  5 xtwy xtwy 4096 2015-08-20 23:35 .config
drwx------  3 xtwy xtwy 4096 2015-08-20 23:31 .dbus
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Desktop
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Documents
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Downloads
-rw-------  1 xtwy xtwy   16 2015-08-20 23:31 .esd_auth
-rw-r--r--  1 xtwy xtwy  179 2015-08-20 21:53 examples.desktop
drwx------  4 xtwy xtwy 4096 2015-08-20 23:34 .gconf
drwx------  2 xtwy xtwy 4096 2015-08-21 00:12 .gconfd
drwx------  6 xtwy xtwy 4096 2015-08-20 23:32 .gnome2
drwx------  2 xtwy xtwy 4096 2015-08-20 23:32 .gnome2_private
drwx------  2 xtwy xtwy 4096 2015-08-20 23:50 .gnupg
-rw-r--r--  1 xtwy xtwy  132 2015-08-20 23:34 .gtk-bookmarks
dr-x------  2 xtwy xtwy    0 2015-08-20 23:34 .gvfs
-rw-------  1 xtwy xtwy  636 2015-08-20 23:34 .ICEauthority
drwx------  3 xtwy xtwy 4096 2015-08-20 23:34 .local
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Music
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 .nautilus
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Pictures
-rw-r--r--  1 xtwy xtwy  675 2015-08-20 21:53 .profile
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Public
drwx------  2 xtwy xtwy 4096 2015-08-20 23:32 .pulse
-rw-------  1 xtwy xtwy  256 2015-08-20 23:31 .pulse-cookie
-rw-------  1 xtwy xtwy  218 2015-08-20 23:32 .recently-used.xbel
drwx------  2 xtwy xtwy 4096 2015-08-20 23:50 .ssh
-rw-r--r--  1 xtwy xtwy    0 2015-08-20 23:58 .sudo_as_admin_successful
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Templates
drwx------  2 xtwy xtwy 4096 2015-08-20 23:35 .update-notifier
drwxr-xr-x  2 xtwy xtwy 4096 2015-08-20 23:31 Videos
-rw-------  1 xtwy xtwy 1681 2015-08-20 23:52 .xsession-errors
-rw-------  1 xtwy xtwy 2829 2015-08-20 23:32 .xsession-errors.old
//ls -l列出文件和目录的详细用户,不包括隐含文件和当前目录.、上级目录..
xtwy@ubuntu:~$ ls -l
total 36
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Desktop
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Documents
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Downloads
-rw-r--r-- 1 xtwy xtwy  179 2015-08-20 21:53 examples.desktop
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Music
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Pictures
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Public
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Templates
drwxr-xr-x 2 xtwy xtwy 4096 2015-08-20 23:31 Videos

这里写图片描述
这里写图片描述
这里写图片描述

上面四种是最为常用的ls命令,可以满足日常工作中的绝大部分需求,更多参数如下:

-a 列出目录下的所有文件,包括以 . 开头的隐含文件。
-b 把文件名中不可输出的字符用反斜杠加字符编号(就象在C语言里一样)的形式列出。
-c 输出文件的 i 节点的修改时间,并以此排序。
-d 将目录象文件一样显示,而不是显示其下的文件。
-e 输出时间的全部信息,而不是输出简略信息。
-f -U 对输出的文件不排序。
-g 无用。
-i 输出文件的 i 节点的索引信息。
-k 以 k 字节的形式表示文件的大小。
-l 列出文件的详细信息。
-m 横向输出文件名,并以“,”作分格符。
-n 用数字的 UID,GID 代替名称。
-o 显示文件的除组信息外的详细信息。
-p -F 在每个文件名后附上一个字符以说明该文件的类型,“*”表示可执行的普通
文件;“/”表示目录;“@”表示符号链接;“|”表示FIFOs;“=”表示套
接字(sockets)。
-q 用?代替不可输出的字符。
-r 对目录反向排序。
-s 在每个文件名后输出该文件的大小。
-t 以时间排序。
-u 以文件上次被访问的时间排序。
-x 按列输出,横向排序。
-A 显示除 “.”和“..”外的所有文件。
-B 不输出以 “~”结尾的备份文件。
-C 按列输出,纵向排序。
-G 输出文件的组的信息。
-L 列出链接文件名而不是链接到的文件。
-N 不限制文件长度。
-Q 把输出的文件名用双引号括起来。
-R 列出所有子目录下的文件。
-S 以文件大小排序。
-X 以文件的扩展名(最后一个 . 后的字符)排序。
-1 一行只输出一个文件。

在需要时去查文档即可。

添加公众微信号,可以了解更多最新Spark、Scala相关技术资讯
这里写图片描述

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
【大数据开发运维解决方案】Hadoop2.7.6+Spark单机伪分布式安装
一、安装spark依赖的Scala 1.1 下载和解压缩Scala 下载地址: 点此下载 或则直接去官网挑选下载: 官网连接 在Linux服务器的opt目录下新建一个名为scala的文件夹,并将下载的压缩包上载上去: [root@hadoop opt]# cd /usr/ [root@hadoop usr]# mkdir scala [root@hadoop usr]# cd scala/ [ro...
15 0
大数据开发!Pandas转spark无痛指南!⛵
Pandas灵活强大,是数据分析必备工具库!但处理大型数据集时,需过渡到PySpark才可以发挥并行计算的优势。本文总结了Pandas与PySpark的核心功能代码段,掌握即可丝滑切换。
822 0
工作3年,月薪20k+的大数据开发人员,突然说我不想只做Hadoop、Spark、Flink层面的技术开发
“不管国内或全球“新冠”疫情有多严重、还得持续多久,我只想先保住我的工作,如果降薪,我也能在短时间找到待遇更好的下一个东家”。 ——《大数据就业特训营》23期学员李斌 2014年做大数据培训至今,已有5年之多,可以说大数据技术的发展变化速度之快,用“突飞猛进”来说毫不夸张。
879 0
老司机告诉你大数据开发:学Hadoop好还是Spark好?
相信看这篇文章的你们,都和我一样对Hadoop和Apache Spark的选择有一定的疑惑,今天查了不少资料,我们就来谈谈这两种 平台的比较与选择吧,看看对于工作和发展,到底哪个更好。 一、Hadoop与Spark 1.Spark Spark是一个用来实现快速而通用的集群计算的平台。
2129 0
大数据开发是先学习Hadoop还是spark,看10万程序猿所留下的结论
从目前我遇到过的面试者和看过的简历来看,凡是没有过大数据项目经验的人,简历写出花来都是扯淡。部署一个集群,装一个Hive,HBase什么的根本就不叫大数据(有的公司甚至部署Hadoop只用HDFS,每天处理5GB数据,这是我面过的一个人告诉我的他的工作经验)。
1659 0
Spark修炼之道(基础篇)——Linux大数据开发基础:第十五节:基础正则表达式(一)
参考书目:鸟哥的LINUX私房菜基础学习篇(第三版) Linux Shell Scripting Cookbook 本节主要内容 基础正则表达式 1. 基础正则表达式 (1)^行开始符 ^匹配一行的开始,例如’^Spark’ 匹配所有Spark开始的行 //grep -n表示查找到的结果显示行号 root@sparkslav
2644 0
Spark修炼之道(基础篇)——Linux大数据开发基础:第十四节:Shell编程入门(六)
本文主要内容 case控制结构 read命令 管道 1. case控制结构 参考:http://blog.csdn.net/dreamtdp/article/details/8048720 case控制结构语法格式: case expression in pattern1 ) statements ;; pattern2
2359 0
Spark修炼之道(基础篇)——Linux大数据开发基础:第十三节:Shell编程入门(五)
本节主要内容 while循环控制结构 if条件判断 until循环控制结构 1. while循环控制结构 本节例子来源:http://blog.chinaunix.net/uid-25880122-id-2901409.html 语法格式: while expression do command command done (1)计数器格式 适用于循环次
2362 0
Spark修炼之道(基础篇)——Linux大数据开发基础:第十二节:Shell编程入门(四)
本节主要内容 shell脚本调试 shell函数 shell控制结构初步 1. shell脚本调试 当脚本出错时,需要对脚本进行调试,学会脚本调试是每个linux系统使用者必备技能。shell脚本调试无需任何额外的工具,只需要要在脚本文件前加-x选项即可,创建debug.sh文件,内容如下: #!/bin/bash #Filename: debug.sh ech
2553 0
Spark修炼之道(基础篇)——Linux大数据开发基础:第十一节:Shell编程入门(三)
本节主要内容 shell数组 shell命令别名 时间操作 1. Shell数组 同C、C++等语言一样,shell脚本也提供了数组这样一个重要的数据结构,shell中的数组有两种,一种为普通数组,另外的一种称为关联数组。普通数据的存取通过整数进行,关联数组的存取通过字符串进行。具体如下: //用()定义一个数组,注意数组元素间不能用,否则达不到预期目的 roo
2582 0
+关注
文章
问答
文章排行榜
最热
最新
相关电子书
更多
云HBaseSQL及分析 ——Phoenix&Spark
立即下载
R AND SPARK
立即下载
Spark Autotuning
立即下载