黑马程序员-大数据入门到实战-前置章节

简介: 黑马程序员-大数据入门到实战-前置章节

1. 环境介绍

基于VMware构建Linux虚拟机

① 是大数据从业者或IT从业者的必备技能之一

② 是成本低廉的方案

2. VMware准备虚拟机

① 设置VMware网段

② 下载Centos操作系统

③ 在VMware中安装Centos操作系统

④ 配置多台Linux虚拟机

3. VMware虚拟机系统设置

3.1 主机名、IP、SSH免密登录

对三台虚拟机完成主机名、固定IP、SSH免密登录等系统设置

3.1.1 配置固定IP地址

① 开启node1,修改主机名为node1,并修改固定ip

# 修改主机名
hostnamectl set-hostname node1;
# 修改IP地址
vim /etc/sysconfig/network-scripts/ifcfg-ens33
IPADDR="192.168.88.101"
#重启网卡
systemctl restart network

同样的操作启动node2和node3

修改node2主机名为node2,设置ip为192.168.88.102

修改node3主机名为node3,设置ip为192.168.88.103

3.1.2 配置主机名映射

① 在Windows系统中修改hosts文件,填入如下内容:

192.168.88.101 node1
192.168.88.102 node2
192.168.88.103 node3

② 在3台Linux的/etc/hosts文件中填入以下内容

192.168.88.101 node1
192.168.88.102 node2
192.168.88.103 node3


3.1.3 配置SSH免密登录

后续安装的集群化软件,多数需要远程登录以及远程执行命令,为了简单起见,配置三台Linux服务器之间的免密码互相SSH登录

① 在每一台机器执行:(一路回车到底)

ssh-keygen -t rsa -b 4096

② 在每一台机器执行:

ssh-copy-id node1
ssh-copy-id node2
ssh-copy-id node3

执行完毕后,node1、node2、node3之间将完成root用户间的免密互通

3.1.4 创建hadoop用户并配置免密登录

后序大数据的软件,将不以root用户启动

我们将大数据的软件创建一个单独的用户hadoop,并为三台服务器同样配置hadoop用户的免密互通

① 在每一台机器执行:

useradd hadoop #创建hadoop用户

② 在每一台机器执行:

passwd hadoop #设置hadoop用户密码为123456

③ 在每一台机器执行:

su - hadoop #切换到hadoop用户

④ 在每一台机器执行:

ssh-keygen -t rsa -b 4096

⑤ 在每一台机器执行:

ssh-copy-id node1
ssh-copy-id node2
ssh-copy-id node3

3.2 JDK环境部署

对三台虚拟机完成JDK环境部署

3.2.1 配置JDK环境

① 创建文件夹,用来部署JDK

mkdir -p /export/server

② 解压JDK安装文件

tar -zxvf jdk-8u351-linux-x64.tar.gz -C /export/server

③ 配置JDK的软链接

ln -s /export/server/jdk1.8.0_351 /export/server/jdk

④ 配置JAVA_HOME环境变量

# 编辑/etc/profile文件
export JAVA_HOME=/export/server/jdk
export PATH=$PATH:$JAVA_HOME/bin

⑤ 生效环境变量

source /etc/profile

⑥ 配置java执行程序的软链接

# 删除系统自带的java程序
rm -f /usr/bin/java
# 软链接我们自己安装的java程序
ln -s /export/server/jdk/bin/java /usr/bin/java

⑦ 执行验证

java -version
javac -version

3.3 防火墙、SELinux、时间同步

对三台虚拟机完成防火墙、SELinux、时间同步等系统设置

3.3.1 关闭防火墙和SELinux

集群化软件之间需要通过端口互相通讯,为了避免出现网络不通的问题,我们可以简单在集群内部关闭防火墙

① 在每一台机器执行:

systemctl stop firewalld
systemctl disable firewalld

Linux有一个安全模块:SELinux,用以限制用户和程序的相关权限,来确保系统的安全稳定。

在当前,我们需要关闭SELinux功能,避免导致后面的软件运行出现问题

② 在每一台机器执行:

vim /etc/sysconfig/selinux
# 将第七行SELINUX=enforcing 改为
SELINUX=disabled

3.3.2 修改时区并配置自动时间同步

① 在每一台机器执行:

yum install -y ntp #安装ntp软件

② 更新时区

rm -f /etc/localtime;sudo ln -s /usr/share/zoneinfo/Asia/Shanghai /etc/localtime

③ 同步时间

ntpdate -u ntp.aliyun.com

④ 开启ntp服务并设置开机自启

systemctl start ntpd
systemctl enable ntpd

4. 总结

  1. 设置三台Linux的主机名和固定IP
  2. 在Linux系统以及本机中配置了主机名映射
  3. 配置了三台服务器之间root用户的SSH免密互通
  4. 安装配置完成了JDK环境
  5. 关闭了防火墙和SELinux
  6. 更新了时区和同步了时间
  7. 拍摄快照保存状态
相关实践学习
简单用户画像分析
本场景主要介绍基于海量日志数据进行简单用户画像分析为背景,如何通过使用DataWorks完成数据采集 、加工数据、配置数据质量监控和数据可视化展现等任务。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
4月前
|
SQL 分布式计算 数据可视化
滴滴出行大数据数仓实战
滴滴出行大数据数仓实战
119 0
滴滴出行大数据数仓实战
|
4月前
|
SQL 分布式计算 大数据
【大数据技术Spark】DStream编程操作讲解实战(图文解释 附源码)
【大数据技术Spark】DStream编程操作讲解实战(图文解释 附源码)
43 0
|
4月前
|
分布式计算 Java 大数据
【大数据技术Hadoop+Spark】HDFS Shell常用命令及HDFS Java API详解及实战(超详细 附源码)
【大数据技术Hadoop+Spark】HDFS Shell常用命令及HDFS Java API详解及实战(超详细 附源码)
229 0
|
4月前
|
安全 大数据 API
elasticsearch|大数据|elasticsearch的api部分实战操作以及用户和密码的管理
elasticsearch|大数据|elasticsearch的api部分实战操作以及用户和密码的管理
66 0
|
4月前
|
SQL 分布式计算 数据库
【大数据技术Spark】Spark SQL操作Dataframe、读写MySQL、Hive数据库实战(附源码)
【大数据技术Spark】Spark SQL操作Dataframe、读写MySQL、Hive数据库实战(附源码)
103 0
|
4月前
|
分布式计算 大数据 Scala
【大数据技术Hadoop+Spark】Spark RDD创建、操作及词频统计、倒排索引实战(超详细 附源码)
【大数据技术Hadoop+Spark】Spark RDD创建、操作及词频统计、倒排索引实战(超详细 附源码)
94 1
|
4天前
|
分布式计算 大数据 数据处理
[AIGC大数据基础] Spark 入门
[AIGC大数据基础] Spark 入门
|
4月前
|
分布式计算 大数据 Java
问我大数据怎么入门,我总结了亲身体验的学习路线推荐给她【推荐收藏】
问我大数据怎么入门,我总结了亲身体验的学习路线推荐给她【推荐收藏】
50 0
|
17天前
|
机器学习/深度学习 人工智能 安全
Azure Databricks实战:在云上轻松进行大数据分析与AI开发
【4月更文挑战第8天】Databricks在大数据分析和AI开发中表现出色,简化流程并提高效率。文中列举了三个应用场景:数据湖分析、实时流处理和AI机器学习,并阐述了Databricks的一体化平台、云原生弹性及企业级安全优势。博主认为,Databricks提升了研发效能,无缝集成Azure生态,并具有持续创新潜力,是应对大数据挑战和加速AI创新的理想工具。
41 0
|
2月前
|
分布式计算 大数据 Java
Spark 大数据实战:基于 RDD 的大数据处理分析
Spark 大数据实战:基于 RDD 的大数据处理分析
126 0