Hadoop大数据平台实战(00):Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本 单节点模式-阿里云开发者社区

开发者社区> 徐雷frank> 正文

Hadoop大数据平台实战(00):Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本 单节点模式

简介: Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本
+关注继续查看

Linux Ubuntu 18.04实战安装大数据Hadoop 3.1.2版本。这里分别选择最新的Ubuntu系统 18.04,以及最新的Hadoop版本3.1.2
Hadoop是开源免费的大数据方案,官方网站https://hadoop.apache.org/,核心的组件都是使用Java开发,也是目前也是最流行的,使用最广泛的大数据解决方案,包括几十个框架和工具。
hadoop有3种模式,我们先使用最简单的模式,来安装实战学习Hadoop。
1)单机模式Local (Standalone) Mode
2)伪分布式Pseudo-Distributed Mode
3)完全分布式Fully-Distributed Mode
image

1、安装JDK
安装开源的JDK,免费,不会引起收费问题。

sudo apt install default-jdk

image

查看安装版本 Java -version
image

2、安装SSH
sudo apt-get install openssh-server openssh-client

ssh-keygen -t rsa -P ""
cat $HOME/.ssh/id_rsa.pub >> $HOME/.ssh/authorized_keys

image
测试登录,不需要密码:
ssh localhost
3、下载最新版本Hadoop
为了速度我们选择清华大学镜像,服务器,

wget http://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/hadoop-3.1.2/hadoop-3.1.2.tar.gz

image

4、安装Hadoop
等待下载完毕,解压,然后进行安装配置

tar xzvf hadoop-3.1.2.tar.gz
mv hadoop-3.1.2 /usr/local/hadoop

image

查看hadoop是否安装成功

sudo ./bin/hadoop version

image

5、创建Hadoop账号
为hadoop创建专用账户,并设置为超级用户

sudo addgroup hadoop
sudo adduser --ingroup hadoop hadoopuser
//加为超级用户
sudo adduser hadoopuser sudo

6、配置Hadoop环境变量
在.bashrc文件中添加hadoop环境变量,使用下面的命令

sudo vim ./.bashrc

然后塞入下面的配置,根据实际路径为准:

export HADOOP_HOME=/home/frankxulei/hadoop
export HADOOP_INSTALL=$HADOOP_HOME
export HADOOP_MAPRED_HOME=$HADOOP_HOME
export HADOOP_COMMON_HOME=$HADOOP_HOME
export HADOOP_HDFS_HOME=$HADOOP_HOME
export YARN_HOME=$HADOOP_HOME
export HADOOP_COMMON_LIB_NATIVE_DIR=$HADOOP_HOME/lib/native
export PATH=$PATH:$HADOOP_HOME/sbin:$HADOOP_HOME/bin

使生效:
source ./.bashrc

7、Hadoop测试例子
我们直接Hadoop自带的示例来测试单机模式是否正常工作。创建input目录,然后拷贝测试文本文件到input中,然后执行hadoop的Job分析结果。
本地创建input文件夹:

mkdir ~/input

拷贝测试数据文件到这个文件夹中:

cp /usr/local/hadoop/etc/hadoop/*.xml ~/input

运行下面的命令,mapreduce分析出出a开头的单词频率

bin/hadoop jar /usr/local/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.2.jar grep ./input/ ./output 'a[a-z.]+'

等待漫长的分析计算过程结束,你会看到hadoop不断输出日志信息,读取、清洗、统计结果
image
在输出目录上运行cat来检查大数据分析的结果如下:

cat ~/output/*

结果信息安装不同的单词,频率倒序输出结果,如图所示,表示Hadoop分析过程成功执行
image
8、管理界面
启动Hadoop可以在http://localhost:9870地址,查看Hadoop服务运行状态信息
image
后续我们还有Hadoop集群模式,等复杂的实战配置。
阿里巴巴Java群超过4800人
进群方式:钉钉扫码入群
image
阿里巴巴MongoDB群
image
参考http://hadoop.apache.org/docs/stable/hadoop-project-dist/hadoop-common/SingleCluster.html#Fully-Distributed_Operation

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
如何在Ubuntu上安装最新版本的Node.js
如何在Ubuntu上安装最新版本的Node.js Node.js是一个软件平台,通常用于构建大规模的服务器端应用。Node.js使用JavaScript作为其脚本语言,由于其非阻塞I/O设计以及单线程事件循环机制,使得它可以交付超高的性能。
759 0
《React Native移动开发实战》一一2.2 Git版本控制工具
本节书摘来自华章出版社《React Native移动开发实战》一 书中的第2章,第2.2节,作者:袁林 著 ,更多章节内容可以访问云栖社区“华章计算机”公众号查看。
1763 0
[喵咪大数据]Hadoop集群模式
既然是大数据无论存储和处理都需要相当大的磁盘或者是处理的资源消耗,那么单机肯定是满足不了我们的需求的,所以本节我们就来了解Hadoop的集群模式搭建,在集群情况下一同配合处理任务分发,存储分担等相关的功能进行实践.
104 0
[喵咪大数据]Hadoop节点添加下线和磁盘扩容操作
Hadoop绝非一个简单程序,集群模式下更是如此,所有的数据都存储在Hadoop中如果操作不当会存在丢失数据的风险,那么怎么在安全的情况,扩容下线维护或者磁盘满了怎么增加空间,就是今天的主要内容了.
232 0
Linux 下安装oracle 数据库的准备
注:不做特别说明,则全由root执行 1.linux检查安装包是否全 rpm -q --queryformat "%{NAME}-%{VERSION}-%{RELEASE} (%{ARCH})\n" binutils \ compat-libstdc++-33...
590 0
MIT科技评论:阿里是大数据Game Changer
文章围绕阿里巴巴人工智能和云计算进行了大篇幅报道
886 0
[喵咪大数据]Hadoop单机模式
千里之行始于足下,学习大数据我们首先就要先接触Hadoop,上节介绍到Hadoop分为Hadoop-HDFS,Hadoop-YARN,Hadoop-Mapreduce组成,分别负责分布式文件存储,任务调度,计算处理,本机我们在单机模式下把Hadoop运行起来并且简单的使用接触Hadoop相关的机制.
68 0
+关注
徐雷frank
1.阿里云栖课堂Java讲师 2.阿里云大学讲师,主讲《MongoDB高级实战》《微服务Spring Cloud设计与开发实战》课程 3.MongoDB中文社区核心专家组 4.《MongoDB实战》第2版译者 5.吉林大学计算机科学学士 上海交通大学硕士
55
文章
456
问答
来源圈子
更多
+ 订阅
文章排行榜
最热
最新
相关电子书
更多
《2021云上架构与运维峰会演讲合集》
立即下载
《零基础CSS入门教程》
立即下载
《零基础HTML入门教程》
立即下载