《Hadoop与大数据挖掘》——2.3 Hadoop集群命令

简介:

本节书摘来自华章计算机《Hadoop与大数据挖掘》一书中的第2章,第2.3节,作者 张良均 樊哲 位文超 刘名军 许国杰 周龙 焦正升,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

2.3 Hadoop集群命令

一般操作Hadoop集群都是使用相关的Hadoop命令,比如文件上传、下载、删除,文件夹新建、删除、拷贝等;又或者提交MapReduce任务并执行、查看MapReduce任务执行状态等。那么Hadoop集群包含的相关命令有哪些呢?

大多数Hadoop集群的相关命令类别如表2-3所示。

image
image
image

下面针对每种集群命令,介绍其中常用的命令,为后面的操作打下基础。

2.3.1 HDFS常用命令hdfs dfs

在讲解这个命令前,先对hdfs dfs、hadoop fs、hadoop dfs这3个命令进行区分。

image

该命令的操作在代码清单2-18中列出。

image
image
image

其中斜体加粗的命令是比较常用的,一般可以根据命令名称推断出该命令的功能及用法。同时,也可以使用-usage命令查看某个具体名,如代码清单2-19所示。

image

这里,针对常用的命令做简单介绍,如表2-4所示。

image

2.3.2 动手实践:hdfs dfs命令实战

在了解了一些Hadoop HDFS相关命令后,即可进行实验,加深对该类命令的认识。

实验步骤如下:

1)root账号登录master机器终端;

2)上传/root/anaconda-ks.cfg 文件到HDFS的/user/root/目录下;

3)复制或移动HDFS中/user/root/anaconda-ks.cfg 到/user/root/tmp/目录下;

4)下载HDFS中的/user/root/tmp/anaconda-ks.cfg 文件到linux /tmp目录下;

5)删除/user/root/tmp目录。

思考:

1)如果使用的不是root账号登录,那么可以操作吗?如何操作?

2)删除/user/root/tmp目录可以使用哪些命令?不同命令有什么区别?

2.3.3 MapReduce常用命令mapred job

MapReduce常用命令就是job相关命令,该命令相关参数及描述如代码清单2-20所示。

image

其中比较常用的描述如下。

image

2.3.4 YARN常用命令yarn jar

YARN常用命令就是yarn jar命令,即提交一个MapReduce任务的命令。使用该命令可以直接运行一个MapReduce任务。该命令描述如代码清单2-21所示。

image

从上面的描述中可以看出,其实调用yarn jar命令还是比较简单的,只需要给出要执行的jar文件路径、可选的主类,以及主类对应的输入参数即可。

2.3.5 动手实践:运行MapReduce任务

实验步骤如下:

1)上传/root/anaconda-ks.cfg文件到HDFS文件系统/user/root目录;

2)使用yarn jar的方式提交任务,其中,

image

3)查看输出运行结果;

4)使用mapred job命令查看任务状态及对应日志输出;

5)再次执行任务,查看输出信息;

6)产生一个大数据文件,上传到HDFS,使用该大数据文件执行单词计数MapReduce任务,在执行到一半后,使用mapred job的kill命令,杀死该任务,查看相关输出信息。

思考:

1)执行第5步的时候会报错吗?报什么错?怎么解决?

2)可以在Hadoop IDE中直接提交Job吗?如果可以怎么做?如果不可以,为什么?

相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
存储 分布式计算 Hadoop
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
844 79
|
分布式计算 Hadoop Java
CentOS中构建高可用Hadoop 3集群
这个过程像是在一个未知的森林中探索。但当你抵达终点,看到那个熟悉的Hadoop管理界面时,所有的艰辛都会化为乌有。仔细观察,尽全力,这就是构建高可用Hadoop 3集群的挑战之旅。
529 21
|
存储 分布式计算 大数据
Flume+Hadoop:打造你的大数据处理流水线
本文介绍了如何使用Apache Flume采集日志数据并上传至Hadoop分布式文件系统(HDFS)。Flume是一个高可用、可靠的分布式系统,适用于大规模日志数据的采集和传输。文章详细描述了Flume的安装、配置及启动过程,并通过具体示例展示了如何将本地日志数据实时传输到HDFS中。同时,还提供了验证步骤,确保数据成功上传。最后,补充说明了使用文件模式作为channel以避免数据丢失的方法。
1082 4
|
存储 分布式计算 Hadoop
数据湖技术:Hadoop与Spark在大数据处理中的协同作用
【10月更文挑战第27天】在大数据时代,数据湖技术凭借其灵活性和成本效益成为企业存储和分析大规模异构数据的首选。Hadoop和Spark作为数据湖技术的核心组件,通过HDFS存储数据和Spark进行高效计算,实现了数据处理的优化。本文探讨了Hadoop与Spark的最佳实践,包括数据存储、处理、安全和可视化等方面,展示了它们在实际应用中的协同效应。
814 2
|
存储 分布式计算 Hadoop
数据湖技术:Hadoop与Spark在大数据处理中的协同作用
【10月更文挑战第26天】本文详细探讨了Hadoop与Spark在大数据处理中的协同作用,通过具体案例展示了两者的最佳实践。Hadoop的HDFS和MapReduce负责数据存储和预处理,确保高可靠性和容错性;Spark则凭借其高性能和丰富的API,进行深度分析和机器学习,实现高效的批处理和实时处理。
759 1
|
分布式计算 Kubernetes Hadoop
大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS
大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS
1262 6
|
分布式计算 资源调度 Hadoop
大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比
大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比
595 2
|
存储 分布式计算 资源调度
两万字长文向你解密大数据组件 Hadoop
两万字长文向你解密大数据组件 Hadoop
929 11

热门文章

最新文章