《Hadoop与大数据挖掘》——2.3 Hadoop集群命令

简介:

本节书摘来自华章计算机《Hadoop与大数据挖掘》一书中的第2章,第2.3节,作者 张良均 樊哲 位文超 刘名军 许国杰 周龙 焦正升,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

2.3 Hadoop集群命令

一般操作Hadoop集群都是使用相关的Hadoop命令,比如文件上传、下载、删除,文件夹新建、删除、拷贝等;又或者提交MapReduce任务并执行、查看MapReduce任务执行状态等。那么Hadoop集群包含的相关命令有哪些呢?

大多数Hadoop集群的相关命令类别如表2-3所示。

image
image
image

下面针对每种集群命令,介绍其中常用的命令,为后面的操作打下基础。

2.3.1 HDFS常用命令hdfs dfs

在讲解这个命令前,先对hdfs dfs、hadoop fs、hadoop dfs这3个命令进行区分。

image

该命令的操作在代码清单2-18中列出。

image
image
image

其中斜体加粗的命令是比较常用的,一般可以根据命令名称推断出该命令的功能及用法。同时,也可以使用-usage命令查看某个具体名,如代码清单2-19所示。

image

这里,针对常用的命令做简单介绍,如表2-4所示。

image

2.3.2 动手实践:hdfs dfs命令实战

在了解了一些Hadoop HDFS相关命令后,即可进行实验,加深对该类命令的认识。

实验步骤如下:

1)root账号登录master机器终端;

2)上传/root/anaconda-ks.cfg 文件到HDFS的/user/root/目录下;

3)复制或移动HDFS中/user/root/anaconda-ks.cfg 到/user/root/tmp/目录下;

4)下载HDFS中的/user/root/tmp/anaconda-ks.cfg 文件到linux /tmp目录下;

5)删除/user/root/tmp目录。

思考:

1)如果使用的不是root账号登录,那么可以操作吗?如何操作?

2)删除/user/root/tmp目录可以使用哪些命令?不同命令有什么区别?

2.3.3 MapReduce常用命令mapred job

MapReduce常用命令就是job相关命令,该命令相关参数及描述如代码清单2-20所示。

image

其中比较常用的描述如下。

image

2.3.4 YARN常用命令yarn jar

YARN常用命令就是yarn jar命令,即提交一个MapReduce任务的命令。使用该命令可以直接运行一个MapReduce任务。该命令描述如代码清单2-21所示。

image

从上面的描述中可以看出,其实调用yarn jar命令还是比较简单的,只需要给出要执行的jar文件路径、可选的主类,以及主类对应的输入参数即可。

2.3.5 动手实践:运行MapReduce任务

实验步骤如下:

1)上传/root/anaconda-ks.cfg文件到HDFS文件系统/user/root目录;

2)使用yarn jar的方式提交任务,其中,

image

3)查看输出运行结果;

4)使用mapred job命令查看任务状态及对应日志输出;

5)再次执行任务,查看输出信息;

6)产生一个大数据文件,上传到HDFS,使用该大数据文件执行单词计数MapReduce任务,在执行到一半后,使用mapred job的kill命令,杀死该任务,查看相关输出信息。

思考:

1)执行第5步的时候会报错吗?报什么错?怎么解决?

2)可以在Hadoop IDE中直接提交Job吗?如果可以怎么做?如果不可以,为什么?

相关实践学习
简单用户画像分析
本场景主要介绍基于海量日志数据进行简单用户画像分析为背景,如何通过使用DataWorks完成数据采集 、加工数据、配置数据质量监控和数据可视化展现等任务。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
5天前
|
分布式计算 资源调度 Hadoop
java与大数据:Hadoop与MapReduce
java与大数据:Hadoop与MapReduce
23 0
|
15天前
|
存储 分布式计算 Hadoop
【专栏】Hadoop,开源大数据处理框架:驭服数据洪流的利器
【4月更文挑战第28天】Hadoop,开源大数据处理框架,由Hadoop Common、HDFS、YARN和MapReduce组成,提供大规模数据存储和并行处理。其优势在于可扩展性、容错性、高性能、灵活性及社区支持。然而,数据安全、处理速度、系统复杂性和技能短缺是挑战。通过加强安全措施、结合Spark、自动化工具和培训,Hadoop在应对大数据问题中保持关键地位。
|
19天前
|
分布式计算 Hadoop 大数据
[大数据] mac 史上最简单 hadoop 安装过程
[大数据] mac 史上最简单 hadoop 安装过程
|
19天前
|
分布式计算 监控 Hadoop
Ganglia监控Hadoop与HBase集群
Ganglia监控Hadoop与HBase集群
|
25天前
|
存储 分布式计算 Hadoop
Hadoop集群搭建
Hadoop集群搭建
|
25天前
|
分布式计算 负载均衡 Hadoop
Hadoop集群节点添加
Hadoop集群节点添加
|
25天前
|
存储 分布式计算 Hadoop
Hadoop集群规模扩展
【4月更文挑战第14天】Hadoop集群扩展可通过添加更多节点、垂直扩展(增强单节点资源)和水平扩展(增加节点数量)来实现。关键点包括规划扩展策略、确保集群稳定性和优化配置。注意在扩展过程中要保证数据完整性,并根据需求调整以提升集群性能和效率。
22 1
|
14天前
|
分布式计算 大数据 BI
MaxCompute产品使用合集之MaxCompute项目的数据是否可以被接入到阿里云的Quick BI中
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
14天前
|
SQL 分布式计算 大数据
MaxCompute产品使用合集之怎样可以将大数据计算MaxCompute表的数据可以导出为本地文件
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
13天前
|
分布式计算 DataWorks 数据库
DataWorks操作报错合集之DataWorks使用数据集成整库全增量同步oceanbase数据到odps的时候,遇到报错,该怎么处理
DataWorks是阿里云提供的一站式大数据开发与治理平台,支持数据集成、数据开发、数据服务、数据质量管理、数据安全管理等全流程数据处理。在使用DataWorks过程中,可能会遇到各种操作报错。以下是一些常见的报错情况及其可能的原因和解决方法。
24 0

热门文章

最新文章