《Hadoop MapReduce实战手册》一2.2 HDFS基准测试

简介:

本节书摘来异步社区《Hadoop MapReduce实战手册》一书中的第2章,第2.2节,作者: 【美】Srinath Perera , Thilina Gunarathne 译者: 杨卓荦 责编: 杨海玲,更多章节内容可以访问云栖社区“异步社区”公众号查看。

2.2 HDFS基准测试

Hadoop MapReduce实战手册
运行基准测试程序,可以很好地验证HDFS集群是否已如预期般正确设置并执行。DFSIO是一个Hadoop自带的基准测试,可以用来分析一个HDFS集群的I/O性能。该部分展示了如何使用DFSIO来对HDFS集群的读取和写入性能进行基准测试。

准备工作
在运行这些基准程序之前,必须安装和部署HDFS和MapReduce。导出HADOOP_HOME环境变量,将其指向Hadoop安装根目录:

>export HADOOP_HOME = /../hadoop-1.0.4

该基准测试程序在$HADOOP_HOME/hadoop-*test.jar文件中。

操作步骤
下列步骤显示了如何运行写入性能基准测试。

  1. 在$HADOOP_HOME目录下执行以下命令来测试写入性能的基准程序。-nrFiles参数指定了文件数量,同时-fileSize参数指定了以MB为单位的文件大小。
>bin/hadoop jar $ HADOOP_HOME/hadoop-test- *.JAR TestDFSIO -write 
-nrFiles 5 -CfileSize 100
  1. 基准测试程序会将日志写入控制台,同时将日志追加到一个名为TestDFSIO_results.log的文件中。可以使用-resFile参数提供自定义的结果文件名。

下列步骤显示了如何执行测试读性能的基准测试。

  1. 读性能基准测试采用步骤1中的写性能基准测试创建的文件。因此,写性能基准测试应该在运行读性能基准测试之前执行,并且写基准测试所创建的文件必须存储在HDFS上,以便读基准测试运行。
  2. 执行下面的命令运行读基准测试。读基准测试也会将结果写入控制台,并将其结果追加到一个与写基准测试类似的日志文件。
>bin/ hadoop jar $ HADOOP_HOME/hadoop-test- *.jar TestDFSIO -read 
-nrFiles5 -CfileSize 100

要清理这些基准测试生成的结果文件,可以使用以下命令:

>bin/hadoop jar $HADOOP_HOME hadoop-test-*.jar TestDFSIO –clean

工作原理
DFSIO实际是执行一个MapReduce作业,其中map任务并行读写文件,而reduce任务则被用来收集和归纳性能数据。

更多参考
在运行这些基准测试时,同步观察监控系统,可以帮助你更轻松地识别瓶颈所在。

相关文章
|
3月前
|
分布式计算 Kubernetes Hadoop
大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS
大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS
206 6
|
3月前
|
分布式计算 资源调度 Hadoop
大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比
大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比
93 2
|
1月前
|
数据采集 分布式计算 Hadoop
使用Hadoop MapReduce进行大规模数据爬取
使用Hadoop MapReduce进行大规模数据爬取
|
3月前
|
分布式计算 Hadoop 大数据
大数据体系知识学习(一):PySpark和Hadoop环境的搭建与测试
这篇文章是关于大数据体系知识学习的,主要介绍了Apache Spark的基本概念、特点、组件,以及如何安装配置Java、PySpark和Hadoop环境。文章还提供了详细的安装步骤和测试代码,帮助读者搭建和测试大数据环境。
93 1
|
3月前
|
分布式计算 Hadoop Shell
Hadoop-35 HBase 集群配置和启动 3节点云服务器 集群效果测试 Shell测试
Hadoop-35 HBase 集群配置和启动 3节点云服务器 集群效果测试 Shell测试
95 4
|
3月前
|
分布式计算 监控 Hadoop
Hadoop-29 ZooKeeper集群 Watcher机制 工作原理 与 ZK基本命令 测试集群效果 3台公网云服务器
Hadoop-29 ZooKeeper集群 Watcher机制 工作原理 与 ZK基本命令 测试集群效果 3台公网云服务器
56 1
|
3月前
|
分布式计算 Hadoop Unix
Hadoop-28 ZooKeeper集群 ZNode简介概念和测试 数据结构与监听机制 持久性节点 持久顺序节点 事务ID Watcher机制
Hadoop-28 ZooKeeper集群 ZNode简介概念和测试 数据结构与监听机制 持久性节点 持久顺序节点 事务ID Watcher机制
58 1
|
3月前
|
SQL 分布式计算 关系型数据库
Hadoop-24 Sqoop迁移 MySQL到Hive 与 Hive到MySQL SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce
Hadoop-24 Sqoop迁移 MySQL到Hive 与 Hive到MySQL SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce
131 0
|
3月前
|
SQL 分布式计算 关系型数据库
Hadoop-23 Sqoop 数据MySQL到HDFS(部分) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce
Hadoop-23 Sqoop 数据MySQL到HDFS(部分) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce
59 0
|
3月前
|
SQL 分布式计算 监控
Hadoop-20 Flume 采集数据双写至本地+HDFS中 监控目录变化 3个Agent MemoryChannel Source对比
Hadoop-20 Flume 采集数据双写至本地+HDFS中 监控目录变化 3个Agent MemoryChannel Source对比
76 3