备案控制台

开发者社区大数据文章正文

《Hadoop MapReduce实战手册》一2.1 简介

2017-05-02 1491

版权

版权声明：

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

本节书摘来异步社区《Hadoop MapReduce实战手册》一书中的第2章，第2.1节，作者：【美】Srinath Perera , Thilina Gunarathne 译者：杨卓荦责编：杨海玲，更多章节内容可以访问云栖社区“异步社区”公众号查看。

2.1 简介

Hadoop MapReduce实战手册
Hadoop分布式文件系统（Hadoop Distributed File System，HDFS）被设计成适合运行在低廉的通用硬件上的面向块结构的分布式文件系统。HDFS支持海量数据存储，并提供高吞吐量的数据访问。HDFS通过跨多个节点的冗余方式存储文件数据，以确保容错性和高聚合带宽。

HDFS是Hadoop MapReduce计算默认使用的分布式文件系统。Hadoop在处理存储在HDFS上的数据时支持数据本地化感知。然而，HDFS也可以用作一个通用的分布式文件系统。HDFS架构主要由一个用于处理文件系统元数据的中央NameNode以及很多个用于存储真实数据块的DataNode组成。HDFS数据块通常是粗粒度的，适合存储大数据产品。

1.5节和第1章中的其他各节说明了如何部署HDFS，并对HDFS的基本操作给出了一个概述。本章将学习一组精心挑选的高级HDFS操作，在使用Hadoop MapReduce进行大规模数据处理时，这些操作将十分有用，同时，也适用于使用HDFS作为一个独立的分布式文件系统用于非MapReduce场景。

文章标签：

分布式计算

存储

大数据

Hadoop

关键词：

hadoop mapreduce

hadoop简介

mapreduce hadoop

开源大数据平台 E-MapReduce hadoop

mapreduce简介

异步社区

目录

相关文章

武子康

|

3月前

|

分布式计算资源调度 Hadoop

大数据-80 Spark 简要概述系统架构部署模式与Hadoop MapReduce对比

大数据-80 Spark 简要概述系统架构部署模式与Hadoop MapReduce对比

武子康

99 2 2

小白学大数据

|

1月前

|

数据采集分布式计算 Hadoop

使用Hadoop MapReduce进行大规模数据爬取

使用Hadoop MapReduce进行大规模数据爬取

小白学大数据

54 1 1

武子康

|

3月前

|

SQL 分布式计算关系型数据库

Hadoop-21 Sqoop 数据迁移工具简介与环境配置云服务器 ETL工具 MySQL与Hive数据互相迁移导入导出

Hadoop-21 Sqoop 数据迁移工具简介与环境配置云服务器 ETL工具 MySQL与Hive数据互相迁移导入导出

武子康

125 3 3

武子康

|

3月前

|

分布式计算资源调度 Hadoop

Hadoop-10-HDFS集群 Java实现MapReduce WordCount计算 Hadoop序列化编写Mapper和Reducer和Driver 附带POM 详细代码图文等内容

Hadoop-10-HDFS集群 Java实现MapReduce WordCount计算 Hadoop序列化编写Mapper和Reducer和Driver 附带POM 详细代码图文等内容

武子康

145 3 3

武子康

|

3月前

|

存储分布式计算 Hadoop

Hadoop-33 HBase 初识简介项目简介整体架构 HMaster HRegionServer Region

Hadoop-33 HBase 初识简介项目简介整体架构 HMaster HRegionServer Region

武子康

75 2 2

武子康

|

3月前

|

分布式计算 Hadoop Unix

Hadoop-28 ZooKeeper集群 ZNode简介概念和测试数据结构与监听机制持久性节点持久顺序节点事务ID Watcher机制

Hadoop-28 ZooKeeper集群 ZNode简介概念和测试数据结构与监听机制持久性节点持久顺序节点事务ID Watcher机制

武子康

60 1 1

武子康

|

3月前

|

存储 SQL 消息中间件

Hadoop-26 ZooKeeper集群 3台云服务器基础概念简介与环境的配置使用架构组成分布式协调框架 Leader Follower Observer

Hadoop-26 ZooKeeper集群 3台云服务器基础概念简介与环境的配置使用架构组成分布式协调框架 Leader Follower Observer

武子康

64 0 0

武子康

|

3月前

|

SQL 分布式计算关系型数据库

Hadoop-24 Sqoop迁移 MySQL到Hive 与 Hive到MySQL SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce

Hadoop-24 Sqoop迁移 MySQL到Hive 与 Hive到MySQL SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce

武子康

150 0 0

武子康

|

3月前

|

SQL 分布式计算关系型数据库

Hadoop-23 Sqoop 数据MySQL到HDFS(部分) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce

Hadoop-23 Sqoop 数据MySQL到HDFS(部分) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce

武子康

64 0 0

武子康

|

3月前

|

SQL 分布式计算关系型数据库

Hadoop-22 Sqoop 数据MySQL到HDFS(全量) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce

Hadoop-22 Sqoop 数据MySQL到HDFS(全量) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce

武子康

84 0 0

热门文章

最新文章

Flume+Hadoop：打造你的大数据处理流水线

基于Java的Hadoop文件处理系统：高效分布式数据解析与存储

linux中HADOOP_HOME和JAVA_HOME删除后依然指向旧目录

使用Hadoop MapReduce进行大规模数据爬取

MapReduce 二次排序详解

Google MapReduce到底解决什么问题？

hadoop 原生MapReduce 实现数据连接

MapReduce框架Partitioner分区方法

MapReduce业务－图片关联计算

MapReduce技术的初步了解与学习

E-MapReduce Serverless Spark 版测评

E-MapReduce Serverless Spark 评测

E-MapReduce Serverless Spark开发者评测

E-MapReduce Serverless Spark 评测

E-MapReduce Serverless Spark体验评测

MapReduce编程模型——自定义序列化类实现多指标统计

MapReduce编程模型——在idea里面邂逅CDH MapReduce

YARN支持哪些非基于MapReduce的计算模型？

MapReduce是一种用于并行计算的编程模型和处理大规模数据集的实现

Hadoop生态系统详解：HDFS与MapReduce编程

相关课程

更多

大数据实战项目：反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第五阶段

大数据实战项目 - 反爬虫系统（Lua+Spark+Redis+Hadoop框架搭建）第六阶段

大数据Hadoop快速入门

Hadoop快速入门

Hadoop 分布式计算框架 MapReduce

Hadoop企业优化及扩展案例

相关电子书

更多

《构建Hadoop生态批流一体的实时数仓》

零基础实现hadoop 迁移 MaxCompute 之数据

CIO 指南:如何在SAP软件架构中使用Hadoop

相关实验场景

更多

搭建Hadoop环境

下一篇

阿里云开通OSS存储服务详细流程