Hadoop 2.x (一)

简介:

1、三大马车

MapReduce ,离线计算框架。对海量数据进行处理,支持分布式,大数据分为小数据集,小数据集进行处理(Map),合并统计数据结果(Reduce)。仅适合离线批处理,很好的容错和扩展,适合简单批处理。

HDFS,分布式文件系统,存储海量数据,分布式,保证数据安全性。主节点保存着文件的元数据,存在内存中,用java写的,同时本地有备份。从节点以块为单位,保存数据及数据校验和

HBase,存储数据的数据库

YARN,分布式,资源管理框架 ,管理集群硬件等信息,主从,每个节点都有一个yarn的资源子节点,给主节点提供信息,字节点要向主节点申请资源,container。

2、Hadoop 2.x生态搭建

目录
相关文章
|
SQL 存储 分布式计算
hadoop的特点
hadoop的特点
|
分布式计算 Hadoop Java
|
分布式计算 资源调度 Hadoop
02 Hadoop介绍
02 Hadoop介绍
52 0
|
存储 分布式计算 资源调度
Hadoop构成
Hadoop构成
43 0
|
分布式计算 安全 Hadoop
|
分布式计算 Hadoop
Hadoop DistributedCache详解(转载)
转自:http://dongxicheng.org/mapreduce-nextgen/hadoop-distributedcache-details/
794 0
|
分布式计算 Java Hadoop
|
SQL 分布式计算 大数据
|
存储 分布式计算 大数据

热门文章

最新文章

相关实验场景

更多