Hadoop 2.x (一)

简介:

1、三大马车

MapReduce ,离线计算框架。对海量数据进行处理,支持分布式,大数据分为小数据集,小数据集进行处理(Map),合并统计数据结果(Reduce)。仅适合离线批处理,很好的容错和扩展,适合简单批处理。

HDFS,分布式文件系统,存储海量数据,分布式,保证数据安全性。主节点保存着文件的元数据,存在内存中,用java写的,同时本地有备份。从节点以块为单位,保存数据及数据校验和

HBase,存储数据的数据库

YARN,分布式,资源管理框架 ,管理集群硬件等信息,主从,每个节点都有一个yarn的资源子节点,给主节点提供信息,字节点要向主节点申请资源,container。

2、Hadoop 2.x生态搭建

目录
相关文章
|
分布式计算 Hadoop Java
|
存储 分布式计算 资源调度
Hadoop构成
Hadoop构成
47 0
|
机器学习/深度学习 存储 SQL
Hadoop
Hadoop组成
219 0
|
分布式计算 资源调度 Java
Hadoop3.2.0使用详解
Hadoop3.2.0使用详解1.概述Hadoop3已经发布很久了,迭代集成的一些新特性也是很有用的。截止本篇博客书写为止,Hadoop发布了3.2.0。接下来,笔者就为大家分享一下在使用Hadoop3中遇到到一些问题,以及解决方法。
3622 0
|
分布式计算 Hadoop
Hadoop DistributedCache详解(转载)
转自:http://dongxicheng.org/mapreduce-nextgen/hadoop-distributedcache-details/
811 0
|
分布式计算 监控 Hadoop
|
分布式计算 Java Hadoop
|
SQL 分布式计算 大数据

相关实验场景

更多
AI助理

你好,我是AI助理

可以解答问题、推荐解决方案等