1、三大马车
MapReduce ,离线计算框架。对海量数据进行处理,支持分布式,大数据分为小数据集,小数据集进行处理(Map),合并统计数据结果(Reduce)。仅适合离线批处理,很好的容错和扩展,适合简单批处理。
HDFS,分布式文件系统,存储海量数据,分布式,保证数据安全性。主节点保存着文件的元数据,存在内存中,用java写的,同时本地有备份。从节点以块为单位,保存数据及数据校验和
HBase,存储数据的数据库
YARN,分布式,资源管理框架 ,管理集群硬件等信息,主从,每个节点都有一个yarn的资源子节点,给主节点提供信息,字节点要向主节点申请资源,container。
2、Hadoop 2.x生态搭建