Hadoop 简介

2014-10-13 2249

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： Hadoop的发音是 [‘hædu:p]。 Apache的发音是 [æpæʃ]。 Hadoop是Apache基金会的一个开源项目，用于大量数据的分布式处理。核心为HDFS与MapReduce。 1.HDFS HDFS,Hadoop Distributed File System，Hadoop分布式文件系统。 2.map-reduce思想 mapper将大任务化为小任务，分布

Hadoop的发音是 [‘hædu:p]。 Apache的发音是 [æpæʃ]。

Hadoop是Apache基金会的一个开源项目，用于大量数据的分布式处理。核心为HDFS与MapReduce。

1.HDFS

HDFS,Hadoop Distributed File System，Hadoop分布式文件系统。

2.map-reduce思想

mapper将大任务化为小任务，分布式并行计算。中间结果传给reducer，作归约整理，得到最终结果。

3.相关类

3.1配置

void org.apache.hadoop.mapred.JobConf. setOutputKeyClass(Class<?> theClass)
void org.apache.hadoop.mapred.JobConf. setOutputValueClass(Class<?> theClass)
void org.apache.hadoop.mapred.JobConf. setMapperClass(Class<? extends Mapper> theClass)
void org.apache.hadoop.mapred.JobConf. setCombinerClass(Class<? extends Reducer> theClass)
void org.apache.hadoop.mapred.JobConf. setReducerClass(Class<? extends Reducer> theClass)
void org.apache.hadoop.mapred.JobConf. setInputFormat(Class<? extends InputFormat> theClass)
void org.apache.hadoop.mapred.JobConf. setOutputFormat(Class<? extends OutputFormat> theClass)
void org.apache.hadoop.mapred.FileInputFormat. setInputPaths(JobConf conf, Path... inputPaths)
void org.apache.hadoop.mapred.FileInputFormat. setInputPaths(JobConf conf, Path... inputPaths)
RunningJob org.apache.hadoop.mapred.JobClient. runJob(JobConf job)

3.2 mapper

org.apache.hadoop.mapred.Mapper<K1, V1, K2, V2>
接口。key1和value1为Mapper任务输入的键值对。key2和value2为Mapper任务输出的键值对。
void org.apache.hadoop.mapred.Mapper.map(K1 key, V1 value, OutputCollector<K2, V2> output, Reporter reporter)
mapper接口仅有的方法。

3.3 reducer

org.apache.hadoop.mapred.Reducer<K2, V2, K3, V3>
接口。K2, V2对应mapper的输出。K3, V3对应着reducer的最终输出。
void org.apache.hadoop.mapred.Reducer.reduce(K2 key, Iterator<V2> values, OutputCollector<K3, V3> output, Reporter reporter)
Reducer接口仅有的方法。

3.4 其他

org.apache.hadoop.mapred. OutputCollector<K, V>
接口。仅有一个方法void collect(K key, V value)。

org.apache.hadoop.mapred. Reporter
接口。用于感知处理进度等。

4.示例代码

在统计词频的例子里，k1是文件名，v1是文件的内容，mapper逐个遍历单词，每遇到一个单词w，就产生一个中间键值对<w, "1">，即<k2,v2>，这表示单词w又找到了一个。mapper将<k2,v2>传给reduce函数，这样reduce函数接受的键就是单词w，值是一串"1"（最基本的实现是这样，但可以优化），个数等于键为w的键值对的个数，然后将这些“1”累加就得到单词w的出现次数。最后这些单词的出现次数会被写到用户定义的位置，存储在HDFS中。

Hadoop 简介

1.HDFS

2.map-reduce思想

3.相关类

3.1配置

3.2 mapper

3.3 reducer

3.4 其他

4.示例代码

热门文章

最新文章

相关课程

相关电子书

相关实验场景