hadoop 原生MapReduce 实现数据连接

简介:

 其实很简单,输入两个文件,一个作为基础数据(学生信息文件),一个是分数信息文件。 
学生信息文件:存放学生数据:包括学号,学生名称

分数信息数据:存放学生的分数信息:包括学号,学科,分数。

我们将通过M/R实现根据学号,进行数据关联,最终结果为:学生名称,学科,分数。

模拟数据

学生数据

[hadoop@hadoop11 student_data]$ cat students.txt
1       Randy
2       Tom
3       kitty
4       Lucy
5       Lily
6       Bruce
7       King
8       Jay
9       Melody
10      Kimy
/////////////////////////////////////////////////////////////////////////////////////////////////////////////////////////////////////

分数数据

[hadoop@hadoop11 student_data]$ cat scores.txt
1       English 89
2       English 77
3       English 54
4       English 98
5       English 83
6       English 99
7       English 30
8       English 76
9       English 56
10      English 88
1       Math    79
2       Math    37
3       Math    65
4       Math    88
5       Math    89
6       Math    59
7       Math    60
8       Math    86
9       Math    56
10      Math    68
1       China   89
2       China   67
3       China   84
4       China   68
5       China   43
6       China   89
7       China   70
8       China   96
9       China   56
10      China   78
///////////////////////////////////////////////////////////////////////////////////////////////////////

实现

1)两个文本解析器,分别解析两个文本文件。

 



本文转自 randy_shandong 51CTO博客,原文链接:http://blog.51cto.com/dba10g/1565697,如需转载请自行联系原作者

相关文章
|
9月前
|
分布式计算 资源调度 Hadoop
大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比
大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比
181 2
|
5月前
|
分布式计算 Hadoop 大数据
从Excel到Hadoop:数据规模的进化之路
从Excel到Hadoop:数据规模的进化之路
92 10
|
6月前
|
存储 分布式计算 Hadoop
基于Java的Hadoop文件处理系统:高效分布式数据解析与存储
本文介绍了如何借鉴Hadoop的设计思想,使用Java实现其核心功能MapReduce,解决海量数据处理问题。通过类比图书馆管理系统,详细解释了Hadoop的两大组件:HDFS(分布式文件系统)和MapReduce(分布式计算模型)。具体实现了单词统计任务,并扩展支持CSV和JSON格式的数据解析。为了提升性能,引入了Combiner减少中间数据传输,以及自定义Partitioner解决数据倾斜问题。最后总结了Hadoop在大数据处理中的重要性,鼓励Java开发者学习Hadoop以拓展技术边界。
202 7
|
7月前
|
数据采集 分布式计算 Hadoop
使用Hadoop MapReduce进行大规模数据爬取
使用Hadoop MapReduce进行大规模数据爬取
|
9月前
|
分布式计算 Java Hadoop
Hadoop-30 ZooKeeper集群 JavaAPI 客户端 POM Java操作ZK 监听节点 监听数据变化 创建节点 删除节点
Hadoop-30 ZooKeeper集群 JavaAPI 客户端 POM Java操作ZK 监听节点 监听数据变化 创建节点 删除节点
166 1
|
9月前
|
SQL 分布式计算 关系型数据库
Hadoop-24 Sqoop迁移 MySQL到Hive 与 Hive到MySQL SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce
Hadoop-24 Sqoop迁移 MySQL到Hive 与 Hive到MySQL SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce
236 0
|
9月前
|
SQL 分布式计算 关系型数据库
Hadoop-23 Sqoop 数据MySQL到HDFS(部分) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce
Hadoop-23 Sqoop 数据MySQL到HDFS(部分) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce
109 0
|
9月前
|
SQL 分布式计算 关系型数据库
Hadoop-22 Sqoop 数据MySQL到HDFS(全量) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce
Hadoop-22 Sqoop 数据MySQL到HDFS(全量) SQL生成数据 HDFS集群 Sqoop import jdbc ETL MapReduce
157 0
|
4月前
|
存储 分布式计算 Hadoop
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
226 79
|
9月前
|
分布式计算 Kubernetes Hadoop
大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS
大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS
379 6

相关实验场景

更多