Hadoop中的MapReduce框架原理、切片源码断点在哪断并且介绍相关源码、FileInputFormat切片源码解析、总结,那些可以证明你看过切片的源码

简介: Hadoop中的MapReduce框架原理、切片源码断点在哪断并且介绍相关源码、FileInputFormat切片源码解析、总结,那些可以证明你看过切片的源码

@[toc]

13.MapReduce框架原理

13.1InputFormat数据输入

13.1.3FileInputFormat切片源码解析

13.1.3.1切片源码断点在哪断并且介绍相关源码:

断点在https://blog.csdn.net/Redamancy06/article/details/126501627?spm=1001.2014.3001.5501
这篇文章写了一部分了,可以先跟着这篇文章做,然后再看这篇文件就好理解了。

在这里插入图片描述一直运行到这一步然后强制进入。
在这里插入图片描述在这个位置打上断点,然后再断点处强行进入

在这里插入图片描述进去后在这两个地方打上断点

在这里插入图片描述然后进入这个断点
在这里插入图片描述就到FileInputFormat类里面了

在这里插入图片描述然后一直往上翻到最上面,点这个按下f4,就可以出现继承关系(type hierarchy)

在这里插入图片描述

  • 红色框住的是最常用的

TextInputFormat是默认的按行切
CombineTextInputFormat把多个小文件放到一起统一的进行切割

  • 还有两个不经常用的

NLineInputFormat按行进行切割
KeyValueTextInputFormat

在这里插入图片描述
我是设置过的,参考的尚硅谷的java课程,有兴趣的可以看下我之前的博客,或者你在设置里面全部快捷键里搜一下type hierarchy
在这里插入图片描述就可以知道你的快捷键是什么了

https://blog.csdn.net/Redamancy06/article/details/126134561

在这里插入图片描述这里minSize获取的是1,1是怎么来的,可以看getFormatMinSplitSize这个和getMinSplitSize方法

在这里插入图片描述getFormatMinSplitSize方法他是返回的是1,

在这里插入图片描述他这个值是由mapreduce.input.fileinputformat.split.minsize这个值来决定

这个参数去mapred-default.xml里面找

在这里插入图片描述

<property>
  <name>mapreduce.input.fileinputformat.split.minsize</name>
  <value>0</value>
  <description>The minimum size chunk that map input should be split
  into.  Note that some file formats may have minimum split sizes that
  take priority over this setting.</description>
</property>

这里的值默认是0
所以minSize的值取1

在这里插入图片描述
maxSize没有获取到,是为什么呢,进入getMaxSplitSize方法里面看看

在这里插入图片描述他的值是由mapreduce.input.fileinputformat.split.maxsize这个值决定
在这里插入图片描述在mapred-default.xml里面mapreduce.input.fileinputformat.split.maxsize是找不到的,如果找不到,则会返回long的最大值,

在这里插入图片描述这里开始循环变量输入的个数,这里可以说明是一个文件一个文件的切片

在这里插入图片描述这里可以看出来文件地址,和文件大小

在这里插入图片描述

在这里插入图片描述

然后继续往下走到这里,isSplitable是检查是否支持切片,如果是压缩文件就不支持切片

在这里插入图片描述
然后再往下走到这里,blockSize是块的大小为32m,因为是在本地,所以他是32m

在这里插入图片描述然后再往下走,splitSize是切片大小,他也是32m,是怎么来的,进入computeSplitSize方法看看
在这里插入图片描述
因为minSize为1,maxSize为long 的最大值,blockSize是32,所以切片的大小与minSize和maxSize有关,可以通过调整这两个的值来改变切片的大小

在这里插入图片描述
如果文件大小除以切片大小大于1.1则切成两片,如果小于1.1则按一片来处理

在这里插入图片描述
这行代码就是将切片信息存在本地
在这里插入图片描述
然后后面就是job提交源码的过程,有兴趣的可以看我之前写的博客https://blog.csdn.net/Redamancy06/article/details/126501627?spm=1001.2014.3001.5501

13.1.3.2切片源码详解

在这里插入图片描述
在这里插入图片描述双shift打开查找文件,然后输入InputFormat
在这里插入图片描述
然后按f4打开这个进入FileInputFormat
在这里插入图片描述
然后ctrl+f3查看对应的方法

最主要关心的是getSplits这个方法

在这里插入图片描述
这个方法里有切片是怎么切的

13.1.3.3总结,那些可以证明你看过切片的源码

在这里插入图片描述他的切片原则是按照每一个文件单独切片

在这里插入图片描述还有这个,他的值取决于块大小,minSize,maxSize,但是块大小是不能改变的,因为他是实实在在存在物理地址的数据,因此块是不能改变的,但是minSize,和maxSize是可以改变的,可以通过改变这两个值来改变切片大小

在这里插入图片描述然后就是这个1.1倍的事

相关文章
|
安全 算法 网络协议
解析:HTTPS通过SSL/TLS证书加密的原理与逻辑
HTTPS通过SSL/TLS证书加密,结合对称与非对称加密及数字证书验证实现安全通信。首先,服务器发送含公钥的数字证书,客户端验证其合法性后生成随机数并用公钥加密发送给服务器,双方据此生成相同的对称密钥。后续通信使用对称加密确保高效性和安全性。同时,数字证书验证服务器身份,防止中间人攻击;哈希算法和数字签名确保数据完整性,防止篡改。整个流程保障了身份认证、数据加密和完整性保护。
|
机器学习/深度学习 数据可视化 PyTorch
深入解析图神经网络注意力机制:数学原理与可视化实现
本文深入解析了图神经网络(GNNs)中自注意力机制的内部运作原理,通过可视化和数学推导揭示其工作机制。文章采用“位置-转移图”概念框架,并使用NumPy实现代码示例,逐步拆解自注意力层的计算过程。文中详细展示了从节点特征矩阵、邻接矩阵到生成注意力权重的具体步骤,并通过四个类(GAL1至GAL4)模拟了整个计算流程。最终,结合实际PyTorch Geometric库中的代码,对比分析了核心逻辑,为理解GNN自注意力机制提供了清晰的学习路径。
1066 7
深入解析图神经网络注意力机制:数学原理与可视化实现
|
机器学习/深度学习 缓存 自然语言处理
深入解析Tiktokenizer:大语言模型中核心分词技术的原理与架构
Tiktokenizer 是一款现代分词工具,旨在高效、智能地将文本转换为机器可处理的离散单元(token)。它不仅超越了传统的空格分割和正则表达式匹配方法,还结合了上下文感知能力,适应复杂语言结构。Tiktokenizer 的核心特性包括自适应 token 分割、高效编码能力和出色的可扩展性,使其适用于从聊天机器人到大规模文本分析等多种应用场景。通过模块化设计,Tiktokenizer 确保了代码的可重用性和维护性,并在分词精度、处理效率和灵活性方面表现出色。此外,它支持多语言处理、表情符号识别和领域特定文本处理,能够应对各种复杂的文本输入需求。
1760 6
深入解析Tiktokenizer:大语言模型中核心分词技术的原理与架构
|
传感器 人工智能 监控
反向寻车系统怎么做?基本原理与系统组成解析
本文通过反向寻车系统的核心组成部分与技术分析,阐述反向寻车系统的工作原理,适用于适用于商场停车场、医院停车场及火车站停车场等。如需获取智慧停车场反向寻车技术方案前往文章最下方获取,如有项目合作及技术交流欢迎私信作者。
1224 2
|
负载均衡 JavaScript 前端开发
分片上传技术全解析:原理、优势与应用(含简单实现源码)
分片上传通过将大文件分割成多个小的片段或块,然后并行或顺序地上传这些片段,从而提高上传效率和可靠性,特别适用于大文件的上传场景,尤其是在网络环境不佳时,分片上传能有效提高上传体验。 博客不应该只有代码和解决方案,重点应该在于给出解决方案的同时分享思维模式,只有思维才能可持续地解决问题,只有思维才是真正值得学习和分享的核心要素。如果这篇博客能给您带来一点帮助,麻烦您点个赞支持一下,还可以收藏起来以备不时之需,有疑问和错误欢迎在评论区指出~
|
数据采集 分布式计算 搜索推荐
Hadoop学习---7、OutputFormat数据输出、MapReduce内核源码解析、Join应用、数据清洗、MapReduce开发总结(一)
Hadoop学习---7、OutputFormat数据输出、MapReduce内核源码解析、Join应用、数据清洗、MapReduce开发总结(一)
|
存储 分布式计算 Hadoop
Hadoop基础学习---6、MapReduce框架原理(一)
Hadoop基础学习---6、MapReduce框架原理(一)
|
存储 分布式计算 Hadoop
【Hadoop】一个例子带你了解MapReduce
【Hadoop】一个例子带你了解MapReduce
341 1
|
分布式计算 Hadoop 索引
Hadoop学习:MapReduce实现倒排索引
Hadoop学习:MapReduce实现倒排索引
458 0
Hadoop学习:MapReduce实现倒排索引
|
数据采集 缓存 分布式计算
Hadoop学习---7、OutputFormat数据输出、MapReduce内核源码解析、Join应用、数据清洗、MapReduce开发总结(二)
Hadoop学习---7、OutputFormat数据输出、MapReduce内核源码解析、Join应用、数据清洗、MapReduce开发总结(二)

热门文章

最新文章

推荐镜像

更多
  • DNS