Mongorestore的archive(归档)模式恢复原理解析

简介: 在上篇Mongodump的archive(归档)模式原理解析中介绍过,Mongodump的archive(归档)模式产生的文件是将多个集合的数据通过一个Multiplexer多路复用混合在一起,因此对应在恢复的时候就需要有一个Demultiplexer来将数据进行解析,是一个多路复用的逆过程。对应.

在上篇Mongodump的archive(归档)模式原理解析中介绍过,Mongodump的archive(归档)模式产生的文件是将多个集合的数据通过一个Multiplexer多路复用混合在一起,因此对应在恢复的时候就需要有一个Demultiplexer来将数据进行解析,是一个多路复用的逆过程。对应于mongodump,MongoDB官方提供了mongorestore这个恢复工具。

归档文件的格式

复习一下归档文件的格式,其最前面有4个字节的magic number,然后是元数据部分(prelude),描述这个归档文件包含哪些集合、索引等信息,最后是body部分,由一个个slice组成,每个slice有一个header、若干个body和一个terminator,其中header和body都是一个bson,terminator是一个4字节的标记。如下图所示:

mongodump_archive_file_format

流程

从一个mongodump备份的归档文件中恢复的过程包括读取归档文件,解析成对应集合的数据,然后再恢复到目标MongoDB。为了同时支持非归档模式和归档模式,这里mongorestore做了一些抽象:主要包括Intent、file接口和DemuxOut。

Intent、file接口

Intent是对备份文件的抽象,一个Intent有可能是某一个集合的数据的备份文件(在非归档模式下是一个BSON文件),也有可能是某一个集合的元数据文件(在非归档模式下是一个JSON文件,其中包含集合创建时指定的option以及索引信息等,以.metadata.json结尾)。访问一个Intent需要通过file接口的Open()、Read()、Write()和Close()方法:

type file interface {
  io.ReadWriteCloser
  Open() error
}

在非归档模式下,对应的file接口的实现是realBSONFile和realMetadataFile。这两个实现的Open()方法调用os.Open()打开对应的文件,使用返回的File进行读取数据。

在归档模式下,mongorestore定义了几个特定的file接口实现,来实现边读取并解析归档文件边恢复。

DemuxOut

之前介绍过,对于归档文件,由于是各个集合的数据按条(slice)混合在一起的,这样我们在顺序读取归档文件时就需要有一个Demultiplexer来将数据进行解混合(甚至进行分发以便可以实现多个集合并发恢复)。DemuxOut也是一组接口定义,主要负责定义Demultiplexer解析归档文件后如何输出数据:

type DemuxOut interface {
  Write([]byte) (int, error)
  Close() error
}

常规集合的Demux恢复流程

主协程通过读取归档文件的prelude,得到需要恢复的集合信息,然后为每个集合创建Intent。之后启动一个Demultiplexer协程(以下简称Demux协程)负责读取归档文件的body部分并进行解析,同时会启动N个Restore协程(根据指定的集合恢复并发度)进行恢复。Demux协程解析出某个集合的数据后调用DemuxOut的Write()方法将数据输出去。Restore协程从Intent的file接口读取数据,并执行恢复到目标MongoDB。

对于需要恢复的常规集合(包括oplog集合),mongorestore定义了一个RegularCollectionReceiver实现了file接口,定义了一个regularCollectionSender实现了DemuxOut接口。regularCollectionSender的Write()方法将这次要发送的数据长度通过一个readLenChan发送出去。RegularCollectionReceiver的Read()方法则等待在这个readLenChan上,等待新数据的通知,当收到数据长度通知时发送一个buf给它。Demux协程会将数据拷贝到这个buf中,再次通过readLenChan通知已拷贝的数据长度,然后继续往下解析。Restore协程收到数据拷贝完毕的通知后,将这些数据恢复到目标MongoDB。恢复的速度通常来说跟不上Demux解析的速度,因此RegularCollectionReceiver在必要时会将Demux发送过来的数据缓存起来慢慢消费。这样Demux协程就可以不停的往下解析,并且可以实现多集合并发恢复。

特殊集合的处理

有一些集合在恢复过程中是需要特殊处理的,这里所说的特殊处理,主要是需要在恢复的特定阶段进行处理。比如对于admin.system.version集合,需要在恢复常规集合之前进行auth版本是否兼容的判断。再比如用户和角色集合,是在恢复的最后阶段进行处理的。对于这些特殊集合,mongorestore的处理方法是,如果在归档文件读取并解析的过程中读取到了,会先缓存在一个buffer中,等到需要的时候再进行处理。在实现上,mongorestore针对这些集合定义了特殊的DemuxOut接口的实现:SpecialCollectionCache。这个实现包含一个bytes.Buffer,利用其Write()方法和Read()方法(这也是其对应的file接口的实现)实现集合数据的暂存和读取。为此,mongorestore为每个Intent都维护了一个对应的DemuxOut,以便可以特殊处理。

如何实现恢复的过程中过滤某些集合

有些集合是不需要进行恢复的,包括system.profile、索引以及不满足用户指定的filter条件的集合等。索引之所以不需要恢复是因为索引是统一通过集合的元数据文件中的描述在集合数据恢复完毕后进行重建的。对于这些不需要恢复的集合,对应的DemuxOut接口的实现是MutedCollection。这个实现的Write()、Close()方法都不干任何事情。这样就实现了过滤恢复。

Restore_goroutines

多集合并发时的恢复优先级

如果在恢复的时候指定了多集合并发进行恢复,mongorestore会在恢复前初始化一个集合恢复优先级调度器。在非归档模式下,会使用一个MultiDatabaseLTF的优先级调度器。这个优先级调度器会在优先恢复大集合的同时兼顾不同数据库集合的并发恢复。在归档模式下,基本就是按照集合的数据在归档文件中的顺序进行恢复。在Demux协程发现一个新的需要恢复的常规集合后,会通过namespaceChan通知主协程,并由主协程转发给归档模式下的优先级调度器,在这里调用RegularCollectionReceiver的Open()方法进行相关初始化,以及注册对应的DemuxOut,建立Demux协程和Restore协程的数据流通通道。

目录
相关文章
|
安全 算法 网络协议
解析:HTTPS通过SSL/TLS证书加密的原理与逻辑
HTTPS通过SSL/TLS证书加密,结合对称与非对称加密及数字证书验证实现安全通信。首先,服务器发送含公钥的数字证书,客户端验证其合法性后生成随机数并用公钥加密发送给服务器,双方据此生成相同的对称密钥。后续通信使用对称加密确保高效性和安全性。同时,数字证书验证服务器身份,防止中间人攻击;哈希算法和数字签名确保数据完整性,防止篡改。整个流程保障了身份认证、数据加密和完整性保护。
|
机器学习/深度学习 算法 数据挖掘
解析静态代理IP改善游戏体验的原理
静态代理IP通过提高网络稳定性和降低延迟,优化游戏体验。具体表现在加快游戏网络速度、实时玩家数据分析、优化游戏设计、简化更新流程、维护网络稳定性、提高连接可靠性、支持地区特性及提升访问速度等方面,确保更流畅、高效的游戏体验。
418 22
解析静态代理IP改善游戏体验的原理
|
编解码 缓存 Prometheus
「ximagine」业余爱好者的非专业显示器测试流程规范,同时也是本账号输出内容的数据来源!如何测试显示器?荒岛整理总结出多种测试方法和注意事项,以及粗浅的原理解析!
本期内容为「ximagine」频道《显示器测试流程》的规范及标准,我们主要使用Calman、DisplayCAL、i1Profiler等软件及CA410、Spyder X、i1Pro 2等设备,是我们目前制作内容数据的重要来源,我们深知所做的仍是比较表面的活儿,和工程师、科研人员相比有着不小的差距,测试并不复杂,但是相当繁琐,收集整理测试无不花费大量时间精力,内容不完善或者有错误的地方,希望大佬指出我们好改进!
1460 16
「ximagine」业余爱好者的非专业显示器测试流程规范,同时也是本账号输出内容的数据来源!如何测试显示器?荒岛整理总结出多种测试方法和注意事项,以及粗浅的原理解析!
|
机器学习/深度学习 数据可视化 PyTorch
深入解析图神经网络注意力机制:数学原理与可视化实现
本文深入解析了图神经网络(GNNs)中自注意力机制的内部运作原理,通过可视化和数学推导揭示其工作机制。文章采用“位置-转移图”概念框架,并使用NumPy实现代码示例,逐步拆解自注意力层的计算过程。文中详细展示了从节点特征矩阵、邻接矩阵到生成注意力权重的具体步骤,并通过四个类(GAL1至GAL4)模拟了整个计算流程。最终,结合实际PyTorch Geometric库中的代码,对比分析了核心逻辑,为理解GNN自注意力机制提供了清晰的学习路径。
1009 7
深入解析图神经网络注意力机制:数学原理与可视化实现
|
机器学习/深度学习 缓存 自然语言处理
深入解析Tiktokenizer:大语言模型中核心分词技术的原理与架构
Tiktokenizer 是一款现代分词工具,旨在高效、智能地将文本转换为机器可处理的离散单元(token)。它不仅超越了传统的空格分割和正则表达式匹配方法,还结合了上下文感知能力,适应复杂语言结构。Tiktokenizer 的核心特性包括自适应 token 分割、高效编码能力和出色的可扩展性,使其适用于从聊天机器人到大规模文本分析等多种应用场景。通过模块化设计,Tiktokenizer 确保了代码的可重用性和维护性,并在分词精度、处理效率和灵活性方面表现出色。此外,它支持多语言处理、表情符号识别和领域特定文本处理,能够应对各种复杂的文本输入需求。
1706 6
深入解析Tiktokenizer:大语言模型中核心分词技术的原理与架构
|
数据可视化 算法 数据挖掘
用傅里叶变换解码时间序列:从频域视角解析季节性模式
本文介绍了如何使用傅里叶变换和周期图分析来识别时间序列中的季节性模式,特别是在能源消耗数据中。通过Python实现傅里叶变换和周期图,可以有效提取并量化时间序列中的主要和次要频率成分,克服传统可视化分析的局限性。这对于准确捕捉时间序列中的季节性变化具有重要意义。文章以AEP能源消耗数据为例,展示了如何应用这些方法识别日、周、半年等周期模式。
796 3
用傅里叶变换解码时间序列:从频域视角解析季节性模式
|
传感器 人工智能 监控
反向寻车系统怎么做?基本原理与系统组成解析
本文通过反向寻车系统的核心组成部分与技术分析,阐述反向寻车系统的工作原理,适用于适用于商场停车场、医院停车场及火车站停车场等。如需获取智慧停车场反向寻车技术方案前往文章最下方获取,如有项目合作及技术交流欢迎私信作者。
1166 2
|
Java 数据库 开发者
详细介绍SpringBoot启动流程及配置类解析原理
通过对 Spring Boot 启动流程及配置类解析原理的深入分析,我们可以看到 Spring Boot 在启动时的灵活性和可扩展性。理解这些机制不仅有助于开发者更好地使用 Spring Boot 进行应用开发,还能够在面对问题时,迅速定位和解决问题。希望本文能为您在 Spring Boot 开发过程中提供有效的指导和帮助。
2506 12
|
开发框架 监控 JavaScript
解锁鸿蒙装饰器:应用、原理与优势全解析
ArkTS提供了多维度的状态管理机制。在UI开发框架中,与UI相关联的数据可以在组件内使用,也可以在不同组件层级间传递,比如父子组件之间、爷孙组件之间,还可以在应用全局范围内传递或跨设备传递。
539 2
|
数据采集 Web App开发 存储
深度解析:使用 Headless 模式 ChromeDriver 进行无界面浏览器操作
本文介绍了基于无界面浏览器(如ChromeDriver)和代理IP技术的现代爬虫解决方案,以应对传统爬虫面临的反爬机制和动态加载内容等问题。通过Selenium驱动ChromeDriver,并结合亿牛云爬虫代理、自定义Cookie和User-Agent设置,实现高效的数据采集。代码示例展示了如何配置ChromeDriver、处理代理认证、添加Cookie及捕获异常,确保爬虫稳定运行。性能对比显示,Headless模式下的ChromeDriver在数据采集成功率、响应时间和反爬规避能力上显著优于传统爬虫。该方案广泛应用于电商、金融和新闻媒体等行业。
869 0
深度解析:使用 Headless 模式 ChromeDriver 进行无界面浏览器操作

热门文章

最新文章

推荐镜像

更多
  • DNS