【DB吐槽大】第72期 - PG wal 联网协议不够发达

简介: 大家好,这里是DB吐槽大会,第72期 - PG wal 联网协议不够发达

背景


1、产品的问题点

  • PG wal 联网协议不够发达

2、问题点背后涉及的技术原理

  • 一个PG 集群有主实例、通过wal流复制建立的一个或多个从实例、从实例还可以集联形成多级从库.
  • 集群拓扑是有根节点的树状数据流结构.
  • 从节点的需要用于replay的WAL数据可以从哪里索取呢?
  • 配置好的上游节点, 上游从pg_wal目录读出来, 发送给下游
  • 自己的pg_wal目录中查找
  • 使用restore_command获取已归档的文件, 这个命令配置在自己的节点中, 通过shell命令获取. 传入参数中最重要的是所需的wal文件名.
  • 在这个集群中, 不同的节点可能部署在不同的主机上, 用于存储WAL的归档的设备, 可能只能被某些节点访问(通常归档由主节点产生, 并copy到归档设备中).
  • 对于已归档的wal文件, 并且是最近一个已完成的检查点之前的, 并且不在wal_keep_size保护范围内, 这样的wal文件可能被删除. 然而下游节点可能因为各种原因还没有及时接收到这样的WAL文件. 那下游节点怎么办? 只能使用restore_command获取已归档的文件, 但是前面说了, 可能只有主节点有归档目录的权限, 怎么办? 重建从库?
  • 核心问题是什么? 上游节点不能代替下游节点使用restore_command, 然后再将wal发送给下游节点.

3、这个问题将影响哪些行业以及业务场景

  • 主从、流复制从库通用问题

4、会导致什么问题?

  • 如果上游节点wal已被清楚, 而且下游节点没有权限获取归档目录中的wal文件, 那么将需要人工介入, 或者重建从库.

5、业务上应该如何避免这个坑

  • 人工介入, 拷贝已清理的wal文件
  • 共享wal归档, 使用restore_command从归档文件中获取已从pg_wal目录清理的wal文件.

6、业务上避免这个坑牺牲了什么, 会引入什么新的问题

  • 复杂度增加

7、数据库未来产品迭代如何修复这个坑

  • 希望内核层面可以支持peer 节点之间、上游与下游之间能够通过流复制协议互相发送wal文件.
  • 上游可以通过restore_command获取已清理的wal文件并发送给下游.
  • 如果是集群拓扑的其他平级节点或分叉节点来发, 可以通过peer约束判定wal文件的正确性.
  • system_id 相同, 表示这是同一个集群
  • timeline + LSN 匹配, 表示这是我需要的wal内容.
  • 扩展诉求: 实际上集群拓扑的监控等信息都可以更强的联动. 实现更有集群意义的dashboard, 甚至与client driver进行联动, 实现更无缝的HA, 负载均衡等.



相关文章
|
6天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1910 6
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
4天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
640 110
|
14天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2526 13
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
14天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
1383 2
|
12天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
1347 2
|
16天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
1432 54
|
12天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
676 2