【DB吐槽大会】第77期 - PG 不支持索引随机采样

简介: 大家好,这里是DB吐槽大会,第77期 - PG 不支持索引随机采样

背景


1、产品的问题点

  • PG 不支持索引随机采样

2、问题点背后涉及的技术原理

  • 随机采样扫描用于返回随机数据. PG内置了表的随机采样方法, 例如按数据块随机采样、按记录随机采样.
  • 但是无法采用固定扫描方法进行随机采样, 例如有where条件的SQL, 符合条件的有10万条, 但是期望随机返回100条. 目前的方法是取得10万条后随机排序返回, 或者给定一个随机数返回.
  • select * from x where xxx order by random() limit x; 机会公平, 但是需要扫描所有符合条件的记录, 同时增加了排序成本
  • select * from x where xxx and random() < xx limit x; 跳过不满足条件的行, 但是这种方法的机会不公平, 很容易导致无法获取到索引扫描末尾符合条件的行.
  • 以上都会导致过度计算, 目前PG无法在索引扫描方法上根据符合条件的index block再随机扫描

3、这个问题将影响哪些行业以及业务场景

  • 通常被用于推荐系统, 在满足条件的记录范围内进行随机推荐.

4、会导致什么问题?

  • 导致过度计算

5、业务上应该如何避免这个坑

6、业务上避免这个坑牺牲了什么, 会引入什么新的问题

  • 需要非常专业的知识

7、数据库未来产品迭代如何修复这个坑

  • 希望内核支持 index scan sample method , 对应table sample, 这个是索引扫描的随机采样功能.
  • 例如在branch层随机选择leaf page.



相关文章
|
芯片 异构计算
【FPGA】高云FPGA之数字钟实验->HC595驱动数码管(一)
【FPGA】高云FPGA之数字钟实验->HC595驱动数码管
597 2
|
Java
异步技巧之CompletableFuture
异步技巧之CompletableFuture
141 2
|
弹性计算 运维 数据安全/隐私保护
3分钟部署 幻兽帕鲁(Palworld) 联机服务
幻兽帕鲁最近在游戏圈非常火,最高在线人数已逼近200万。官方服务器亚历山大,游戏开发商也提供了搭建私人专用服务器的方案,既可以保证稳定的游戏体验,也可以和朋友一起联机游戏,而且还能自定义经验翻倍等游戏里的一些选项。
3分钟部署 幻兽帕鲁(Palworld) 联机服务
|
Python Windows
xlrd库报错【AttributeError: ‘ElementTree‘ object has no attribute ‘getiterator‘】
xlrd库报错【AttributeError: ‘ElementTree‘ object has no attribute ‘getiterator‘】
528 0
|
Java 编译器 Go
经验大分享:SCJP之赋值
经验大分享:SCJP之赋值
89 0
|
Java API 开发工具
Jetpack 之 LifeCycle 组件使用详解
LifeCycle 是一个可以感知宿主生命周期变化的组件。常见的宿主包括 Activity/Fragment、Service 和 Application。LifeCycle 会持有宿主的生命周期状态的信息,当宿主生命周期发生变化时,会通知监听宿主的观察者。
302 0
Jetpack 之 LifeCycle 组件使用详解
|
Oracle 关系型数据库 数据库
windows服务器下oracle数据库查看客户端安装位置,查看oracle数据库实例启用的端口号
windows服务器下oracle数据库查看客户端安装位置,查看oracle数据库实例启用的端口号
1120 0
windows服务器下oracle数据库查看客户端安装位置,查看oracle数据库实例启用的端口号
|
缓存
ListView 的 Adapter 适配器模板
Adapter优化.png ListView中的Adapter优化的通用模板。 如果发现对ListView优化工作做完后,还会卡顿,可以检查notifyDataSetChanged()方法是否运用合理,频繁的调用此方法也会引发卡顿。
941 0