【DB吐槽大会】第77期 - PG 不支持索引随机采样

简介: 大家好,这里是DB吐槽大会,第77期 - PG 不支持索引随机采样

背景


1、产品的问题点

  • PG 不支持索引随机采样

2、问题点背后涉及的技术原理

  • 随机采样扫描用于返回随机数据. PG内置了表的随机采样方法, 例如按数据块随机采样、按记录随机采样.
  • 但是无法采用固定扫描方法进行随机采样, 例如有where条件的SQL, 符合条件的有10万条, 但是期望随机返回100条. 目前的方法是取得10万条后随机排序返回, 或者给定一个随机数返回.
  • select * from x where xxx order by random() limit x; 机会公平, 但是需要扫描所有符合条件的记录, 同时增加了排序成本
  • select * from x where xxx and random() < xx limit x; 跳过不满足条件的行, 但是这种方法的机会不公平, 很容易导致无法获取到索引扫描末尾符合条件的行.
  • 以上都会导致过度计算, 目前PG无法在索引扫描方法上根据符合条件的index block再随机扫描

3、这个问题将影响哪些行业以及业务场景

  • 通常被用于推荐系统, 在满足条件的记录范围内进行随机推荐.

4、会导致什么问题?

  • 导致过度计算

5、业务上应该如何避免这个坑

6、业务上避免这个坑牺牲了什么, 会引入什么新的问题

  • 需要非常专业的知识

7、数据库未来产品迭代如何修复这个坑

  • 希望内核支持 index scan sample method , 对应table sample, 这个是索引扫描的随机采样功能.
  • 例如在branch层随机选择leaf page.



相关文章
|
6月前
|
SQL 关系型数据库 分布式数据库
深度解析PolarDB数据库并行查询技术
深度解析PolarDB数据库并行查询技术:加速SQL执行的关键问题和核心技术 随着数据规模的不断扩大,用户SQL的执行时间越来越长,这不仅对数据库的优化能力提出更高的要求,并且对数据库的执行模式也提出了新的挑战。为了解决这个问题,许多数据库系统,包括Oracle、SQL Server等,都开始提供并行查询引擎的支持,以充分利用系统资源,达到加速SQL执行的效果。本文将深入探讨基于代价进行并行优化、并行执行的云数据库的并行查询引擎的关键问题和核心技术。
228 2
|
SQL 关系型数据库 数据库
【DB吐槽大会】第75期 - PG 不支持索引失效功能
大家好,这里是DB吐槽大会,第75期 - PG 不支持索引失效功能
|
JSON 固态存储 关系型数据库
【DB吐槽大会】第43期 - PG 倒排索引启动和recheck代价高
大家好,这里是DB吐槽大会,第43期 - PG 倒排索引启动和recheck代价高
|
机器学习/深度学习 SQL 算法
【DB吐槽大会】第58期 - PG 复杂JOIN优化器有巨大提升空间
大家好,这里是DB吐槽大会,第58期 - PG 复杂JOIN优化器有巨大提升空间
|
关系型数据库 数据库 索引
【DB吐槽大会】第32期 - PG 没有全局索引
大家好,这里是DB吐槽大会,第32期 - PG 没有全局索引
|
SQL 关系型数据库 数据库
【DB吐槽大会】第73期 - PG 统计信息无法迁移
大家好,这里是DB吐槽大会,第73期 - PG 统计信息无法迁移
|
存储 SQL 缓存
【DB吐槽大会】第45期 - PG 不支持rotate表
大家好,这里是DB吐槽大会,第45期 - PG 不支持rotate表
|
关系型数据库 定位技术 数据库
【DB吐槽大会】第50期 - PG GiST距离排序操作符和过滤无法同时使用索引
大家好,这里是DB吐槽大会,第50期 - PG GiST距离排序操作符和过滤无法同时使用索引
|
关系型数据库 物联网 数据库
【DB吐槽大会】第28期 - PG 每次只扩展1个block
大家好,这里是DB吐槽大会,第28期 - PG 每次只扩展1个block
|
存储 JSON 搜索推荐
【DB吐槽大会】第35期 - “富人”的烦恼?PG 不会自动选择索引类型
大家好,这里是DB吐槽大会,第35期 - “富人”的烦恼?PG 不会自动选择索引类型