不可置信!SQL 优化终于干掉了“distinct”

本文涉及的产品
RDS MySQL Serverless 基础系列,0.5-2RCU 50GB
云数据库 RDS MySQL,集群系列 2核4GB
推荐场景:
搭建个人博客
RDS MySQL Serverless 高可用系列,价值2615元额度,1个月
简介: sql 优化之多表联合查询干掉 “distinct” 去重关键字在我提交了代码的时候,架构师给我指出我这个sql这样写会有问题。因为在分库分表的时候,是不支持子查询的。所以需要把多表的子查询的 sql 结构进行优化。是不是挺恐怖的;(此处为了脱敏,我把相关的 sql 关键词都给打码掉了)

网络异常,图片无法展示
|

sql 优化之多表联合查询干掉 “distinct” 去重关键字

在我提交了代码的时候,架构师给我指出我这个sql这样写会有问题。因为在分库分表的时候,是不支持子查询的。

所以需要把多表的子查询的 sql 结构进行优化。

是不是挺恐怖的;(此处为了脱敏,我把相关的 sql 关键词都给打码掉了)

网络异常,图片无法展示
|

这个 sql 的执行步骤如下: 1、查询出来 d 表中的某个 id 字段包含多个 id 值的所有的数据(因为此表是 1-n 的关系,所以需要去重,仅需要拿到不重复的 id 才可以继续下一个步骤);可以看到此步骤我把查询出来的多个值的结果给生成的了一个子表名为 sss;

2、下一个步骤就是需要进行排序(以时间进行倒序排序,因为要在前台进行按时间进行展示);

3、第 3 步就是把这些结果与 a 表进行合并,查询出来排序后的每个 id 的信息;然后进行分页处理;

其他的可以不必关心,最终要的是去重关键字(DISTINCT),拿小本本记号,一会要考哦。
实践是验证真理的唯一标准

例如有下表:

可以看到name和product_unit列的值都有可能是重复的。

mysql> SELECT t1.id,t1.name,t1.product_unit  FROM dd_product_category t1;
+
| id | name     | product_unit |
+
| 55 | 饮料     | 瓶           |
| 56 | 饮料     | 箱           |
| 57 | 零食     | 包           |
| 59 | 膨化食品 | 袋           |
| 60 | 方便食品 | 箱           |
| 61 | 自热火锅 | 碗           |
| 62 | 方便面   | 箱           |
| 63 | 矿泉水   | 箱           |
| 64 | 糖果     |              |
| 65 | 酒类     | 箱           |
| 66 | 烈酒     | 箱           |
| 67 | 啤酒     | 箱           |
| 68 | 预调酒   | 箱           |
+
13 rows in set (0.13 sec)
mysql> 
mysql>

如何我们想只拿到name或者product_unit列的值并且不想要重复的值该怎么办?

1、拿到单个值是好拿的,但是是存在重复的数据的,这些重复的数据我们只保留一个就可以了,那么该怎么做呢?

mysql> SELECT t1.product_unit  FROM dd_product_category t1;
+
| product_unit |
+
| 瓶           |
| 箱           |
| 包           |
| 袋           |
| 箱           |
| 碗           |
| 箱           |
| 箱           |
|              |
| 箱           |
| 箱           |
| 箱           |
| 箱           |
+
13 rows in set (19.31 sec)
mysql>

2、去除重复列

mysql> 
mysql> SELECT DISTINCT t1.product_unit  FROM dd_product_category t1;
+
| product_unit |
+
| 瓶           |
| 箱           |
| 包           |
| 袋           |
| 碗           |
|              |
+
6 rows in set (0.11 sec)
mysql>

是不是很简单,虽然看着简单,但是如果多表子查询的时候,就会出现问题,例如你想要查询表 a,b,c 三个表的数据,这三个表必然都是有关系的。

a 和 b 是 1-n 的关系。但是你只有 b 表中 id,你需要先查询出来 b 表的数据,然后利用 b 表的数据去查询 a 表的数据,然后再去查询 c 表的数据。

想必肯定是很绕的。

整个过程中你肯定是需要去重的

当整个 sql 写完,基本上跟我写的优化前的 sql 也就差不多了。(多表嵌套,多 sql 嵌套 sql,啦啦啦一大堆)。

优化思路还是有很多的,当时能想到的就是把这个复杂的 sql 拆分成多个简单的 sql 执行,然后使用 Java 后台代码进行处理。(对于不甘于现状的我,想找到一个比这个更友好的解决方案的我,我是不会屈服这个问题的。)

说到这里,先给大家放上一个链接:

  • 1、(Mysql5.7 官方手册中提及到的关于优化 distinct 的方法) dev.mysql.com/doc/refman/…
  • 2、还有一个优化 group by 的: dev.mysql.com/doc/refman/…

推荐大家阅读。

Mysql5.7 官方手册中提及到的关于优化 distinct 的方法,原文如下:

MySQL 5.7 Reference Manual / … / DISTINCT Optimization

8.2.1.16 DISTINCT Optimization

DISTINCT combined with ORDER BY needs a temporary table in many cases.

distinct 与 order by 结合的许多情况下需要建一个临时表;

Because DISTINCT may use GROUP BY, learn how MySQL works with columns in ORDER BY or HAVING clauses that are not part of the selected columns. See Section 12.20.3, “MySQL Handling of GROUP BY”.

因为distinct可能使用group by,了解MySQL如何处理按order by 列或者具有不属于所选列的子句。见12.20.3节, “MySQL Handling of GROUP BY”.

In most cases, a DISTINCT clause can be considered as a special case of GROUP BY. For example, the following two queries are equivalent:

在大多数情况下,一个不同的子句可以被认为是group by 的特殊情况。例如下面这两个查询是等价的:
SELECT DISTINCT c1, c2, c3 FROM t1
WHERE c1 > const;
SELECT c1, c2, c3 FROM t1
WHERE c1 > const GROUP BY c1, c2, c3;

Due to this equivalence, the optimizations applicable to GROUP BY queries can be also applied to queries with a DISTINCT clause. Thus, for more details on the optimization possibilities for DISTINCT queries, see Section 8.2.1.15, “GROUP BY Optimization”.

由于这种等价性,适用于group by查询的优化,也可以应用于具有不同子句的查询。因此,关于distinct的查询优化的更多细节可以参考Section 8.2.1.15, “GROUP BY Optimization”.

When combining LIMIT row_count with DISTINCT, MySQL stops as soon as it finds row_count unique rows.

当 row_count 与 distinct 一起使用时,MySQL 一旦发现 row_count 是唯一的行,就会停止。

If you do not use columns from all tables named in a query, MySQL stops scanning any unused tables as soon as it finds the first match. In the following case, assuming that t1 is used before t2 (which you can check with EXPLAIN), MySQL stops reading from t2 (for any particular row in t1) when it finds the first row in t2:

如果在查询中不适用来自所有表的列,MySQL 一旦找到第一个匹配项就会停止扫描任何未使用的表。

在下面的例子中,假设 t1 在 t2 之前使用(你可以使用 explanin 来检查),MySQL 在找到 t2 的第一行时停止从 t2 读取(对于 t1 中的任何特定行)。

SELECT DISTINCT t1.a FROM t1, t2 where t1.a=t2.a;

官方的手册中写到的,真是句句扣心呀!!!

总结有以下比较重要的几点:

  • 1、distinct 与 group by 几乎等价;
  • 2、distinct 的相关优化与 group by 的查询优化方法是等价的;

我们抱着试试看的态度,去做个试验。

就以下列这个效果为最终目的好了:

mysql> 
mysql> SELECT DISTINCT t1.product_unit  FROM dd_product_category t1;
+
| product_unit |
+
| 瓶           |
| 箱           |
| 包           |
| 袋           |
| 碗           |
|              |
+
6 rows in set (0.11 sec)
mysql>

使用 group by 去重:

mysql> select  t1.product_unit from dd_product_category t1 group by t1.product_unit;
+
| product_unit |
+
|              |
| 包           |
| 瓶           |
| 碗           |
| 箱           |
| 袋           |
+
6 rows in set (19.46 sec)
mysql>
可以看到,最终拿到的数据是一模一样的。
那么我们试验是成功的,distinct的效果和group by的效果是一样的。
那么我们优化distinct就变向的去优化group by了(我优化前的sql并未使用group by所以谈不上优化group by,只能说是把distinct的复杂sql改造成group by 的sql)。

打开我前面提到的这个优化 group by 的官方手册: dev.mysql.com/doc/refman/…

由于原文比较长,这里就不在过多赘述。

现在需要做的就是把 distinct 改造成 group by 的 sql 语法的写法。

怎么样,改造后的 sql,是不是还挺清爽的。

1、我们扔掉了多个嵌套sql;

2、也不用去生成一个sss的临时表了

网络异常,图片无法展示
|

对于本人而言学到了:

  • 1、distinct 与 group by 几乎等价;
  • 2、distinct 的相关优化与 group by 的查询优化方法是等价的;
  • 3、如果 distinct 的不能让 sql 最优化,那么可以尝试着使用 group by 的方式去改造一下。
  • 本文就是愿天堂没有BUG给大家分享的内容,大家有收获的话可以分享下,想学习更多的话可以到微信公众号里找我,我等你哦。
相关实践学习
如何在云端创建MySQL数据库
开始实验后,系统会自动创建一台自建MySQL的 源数据库 ECS 实例和一台 目标数据库 RDS。
全面了解阿里云能为你做什么
阿里云在全球各地部署高效节能的绿色数据中心,利用清洁计算为万物互联的新世界提供源源不断的能源动力,目前开服的区域包括中国(华北、华东、华南、香港)、新加坡、美国(美东、美西)、欧洲、中东、澳大利亚、日本。目前阿里云的产品涵盖弹性计算、数据库、存储与CDN、分析与搜索、云通信、网络、管理与监控、应用服务、互联网中间件、移动服务、视频服务等。通过本课程,来了解阿里云能够为你的业务带来哪些帮助     相关的阿里云产品:云服务器ECS 云服务器 ECS(Elastic Compute Service)是一种弹性可伸缩的计算服务,助您降低 IT 成本,提升运维效率,使您更专注于核心业务创新。产品详情: https://www.aliyun.com/product/ecs
相关文章
|
1月前
|
SQL 存储 关系型数据库
如何巧用索引优化SQL语句性能?
本文从索引角度探讨了如何优化MySQL中的SQL语句性能。首先介绍了如何通过查看执行时间和执行计划定位慢SQL,并详细解析了EXPLAIN命令的各个字段含义。接着讲解了索引优化的关键点,包括聚簇索引、索引覆盖、联合索引及最左前缀原则等。最后,通过具体示例展示了索引如何提升查询速度,并提供了三层B+树的存储容量计算方法。通过这些技巧,可以帮助开发者有效提升数据库查询效率。
69 2
|
6天前
|
SQL 存储 缓存
如何优化SQL查询性能?
【10月更文挑战第28天】如何优化SQL查询性能?
33 10
|
5天前
|
SQL 存储 缓存
SQL Server 数据太多如何优化
11种优化方案供你参考,优化 SQL Server 数据库性能得从多个方面着手,包括硬件配置、数据库结构、查询优化、索引管理、分区分表、并行处理等。通过合理的索引、查询优化、数据分区等技术,可以在数据量增大时保持较好的性能。同时,定期进行数据库维护和清理,保证数据库高效运行。
|
19天前
|
SQL 资源调度 分布式计算
如何让SQL跑快一点?(优化指南)
这篇文章主要探讨了如何在阿里云MaxCompute(原ODPS)平台上对SQL任务进行优化,特别是针对大数据处理和分析场景下的性能优化。
|
27天前
|
SQL 监控 数据库
慢SQL对数据库写入性能的影响及优化技巧
在数据库管理系统中,慢SQL(即执行缓慢的SQL语句)不仅会影响查询性能,还可能对数据库的写入性能产生显著的不利影响
|
30天前
|
SQL 关系型数据库 PostgreSQL
遇到SQL 子查询性能很差?其实可以这样优化
遇到SQL 子查询性能很差?其实可以这样优化
74 2
|
27天前
|
SQL 存储 数据库
慢SQL对数据库写入性能的影响及优化技巧
在数据库管理系统中,慢SQL(即执行缓慢的SQL语句)不仅会影响查询性能,还可能对数据库的写入性能产生显著的不利影响
|
1月前
|
SQL 数据处理 数据库
SQL语句优化与查询结果优化:提升数据库性能的实战技巧
在数据库管理和应用中,SQL语句的编写和查询结果的优化是提升数据库性能的关键环节
|
1月前
|
SQL 存储 数据库
慢SQL对数据库写入性能的影响及优化策略
在数据库管理系统中,慢SQL(即执行缓慢的SQL语句)不仅会影响查询性能,还可能对数据库的写入性能产生不利影响
|
3月前
|
Java XML Maven
跨越时代的飞跃:Struts 2 升级秘籍——从旧版本无缝迁移到最新版,焕发应用新生!
【8月更文挑战第31天】随着软件技术的发展,Struts 2 框架也在不断更新。本文通过具体案例指导开发者如何从旧版平滑升级到 Struts 2.6.x。首先更新 `pom.xml` 中的依赖版本,并执行 `mvn clean install`。接着检查 `struts.xml` 配置,确保符合新版本要求,调整包扫描器等设置。审查 Action 类及其注解,检查配置文件中的弃用项及插件。更新自定义拦截器实现,并验证日志配置。最后,通过一系列测试确保升级后的系统正常运行。通过这些步骤,可以顺利完成 Struts 2 的版本升级,提升应用的安全性和性能。
187 0