SQL 语句不要过多的 join

简介: SQL 语句不要过多的 join

送分题

 

面试官:有操作过Linux吗?

 

我:有的呀

 

面试官:我想查看内存的使用情况该用什么命令

 

我:free 或者 top

 

面试官:那你说一下用free命令都可以看到啥信息

 

我:那,如下图所示 可以看到内存以及缓存的使用情况

 

  • total 总内存
  • used 已用内存
  • free 空闲内存
  • buff/cache 已使用的缓存
  • avaiable 可用内存

 

 

 

面试官:那你知道怎么清理已使用的缓存吗(buff/cache)

 

我:em... 不知道

 

面试官:sync; echo 3 > /proc/sys/vm/drop_caches就可以清理buff/cache了,你说说我在线上执行这条命令做好不好?

 

 

我:(送分题,内心大喜)好处大大的有,清理出缓存我们就有更多可用的内存空间, 就跟pc上面xx卫士的小火箭一样,点一下,就释放出好多的内存

 

面试官:em...., 回去等通知吧

 

再谈SQL Join

 

面试官:换个话题,谈谈你对join的理解

 

我:好的(再答错就彻底完了,把握住机会)

 

回顾

 

SQL中的join可以根据某些条件把指定的表给结合起来并将数据返回给客户端

 

join的方式有

 

  • inner join  内连接

 

 

 

 

  • left join 左连接

 

 

 

 

  • right join 右连接

 

 

 

 

  • full join 全连接

 

 

 

 

面试官:在项目开发中如果需要使用join语句,如何优化提升性能?

 

我:分为两种情况,数据规模小的,数据规模大的。

 

面试官:  然后?

 

我:对于

 

  • 数据规模较小 全部干进内存就完事了嗷
  • 数据规模较大

 

可以通过增加索引来优化join语句的执行速度 可以通过冗余信息来减少join的次数 尽量减少表连接的次数,一个SQL语句表连接的次数不要超过5次

 

面试官:可以总结为join语句是相对比较耗费性能,对吗?

 

我:是的

 

面试官: 为什么?

 

缓冲区

 

我: 在执行join语句的时候必然要有一个比较的过程

 

面试官: 是的

 

我:逐条比较两个表的语句是比较慢的,因此我们可以把两个表中数据依次读进一个内存块中, 以MySQL的InnoDB引擎为例,使用以下语句我们必然可以查到相关的内存区域show variables like '%buffer%'

 

 

如下图所示join_buffer_size的大小将会影响我们join语句的执行性能

面试官: 除此之外呢?

 

一个大前提

 

我:任何项目终究要上线,不可避免的要产生数据,数据的规模又不可能太小

 

面试官: 是这样的

 

我:大部分数据库中的数据最终要保存到硬盘上,并且以文件的形式进行存储。

 

以MySQL的InnoDB引擎为例

 

  • InnoDB以页(page)为基本的IO单位,每个页的大小为16KB
  • InnoDB会为每个表创建用于存储数据的.ibd文件

 

 

验证

 

 

我:这意味着我们有多少表要连接就需要读多少个文件,虽然可以利用索引,但还是免不了频繁的移动硬盘的磁头

 

面试官:也就是说频繁的移动磁头会影响性能对吧

 

我:是的,现在的开源框架不都喜欢说自己通过顺序读写大大的提升了性能吗,比如hbase、kafka

 

面试官:说的没错,那你认为Linux有对此做出优化吗?提示,你可以再执行一次free命令看一下

 

我:奇怪缓存怎么占用了1.2G多

 

 

 

图片来源这里

 

面试官: 你有没有想过

 

  • buff/cache 里面存的是什么,?
  • 为什么buff/cache 占了那么多内存,可用内存即availlable还有1.1G?
  • 为什么你可以通过两条命令来清理buff/cache占用的内存,而想要释放used只能通过结束进程来实现?

 

品,你细品

 

思考了几分钟后

 

 

我:这么随便就释放了buff/cache所占用的内存,说明它就不重要, 清除它不会对系统的运行造成影响

 

面试官: 不完全对

 

我:难道是?想起来《CSAPP》(深入理解计算机系统)里面说过一句话

 

存储器层次结构的本质是,每一层存储设备都是较低一层设备的缓存

 

 

翻译成人话,就是说Linux会把内存当作是硬盘的高速缓存

 

相关资料 tldp.org/LDP/sag/htm…

 

面试官:现在知道那道送分题应该怎么回答了吧

 

Join算法

 

面试官:再给你个机会,如果让你来实现Join算法你会怎么做?

 

我:无索引的话,嵌套循环就完事了嗷。有索引的话,则可以利用索引来提升性能.

 

面试官:说回join_buffer 你认为join_buffer里面存储的是什么?

 

我:在扫描过程中,数据库会选择一个表把他要返回以及需要进行和其他表进行比较的数据放进join_buffer

 

面试官:有索引的情况下是怎么处理的?

 

我:这个就比较简单了,直接读取两个表的索引树进行比较就完事了嗷,我这边介绍一下无索引的处理方式

 

Nested Loop Join

 

 

嵌套循环,每次只读取表中的一行数据,也就是说如果outerTable有10万行数据, innerTable有100行数据,需要读取10000000次(假设这两个表的文件没有被操作系统给缓存到内存, 我们称之为冷数据表)

当然现在没啥数据库引擎使用这种算法(太慢了)

 

Block nested loop

 

 

Block 块,也就是说每次都会取一块数据到内存以减少I/O的开销

当没有索引可以使用的时候,MySQL InnoDB 就会使用这种算法

考虑以下两个表 t_a 和t_b

 

 

当无法使用索引执行join操作的时候,InnoDB会自动使用Block

nested loop 算法

 

 

总结

 

上学时,数据库老师最喜欢考数据库范式,直到上班才学会一切以性能为准,能冗余就冗余,实在冗余不了的就join如果join真的影响到性能。试着调大你的join_buffer_size, 或者换固态硬盘。

相关文章
|
2月前
|
SQL
SQL JOIN
【11月更文挑战第06天】
48 4
|
7月前
|
SQL 关系型数据库 MySQL
SQL FULL OUTER JOIN 关键字
SQL FULL OUTER JOIN 关键字
58 2
|
3月前
|
SQL 关系型数据库 MySQL
图解 SQL 里的各种 JOIN
用文氏图表示 SQL 里的各种 JOIN,一下子就理解了。
52 2
|
3月前
|
SQL 分布式计算 Java
Hadoop-11-MapReduce JOIN 操作的Java实现 Driver Mapper Reducer具体实现逻辑 模拟SQL进行联表操作
Hadoop-11-MapReduce JOIN 操作的Java实现 Driver Mapper Reducer具体实现逻辑 模拟SQL进行联表操作
55 3
|
5月前
|
Java 网络架构 数据格式
Struts 2 携手 RESTful:颠覆传统,重塑Web服务新纪元的史诗级组合!
【8月更文挑战第31天】《Struts 2 与 RESTful 设计:构建现代 Web 服务》介绍如何结合 Struts 2 框架与 RESTful 设计理念,构建高效、可扩展的 Web 服务。Struts 2 的 REST 插件提供简洁的 API 和约定,使开发者能快速创建符合 REST 规范的服务接口。通过在 `struts.xml` 中配置 `<rest>` 命名空间并使用注解如 `@Action`、`@GET` 等,可轻松定义服务路径及 HTTP 方法。
70 0
|
5月前
|
SQL 存储 数据挖掘
"SQL JOIN大揭秘:解锁多表联合查询的终极奥义,从内到外,左至右,全连接让你数据世界畅通无阻!"
【8月更文挑战第31天】在数据库领域,数据常分散在多个表中,而SQL JOIN操作如同桥梁,连接这些孤岛,使数据自由流动,编织成复杂的信息网络。本文通过对比内连接、左连接、右连接和全连接的不同类型,并结合示例代码,展示SQL JOIN的强大功能。掌握JOIN技术不仅能高效查询数据,更是数据分析和数据库管理的关键技能。
134 0
|
6月前
|
JSON 数据格式 SQL
SQL开发问题之直接使用join方法在处理字符串类型属性时可能会遇到性能问题如何解决
SQL开发问题之直接使用join方法在处理字符串类型属性时可能会遇到性能问题如何解决
|
6月前
|
SQL
SQL FULL OUTER JOIN 关键字
【7月更文挑战第17天】SQL FULL OUTER JOIN 关键字。
48 6
|
6月前
|
SQL
SQL INNER JOIN 关键字
【7月更文挑战第17天】SQL INNER JOIN 关键字。
47 5
|
6月前
|
SQL 数据库
SQL LEFT JOIN 关键字
【7月更文挑战第17天】SQL LEFT JOIN 关键字。
43 4