mysql多库表关联问题症结

本文涉及的产品
云数据库 RDS MySQL,集群系列 2核4GB
推荐场景:
搭建个人博客
RDS MySQL Serverless 基础系列,0.5-2RCU 50GB
云数据库 RDS PostgreSQL,集群系列 2核4GB
简介: 0、题记项目中使用mysql作为数据存储,需要定期将库表中的数据按照给定格式生成报表。根据导出周期的不同分为:日报、周报、月报、季报、年报等格式。

导出的整个逻辑我来负责编写,前期的日报、周报导出都没有问题。

但是,四月初统计上个月的月报的时候,发现到处全部的数据需要花费超过12个小时的时间。

10几分钟的到处已然让人无法接受了,12个小时简直要了人命!

本文基于导出时间长的问题,说下数据库表的设计和多表关联需要注意的事情!


一、当前库表的情况

1、导出给定格式的表数据分散到十几张表中;

2、导出渠道也分为:搜索、微博、微信、论坛等近10种格式。

3、核心业务数据分散在5张表中,其中4张表平均月数据量5万条+,另一张关联表的数据量10万条+。

4、另五张表示配置相关的数据,如:渠道名称、主题名称、关键词名称等。


二、导出格式的要求

1、每个渠道有各自的导出模板;

2、每个模板不同,模板中的字段分散在近十张表中。


三、为什么需要那么多库表的关联?

1、导出的数据往往是关键的数据,小而精;而创建的库表往往是基础数据,大而全。

2、一类库表是基础配置信息;另一类库表是结果存储信息。结果信息表中的部分字段取自基础配置信息表。于是,便产生了表之间的关联。


四、导出时间长的根本原因是什么?

经过近2天排查,耗时的是微信导出渠道中的处理结果表中的处置标记1和处置标记2字段。这两个字段涉及到和另外两个表的关联。

处理结果表中已经入库了处置结果标记1和处置结果标记2的ID。

排查发现,如果去掉这三张表的关联,导出是分钟级的;而如果加上,导出则是小时级别的。

那两个关联表涉及的数据有多少呢?

根因1——处置标记1:涉及10X5W=50W数量级的关联;处置标记2:涉及50X5W=250W数量级的关联;

慢就慢在处置标记2上。

根因2——处理结果表没有进行分区;主键不合理、没有建立外键。


五、库表关联注意点是什么?

1、设计表的时候,想的更长远一些。

比如:关联表中如果存储配置表中的相关ID,导出需要名称的话就需要字段的关联;相反,如果直接存储名称的话,则少了一层遍历或关联操作。


2、设立主键、外键。

3、尽可能的设立表分区存储结构。

这个在创立表的时候就应该想到,因为,后续的修改可能会有错误提示。

以下是以月为分区修改的表结构:


ALTER TABLE store_rst

PARTITION BY RANGE COLUMNS (update_time)

(

 PARTITION p201612 VALUES LESS THAN ('2016-12-01'),

 PARTITION p201701 VALUES LESS THAN ('2017-01-01'),

 PARTITION p201702 VALUES LESS THAN ('2017-02-01'),

 PARTITION p201703 VALUES LESS THAN ('2017-03-01'),

 PARTITION p201704 VALUES LESS THAN ('2017-04-01'),

 PARTITION p201705 VALUES LESS THAN ('2017-05-01'),

 PARTITION p201706 VALUES LESS THAN ('2017-06-01'),

 PARTITION p201707 VALUES LESS THAN ('2017-07-01'),

 PARTITION p201708 VALUES LESS THAN ('2017-08-01'),

 PARTITION p201709 VALUES LESS THAN ('2017-09-01'),

 PARTITION p201710 VALUES LESS THAN ('2017-10-01'),

 PARTITION p201711 VALUES LESS THAN ('2017-11-01'),

 PARTITION p201712 VALUES LESS THAN ('2017-12-01'),

 PARTITION pMax VALUES LESS THAN (MAXVALUE));

1

2

3

4

5

6

7

8

9

10

11

12

13

14

15

16

17

4、多表关联一定是小表关联大表,能提高查询效率。

根本原因在于: 永远用小结果集驱动大记录集,因为在mysql中,只有Nested Join一种Join方式,就是说mysql的join是通过嵌套循环来实现的。通过小结果集驱动大记录集这个原则来减少嵌套循环的循环次数,以减少IO总量及CPU运算次数。(from腾讯)


六、小结

1、问题的根源还在于库表的设计,这点以后的开发中一定要注意,否则可能导致需要2-3天甚至更多的时间来排查一个本来设计阶段就可以避免的Bug。

2、做好库表的设计,相当的工作积累必不可少。更重要的是扎实的基本功也不能落下。《高性能mysql》、《高可用mysql》有时间一定要好好研读(说给自己)。

3、(20170429)实践发现,如果对于多表关联建立了View视图,然后后续的操作对视图进行操作,可以实现的非常迅速的导入导出操作(这块知道的有点晚了)。


七、引申思考的几个问题?

1、多表关联如何根源避免?

2、如何设计表能最小化配置、最大化性能?

3、索引、主键、外键区别和联系?

4、如何优化mysql性能?

5、视图能解决多表关联问题,然后呢?

20170510 待思考总结。


参考:

https://www.qcloud.com/community/article/164816001481011831?fromSource=gwzcw.82729.82729.82729

相关实践学习
如何快速连接云数据库RDS MySQL
本场景介绍如何通过阿里云数据管理服务DMS快速连接云数据库RDS MySQL,然后进行数据表的CRUD操作。
全面了解阿里云能为你做什么
阿里云在全球各地部署高效节能的绿色数据中心,利用清洁计算为万物互联的新世界提供源源不断的能源动力,目前开服的区域包括中国(华北、华东、华南、香港)、新加坡、美国(美东、美西)、欧洲、中东、澳大利亚、日本。目前阿里云的产品涵盖弹性计算、数据库、存储与CDN、分析与搜索、云通信、网络、管理与监控、应用服务、互联网中间件、移动服务、视频服务等。通过本课程,来了解阿里云能够为你的业务带来哪些帮助     相关的阿里云产品:云服务器ECS 云服务器 ECS(Elastic Compute Service)是一种弹性可伸缩的计算服务,助您降低 IT 成本,提升运维效率,使您更专注于核心业务创新。产品详情: https://www.aliyun.com/product/ecs
相关文章
|
SQL 存储 开发框架
|
MySQL 数据库
mysql多库表关联问题症结
本文基于导出时间长的问题,说下数据库表的设计和多表关联需要注意的事情!
416 0
|
SQL 监控 关系型数据库
|
Oracle 关系型数据库 MySQL
使用外部表关联MySQL数据到Oracle
因为业务需要,有个临时的活动需要DBA来支持一些数据业务,问题来了,需要从MySQL端同步一部分数据到Oracle端,然后从Oracle端匹配查到相应的数据返回给MySQL,至于原因,也是不同的业务系统,不同的权限分配,还没法做到一个应用端去读取这些信息,而且也有安全的考虑,大体就是两部分的数据也是互相补充,但又彼此独立,是一个全集和子集的关系。
1203 0
|
4天前
|
缓存 关系型数据库 MySQL
【深入了解MySQL】优化查询性能与数据库设计的深度总结
本文详细介绍了MySQL查询优化和数据库设计技巧,涵盖基础优化、高级技巧及性能监控。
58 0
|
1月前
|
存储 Oracle 关系型数据库
数据库传奇:MySQL创世之父的两千金My、Maria
《数据库传奇:MySQL创世之父的两千金My、Maria》介绍了MySQL的发展历程及其分支MariaDB。MySQL由Michael Widenius等人于1994年创建,现归Oracle所有,广泛应用于阿里巴巴、腾讯等企业。2009年,Widenius因担心Oracle收购影响MySQL的开源性,创建了MariaDB,提供额外功能和改进。维基百科、Google等已逐步替换为MariaDB,以确保更好的性能和社区支持。掌握MariaDB作为备用方案,对未来发展至关重要。
61 3
|
1月前
|
安全 关系型数据库 MySQL
MySQL崩溃保险箱:探秘Redo/Undo日志确保数据库安全无忧!
《MySQL崩溃保险箱:探秘Redo/Undo日志确保数据库安全无忧!》介绍了MySQL中的三种关键日志:二进制日志(Binary Log)、重做日志(Redo Log)和撤销日志(Undo Log)。这些日志确保了数据库的ACID特性,即原子性、一致性、隔离性和持久性。Redo Log记录数据页的物理修改,保证事务持久性;Undo Log记录事务的逆操作,支持回滚和多版本并发控制(MVCC)。文章还详细对比了InnoDB和MyISAM存储引擎在事务支持、锁定机制、并发性等方面的差异,强调了InnoDB在高并发和事务处理中的优势。通过这些机制,MySQL能够在事务执行、崩溃和恢复过程中保持
79 3
|
1月前
|
SQL 关系型数据库 MySQL
数据库灾难应对:MySQL误删除数据的救赎之道,技巧get起来!之binlog
《数据库灾难应对:MySQL误删除数据的救赎之道,技巧get起来!之binlog》介绍了如何利用MySQL的二进制日志(Binlog)恢复误删除的数据。主要内容包括: 1. **启用二进制日志**:在`my.cnf`中配置`log-bin`并重启MySQL服务。 2. **查看二进制日志文件**:使用`SHOW VARIABLES LIKE 'log_%';`和`SHOW MASTER STATUS;`命令获取当前日志文件及位置。 3. **创建数据备份**:确保在恢复前已有备份,以防意外。 4. **导出二进制日志为SQL语句**:使用`mysqlbinlog`
94 2