【DBMS 数据库管理系统】数据仓库 数据组织 ( 数据组织级别 | 元数据 | 粒度 | 分割 | 数据组织形式 )(二)

简介: 【DBMS 数据库管理系统】数据仓库 数据组织 ( 数据组织级别 | 元数据 | 粒度 | 分割 | 数据组织形式 )(二)

五、分割


分割 : 将 完整的数据集 分散到 各自的物理单元 中去 , 以便能 分别独立处理 ;


分割结果 : 数据 分割后的 数据单元 , 称为 分片 ;

分割目的 : 提高效率 ;

分割作用 : 分析 相关性 数据集合 , 将 具有相关性 的数据 组织到一起分析 , 提高分析效率 ;


分割标准 :


方便进行如下操作 : 重构 , 索引 , 重组 , 恢复 , 监控 , 扫描 ;

业务领域

日期

地域

多个分割标准组合


"分割" 示例 : 对 保险行业数据 进行分割 ;


总的数据集 : 3 33 年的 车险 , 寿险 , 健康险 , 财产险 , 意外险 数据 ;

分割标准 : 按照 “时间” , 和 “险种” , 进行分割 ;

分片详情 : 分片个数为 3 × 5 = 15 3 \times 5 = 153×5=15 个数据分片 ;

时间 车险 寿险 健康险 财产险 意外险

2020 20202020 年 分片 1 11 分片 2 22 分片 3 33 分片 4 44 分片 5 55

2019 20192019 年 分片 6 66 分片 7 77 分片 8 88 分片 9 99 分片 10 1010

2018 20182018 年 分片 11 1111 分片 12 1212 分片 13 1313 分片 14 1414 分片 15 1515


数据分片使用方式 :


处理单独数据分片 : 如果只分析 2019 20192019 年的车险数据 , 只需要分析 分片 6 66 中的数据即可 , 每个分片的数据都可以独立处理 ;


合并若干数据分片 : 如果分析 2020 20202020 年的健康险 和 意外险 数据 , 那么需要 将 分片 2 22 和 分片 5 55 合并起来 , 进行分析 ;






六、数据仓库组织形式


数据仓库组织形式 :


简单堆积文件

轮转综合文件

简化直接文件

连续文件


简单堆积文件 :


概念 : 将数据库中 提取加工 的数据 , 直接积累存储 ;

操作 : 来一个存放一个 , 按照时间先后顺序存放 , 堆积 ;


轮转综合文件 :


概念 : 将 数据的存储单位 , 分成 若干级别 , 每个级别有有限个指定的数据 ;

数据形式 : 一定时间段的综合数据 , 称为 轮转记录 ;

优点 : 结构简单 , 数据量比 “简单堆积文件” 少 ;

缺点 : 综合数据 , 会损失数据细节 , 越久远的历史数据 , 数据细节损失的越多 ;

操作 : 够一个时间段 , 就将指定长度的数据综合在一起 ; 每次综合都会损失一定的数据细节 ;

示例 : 如果数据积累够 1 天 , 直接综合成一天的数据 ; 如果数据积累够 30 天 , 直接综合成一个月的数据 ; 如果数据积累够 12 个月 , 直接综合成一年的数据 , 小时的数据不超过 24 个 , 天的数据不超过 30 个 , 月的数据 不超过 12 个 ;


简化直接文件 :


概念 : 按照一定时间间隔 , 对数据库采样 ;

快照 : 每隔一定时间 , 做一个数据库快照 , 存储该快照 , 与 “简单堆积文件” 类似 ;

示例 : 周一对数据做一个快照 , 周二在做一个快照 , 每天都做一个数据库快照 , 存储下来 ;

缺点 : 浪费存储空间 ;


连续文件 : 在上述 “简化直接文件” 快照的基础之上 , 进行增量更新 , 只更新对比后的差异数据 ;


概念 : 两个连续简化的直接文件 , 对比两个文件的差异 , 生成连续文件 ;

连续文件 + 新的简单文件 = 新的连续文件


目录
相关文章
|
1月前
|
存储 监控 数据处理
flink 向doris 数据库写入数据时出现背压如何排查?
本文介绍了如何确定和解决Flink任务向Doris数据库写入数据时遇到的背压问题。首先通过Flink Web UI和性能指标监控识别背压,然后从Doris数据库性能、网络连接稳定性、Flink任务数据处理逻辑及资源配置等方面排查原因,并通过分析相关日志进一步定位问题。
170 61
|
3天前
|
前端开发 JavaScript 数据库
获取数据库中字段的数据作为下拉框选项
获取数据库中字段的数据作为下拉框选项
25 5
|
1月前
|
关系型数据库 MySQL 数据库
GBase 数据库如何像MYSQL一样存放多行数据
GBase 数据库如何像MYSQL一样存放多行数据
|
1月前
|
关系型数据库 分布式数据库 数据库
云栖大会|从数据到决策:AI时代数据库如何实现高效数据管理?
在2024云栖大会「海量数据的高效存储与管理」专场,阿里云瑶池讲师团携手AMD、FunPlus、太美医疗科技、中石化、平安科技以及小赢科技、迅雷集团的资深技术专家深入分享了阿里云在OLTP方向的最新技术进展和行业最佳实践。
|
4天前
|
存储 Oracle 关系型数据库
数据库传奇:MySQL创世之父的两千金My、Maria
《数据库传奇:MySQL创世之父的两千金My、Maria》介绍了MySQL的发展历程及其分支MariaDB。MySQL由Michael Widenius等人于1994年创建,现归Oracle所有,广泛应用于阿里巴巴、腾讯等企业。2009年,Widenius因担心Oracle收购影响MySQL的开源性,创建了MariaDB,提供额外功能和改进。维基百科、Google等已逐步替换为MariaDB,以确保更好的性能和社区支持。掌握MariaDB作为备用方案,对未来发展至关重要。
15 3
|
4天前
|
安全 关系型数据库 MySQL
MySQL崩溃保险箱:探秘Redo/Undo日志确保数据库安全无忧!
《MySQL崩溃保险箱:探秘Redo/Undo日志确保数据库安全无忧!》介绍了MySQL中的三种关键日志:二进制日志(Binary Log)、重做日志(Redo Log)和撤销日志(Undo Log)。这些日志确保了数据库的ACID特性,即原子性、一致性、隔离性和持久性。Redo Log记录数据页的物理修改,保证事务持久性;Undo Log记录事务的逆操作,支持回滚和多版本并发控制(MVCC)。文章还详细对比了InnoDB和MyISAM存储引擎在事务支持、锁定机制、并发性等方面的差异,强调了InnoDB在高并发和事务处理中的优势。通过这些机制,MySQL能够在事务执行、崩溃和恢复过程中保持
20 3
|
4天前
|
SQL 关系型数据库 MySQL
数据库灾难应对:MySQL误删除数据的救赎之道,技巧get起来!之binlog
《数据库灾难应对:MySQL误删除数据的救赎之道,技巧get起来!之binlog》介绍了如何利用MySQL的二进制日志(Binlog)恢复误删除的数据。主要内容包括: 1. **启用二进制日志**:在`my.cnf`中配置`log-bin`并重启MySQL服务。 2. **查看二进制日志文件**:使用`SHOW VARIABLES LIKE 'log_%';`和`SHOW MASTER STATUS;`命令获取当前日志文件及位置。 3. **创建数据备份**:确保在恢复前已有备份,以防意外。 4. **导出二进制日志为SQL语句**:使用`mysqlbinlog`
25 2
|
17天前
|
关系型数据库 MySQL 数据库
Python处理数据库:MySQL与SQLite详解 | python小知识
本文详细介绍了如何使用Python操作MySQL和SQLite数据库,包括安装必要的库、连接数据库、执行增删改查等基本操作,适合初学者快速上手。
123 15
|
11天前
|
SQL 关系型数据库 MySQL
数据库数据恢复—Mysql数据库表记录丢失的数据恢复方案
Mysql数据库故障: Mysql数据库表记录丢失。 Mysql数据库故障表现: 1、Mysql数据库表中无任何数据或只有部分数据。 2、客户端无法查询到完整的信息。
|
18天前
|
关系型数据库 MySQL 数据库
数据库数据恢复—MYSQL数据库文件损坏的数据恢复案例
mysql数据库文件ibdata1、MYI、MYD损坏。 故障表现:1、数据库无法进行查询等操作;2、使用mysqlcheck和myisamchk无法修复数据库。