三张图读懂Greenplum在企业的正确使用姿势

本文涉及的产品
RDS AI 助手,专业版
RDS MySQL DuckDB 分析主实例,集群系列 4核8GB
RDS MySQL DuckDB 分析主实例,基础系列 4核8GB
简介: 第一张 老外通常如何使用数据仓库 数据仓库的使用人员通常是数据分析师,一个成熟的分析模型的建立,可能需要多次的数据模型分析试错。 通常试错不会允许直接在任务库中执行,因为很容易干扰任务库的任务处理,你一定不想因为试错导致报表不能按时输出吧,相信老板会让你好看的。 因此老外通常会将数据

背景

很多使用数据仓库的朋友可能都有过这样的困惑,为什么数据仓库的资源经常会出现不可控,或者抢用的情况,严重的甚至影响正常的作业任务,导致不能按时输出报表或者分析结果。

这里的原因较多,最主要的原因可能还是使用姿势不对,MPP是用极资源的产品,一伙人在抢资源当然跑不好。你想想一个跑道能让多架飞机同时起飞或降落吗?

第一张

老外通常如何使用数据仓库

数据仓库的使用人员通常是数据分析师,一个成熟的分析模型的建立,可能需要多次的数据模型分析试错。

通常试错不会允许直接在任务库中执行,因为很容易干扰任务库的任务处理,你一定不想因为试错导致报表不能按时输出吧,相信老板会让你好看的。

因此老外通常会将数据仓库分为两种,一种是跑任务的大数仓,所有的数据都在大数仓里面。

分析人员使用的是独立的小型分析库,如果要试错的话,向DBA提交测试数据的ETL申请,拿到数据后进行分析建模,在多次数据模型分析试错后找到成熟的数据分析模型,再提交到大数仓去RUN 任务。

由于分析人员可能较多,不同的分析人员可能会有同一份数据的分析需求,所以这种模式造成了大量的重复试错数据。每个分析师都要问DBA要数据,也会很痛苦。
screenshot

第二张

LOFTD消灭重复试错数据

LOFTD是一个独立的具备处理predict, project filter请求的文件服务器。

将LOFTD作为一个外部的数据源,读写非常方便。

数据分析人员向DBA提交数据抽取请求,数据被抽取到LOFTD,小型分析库通过外部表的方式访问LOFTD。

并且LOFTD可以共享给多个小型分析库使用,所以消除了数据的冗余。
screenshot

第三张

阿里云的用户如何正确使用ApsaraDB for Greenplum

阿里云的用户可以购买SATA+SSD混合存储的Greenplum,以非常高的性价比获得PB级的数据仓库(公测阶段只提供纯SSD的版本)。

用户可以使用ETL工具,或者mysql2pgsql, pgsql2pgsql将数据增量或全量的从MySQL或PgSQL同步到Greenplum。

成熟的分析任务可以跑在这个大的Greenplum数仓上面。

另外,分析人员要数据分析模型试错的话,可以将数据模型分析试错的样本数据导出到OSS。 Greenplum或者RDS PG可以通过OSS外部表直接访问试错数据,进行分析。

ETL可以选择阿里云市场中的ETL服务或者用户自己使用开源的ETL工具,都是非常方便的。

如果试错的数据量(样本数据)在百GB的规模,建议可以直接使用RDS PG
。 9.6还会推出CPU并行计算的功能,处理百GB毫无压力。 数据模型分析试错数据再大一点的话,建议还是购买小型的Greenplum。

这样就可以做到跑成熟的数据分析模型,试错两不误。

如果用户 为了节约成本一定要将成熟模型和试错放到一个数据仓库来跑的话,如果你不想因为任务跑不出来被老板批,建议错开任务的时间。
screenshot

小结

  1. 正确使用数仓(不管是Greenplum还是其他的数仓),必须要搞清楚跑成熟任务和分析人员模型试错是不要混到一起跑的,相互干扰,时间还漫长。 分析人员很贵的,多加几台机器,把模型试错和成熟任务分开,可以给分析人员灵活的发挥空间,又不耽误跑成熟模型,何乐不为呢。

祝大家玩得开心,欢迎随时来阿里云促膝长谈业务需求 ,恭候光临。

阿里云的小伙伴们加油,努力做 最贴地气的云数据库 。

相关实践学习
阿里云云原生数据仓库AnalyticDB MySQL版 使用教程
云原生数据仓库AnalyticDB MySQL版是一种支持高并发低延时查询的新一代云原生数据仓库,高度兼容MySQL协议以及SQL:92、SQL:99、SQL:2003标准,可以对海量数据进行即时的多维分析透视和业务探索,快速构建企业云上数据仓库。 了解产品 https://www.aliyun.com/product/ApsaraDB/ads
目录
相关文章
|
存储
wsl的存储路径
wsl的存储路径
1918 0
|
3月前
|
存储 弹性计算 固态存储
2026年阿里云服务器4核8G配置收费标准与活动价格,最优购买方案与价格对比
2026年阿里云4核8G云服务器提供多样化实例选择,价格跨度显著。经济型e实例年费约1477元起,适配个人网站、开发测试等轻量场景;通用算力型u2a实例年费约898元起,以高性价比支撑企业通用业务;计算型c9i实例年费约3147元起,聚焦高性能计算场景。用户可通过新客专属折扣、九代实例年付6.4折、领券满减等策略降低成本,结合带宽降配+CDN加速、弹性云盘等技巧进一步优化成本,适配小型网站、电商后台、在线游戏等多场景需求。
|
C#
ICSharpCode.TextEditor使用及扩展
SharpDevelop (#develop)有很多“副产品”,其中最出名的应算SharpZipLib (#ziplib),纯C#的ZIP类库,而在SharpDevelop (#develop)中,“隐藏”了很多优秀的类库,其中ICSharpCode.TextEditor是表表者。
3007 0
|
SQL 双11 流计算
Flink SQL 功能解密系列 —— 流计算“撤回(Retraction)”案例分析
通俗讲retract就是传统数据里面的更新操作,也就是说retract是流式计算场景下对数据更新的处理方式。
|
6月前
|
存储 人工智能 大数据
云栖2025|阿里云开源大数据发布新一代“湖流一体”数智平台及全栈技术升级
阿里云在云栖大会发布“湖流一体”数智平台,推出DLF-3.0全模态湖仓、实时计算Flink版升级及EMR系列新品,融合实时化、多模态、智能化技术,打造AI时代高效开放的数据底座,赋能企业数字化转型。
1184 0
|
9月前
|
存储 API 数据安全/隐私保护
如何使用Web Storage进行状态持久化?
如何使用Web Storage进行状态持久化?
|
5月前
|
搜索推荐 安全 数据可视化
智慧随访系统,随访系统源码,多渠道随访、智能提醒、表单模板库与满意度调查
诊后随访管理系统通过信息化手段,实现患者出院后的全流程健康管理。系统基于模块化架构,集成HIS/EMR数据,支持多渠道随访、智能提醒、表单模板库与满意度调查,提供从计划制定、执行记录到统计分析的一体化解决方案,提升医疗连续性与服务质量。
321 0
|
9月前
|
算法 搜索推荐 API
微信加人太频繁被限制怎么办?
微信加人限制的技术背景 微信为
|
11月前
|
存储 人工智能 iOS开发
Apple Logic Pro 11.2 发布 - 专业音乐制作 (音频编辑)
Apple Logic Pro 11.2 发布 - 专业音乐制作 (音频编辑)
277 1
|
SQL 存储 人工智能
Apache Flink 2.0.0: 实时数据处理的新纪元
Apache Flink 2.0.0 正式发布!这是自 Flink 1.0 发布九年以来的首次重大更新,凝聚了社区两年的努力。此版本引入分离式状态管理、物化表、流批统一等创新功能,优化云原生环境下的资源利用与性能表现,并强化了对人工智能工作流的支持。同时,Flink 2.0 对 API 和配置进行了全面清理,移除了过时组件,为未来的发展奠定了坚实基础。感谢 165 位贡献者的辛勤付出,共同推动实时计算进入新纪元!
1425 1
Apache Flink 2.0.0: 实时数据处理的新纪元