云场景实践研究第65期:五叶草

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: 五叶草利用阿里云MaxCompute,为某世界500强快消品零售巨头搭建了企业级数据仓库。依托其强大的海量数据处理能力,有效降低了时间人力成本,提升了工作效率,使客户可以将更多的精力投入到业务升级中去。
更多云场景实践研究案例,点击这里: 【云场景实践研究合集】联合不是简单的加法,而是无限的生态,谁会是下一个独角兽
五叶草利用阿里云MaxCompute,为某世界500强快消品零售巨头搭建了企业级数据仓库。依托其强大的海量数据处理能力,有效降低了时间人力成本,提升了工作效率,使客户可以将更多的精力投入到业务升级中去。

采用的阿里产品
阿里云MaxCompute

为什么使用阿里云
MaxCompute,具有强大的海量数据处理能力,能够有效降低时间人力成本,提升工作效率,使客户可以将更多的精力投入到业务升级中去。

关于五叶草
五叶草大数据有限公司是南京高新区阿里巴巴创新中心基地本地运营商,是南京首家大数据、云计算、人工智能、物联网专业孵化培训基地。阿里云数加(大数据平台)金牌合作伙伴,阿里云职业认证培训体系课程授权合作伙伴和指定运营商。其业务包括:五叶草指数咨询服务、大数据行业解决方案、大数据职业认证培训、阿里云大数据实验室、五叶草大数据私董会、大数据项目孵化加速、大数据生态投资基金、大数据众智生态集市等。

面临的问题
由于部分子系统未打通、业务逻辑繁杂,客户的业务分析工作主要在线下人工完成,分析时间长、统计口径不一、数据质量参差不齐。

为什么选择阿里云
利用MaxCompute,五叶草为某世界500强快消品零售巨头搭建了企业级数据仓库。在将数据存储在MaxCompute后,依托其强大的海量数据处理能力,原先需要花数小时更新的报表只在10分钟左右即可完成, 有效降低了时间人力成本,提升了工作效率,使客户可以将更多的精力投入到业务升级中去

自定义MaxCompute各层数据模型:
1.数据接口层
数据接口层的数据结构应该对应源系统。应当注意的是同步的源数据要避免使用视图,在客户的生产环境上曾经出现过这样的情况:由于存储过程优化不好,同步视图在同步任务发起后仍然没有生成出来,导致同步任务及后续的ETL挂起。所以后续通过客户和第三方接洽,将数据源从视图换为表。
705238898a8544414618120d5926d0d74d997ac4
2.基础数据层
所有清洗、整合、运算工作应当放在基础数据层,避免对同步表里数据进行操作。以增量更新基础表为例,通过使用下面的方法,五叶草实现了每天增量更新数据到全量基础表的新分区,当天增量与昨天全量合并,数据存在冲突时优先保留增量记录
ff042ae3cbc20d1afc76bb275900067538399793
其中dwd_dummy_data为全量基础表,存放昨天的全量数据;ods_dummy_data为增量同步表,存放今天的增量数据。
由于数据更新之后插入了新分区,保留的基础表原始数据就为后面数据比对提供了极大的便利。客户部分数据源是由其他第三方维护的,出现过本月客户及该第三方协商对上月数据进行了修改,但是没有将该操作提前告知五叶草,最终导致上月月报结果与客户BI部门统计有出入。通过与客户提供的数据比对,五叶草发现与原始数据不一致的地方,在测试环境中对历史数据复现了相同的操作,并重跑了之后的任务,最终上月月报结果与客户BI部门结果一致。
3.多维数据层、数据应用层
在基础数据层,通过清洗、整合、运算得到的表为基本的维度表、事实表。需要面向业务,计算出业务指标后生成一张多维度表,并最终展现给客户。根据进销存、人货场财等分析思路,可以沿着某一方向深挖下去,下面展示了几张从人、场、货三个方向可以分析得出的多维度表,以及所需的基础数据。五叶草同时也在打通更多的数据通路。

  ee3ad2e489bacdaa00d8c992c09a2af330e36dac

关于五叶草的更多实践详情: 依托MaxCompute构建零售快消品行业数据仓库  
原文发布日期:2017-07-28
云栖社区场景研究小组成员:董黎明,仲浩。

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
机器学习/深度学习 存储 云安全
阿云漫画 | 一朵安全的云是如何炼成的
编者按: 作为亚太区最早布局机密计算、最全合规资质认证和用户隐私保护的先行者,阿里云从硬件级安全可信根、硬件固件安全、系统可信链、可信执行环境和合规资质等方面落地可信计算环境,为用户提供全球最高等级的安全可信云。
234 0
阿云漫画 | 一朵安全的云是如何炼成的
|
机器学习/深度学习 数据采集 人工智能
站在2022前展望大模型的未来,周志华、唐杰、杨红霞这些大咖怎么看?
站在2022前展望大模型的未来,周志华、唐杰、杨红霞这些大咖怎么看?
144 0
|
机器学习/深度学习 数据采集 人工智能
站在2022前展望大模型的未来,周志华、唐杰、杨红霞这些大咖怎么看?
站在2022前展望大模型的未来,周志华、唐杰、杨红霞这些大咖怎么看?
521 0
站在2022前展望大模型的未来,周志华、唐杰、杨红霞这些大咖怎么看?
|
JavaScript Java 程序员
SAP成都研究院马洪波:提升学习力,增强竞争力,收获一生乐趣
SAP成都研究院马洪波:提升学习力,增强竞争力,收获一生乐趣
126 0
|
固态存储 安全 架构师
擅长顺势而为,收获家业两成——对话阿里云 MVP杨飞
云栖号资讯:【点击查看更多行业资讯】在这里您可以找到不同行业的第一手的上云资讯,还在等什么,快来! 简介: 对比大多数开发者来说,杨飞的职业路线可以说是大相径庭。从大厂到创业公司,从一线城市回归二线……对于事业和生活,他的选择一直很独特。
1571 0
擅长顺势而为,收获家业两成——对话阿里云 MVP杨飞
|
分布式计算 监控 算法
云场景实践研究第45期:梦想旅行
作为一家服务于出境自由行用户的公司,梦想旅行在上云之后,实现了海外访问的提速,以及高可用与容灾的架构优化。本文将带领大家一同了解梦想旅行如何借助阿里云达到高速海外访问与高可用、容灾架构的最佳实践。
1950 0
|
工业大脑 人工智能 算法
案例酷 | 攀钢:钢铁是怎样用AI炼成的?
过去20年里,尽管中国贡献了全球粗钢增量的80%,但中国钢铁业的发展不容乐观,产能过剩与结构严重失衡、全球经济下滑导致钢铁需求增速放缓、生产质量的不稳定、废品率高、高耗能以及多元化需求,给整个行业都带来了极大的挑战。中国钢企的转型升级迫在眉睫。 在钢铁产业严重过剩、钢企转型压力巨大的背景下, 作为一个传统“老三线”建设的国有企业,攀钢前些年一直处于亏损状态,通过这几年的改革创新,不仅终结了亏损历史,打了一个漂亮的“翻身仗”,去年全年经营性利润创历史最好水平。它究竟是怎么做到的?
921 0
|
算法
算法学习之路|挖掘机技术哪家强
为了用事实说明挖掘机技术到底哪家强,PAT组织了一场挖掘机技能大赛。现请你根据比赛结果统计出技术最强的那个学校。
1539 0
|
敏捷开发 运维 测试技术
云场景实践研究第76期:南京路特
在和阿里的云效平台结合之后,南京路特成功解决了困扰已久的成本问题、管理问题和效率问题,最终年节省20-25万,同时简化了流程、提高了效率。本文将结合南京路特的实践经验带领大家一同了解中小团队持续集成之路。
1893 0
|
运维 关系型数据库 数据库
云场景实践研究第52期:畅游
混合云在安全上有很重要的优势,阿里安全体系很健全,混合云模式既保证了用户线下的场景核心需求,同时依托阿里安全防护体系,将安全堡垒又加固了一层,混合云可能比常规的云上云下打通更实际,优势更明显。借助阿里云提供的混合云解决方案,畅游在游戏的维护成本等各方面都有很大的进步,其故障修复和应用上线的时间速度提升几十倍甚至上百倍。
2484 0