《全链路数据治理-智能数据建模 》——客户案例:大淘系数据模型治理最佳实践(1)

简介: 《全链路数据治理-智能数据建模 》——客户案例:大淘系数据模型治理最佳实践(1)

客户案例:大淘系数据模型治理最佳实践

作者:郭进士,大淘系数仓团队

导读

本次分享题目为淘系数据模型治理,主要介绍过去一年淘系数据治理工作的一些总结。具体将围绕以下4 部分展开:


• 模型背景&问题

• 问题分析

• 治理方案

• 未来规划


一、 模型背景&问题

1. 整体情况

首先介绍一下淘系的整体数据背景。


image.png


淘系的数据中台成立至今已有7 年左右,一直未作数据治理,整体数据生成构成比为:人工创建(22%)+机器生成78%。其中活跃数据占比:9%,不规范数据占比:21%。


数据活跃以倒三角形状分布,整体分布比例为ads:dws:dwd:dim=8:2:1:1,分布还算合理。


上图中下半部分是模型的生命周期,增长和留存情况。淘系的业务还属于快速变化中,模型变化比较快。模型生命周期为25 个月,模型年增长比例30%,模型留存44%。



2. 公共层


image.png



公共层两大核心问题为:


• 首先,公共层表复用性不高。在2014 年的时候公共层还比较规范,但可持续性不强。随着时间流逝,业务增长和变化,复用性就逐年降低。因为大部分的数据是应用层做的,他们会开发自己的公共层,复用性降低,大部分都是无效表。


• 另外,公共数据表在各个团队分布不合理。这是由于数据团队多,为了满足业务开发效率,每个团队都有自己的公共表,容易出现公共表复用占比低,重复建设的场景。其中淘宝数据团队负责最多的公共数据表。



3. 应用层分析


image.png

应用层的主要问题包括:


• 第一,公共层建设不足或公共层透出不足。随着时间增长,公共层的指标不能满足ads 层的业务需要,ads 复用指标逻辑没有下层,引用cdm 层的ads 表占比逐年降低,引用ads 的ads 表占比逐年增高。


• 第二,较多的ads 表共性逻辑未下沉,统计显示超过17.63%ads 表被下游ads复用。


• 第三,跨集市依赖严重,统计显示,整体跨集市依赖占比为30%,特别是大进口和淘宝数据跨集市依赖达到了40%,影响模型的稳定性,影响了模型的下线、修改。





《全链路数据治理-智能数据建模 》——客户案例:大淘系数据模型治理最佳实践(2) https://developer.aliyun.com/article/1230769?groupCode=tech_library

相关文章
|
6月前
|
存储 人工智能 自然语言处理
又双叒叕获认可!阿里云AI Stack一体机首批通过国家评测认证
近日,阿里云AI Stack一体机通过了中国电子技术标准研究院的“云上部署DeepSeek验证测试”,成为首批通过该评测的AI大模型一体机。
628 10
|
6月前
|
自然语言处理 运维 DataWorks
智能体Agent解析:用自然语言重构数据开发工作方式
大数据开发治理平台DataWorks基于MCP协议,正式发布了DataWorks Agent,内置DataWorks MCP Server V1.0。该功能支持在DataWorks Data Studio中通过自然语言交互完成数据开发任务,实现了需求即代码的开发体验。本文将详细介绍如何通过配置使用DataWorks MCP Server进行任务的开发和运维管理。
|
人工智能 分布式计算 大数据
AI Native平台,跨越AI应用从创新到生产的鸿沟
2024年是AI应用的元年,以大模型为中心的 AI Native 应用大爆发正在从理想变成现实。云计算带来的应用创新潮,经历了虚拟机时代和云原生时代,正在全面拥抱以大模型为核心的 AI Native 阶段,推动大数据与AI的工作流前所未有地紧密结合。领先大模型、高效的AI计算平台和统一的大数据平台是 AI Native 应用广泛落地背后不可获缺的要素。 9月20日,2024云栖大会上,阿里云副总裁、阿里云计算平台事业部负责人汪军华宣布大数据AI平台全面升级,为 AI Native 应用大爆发提供坚实的平台支撑。
|
数据采集 安全 Java
Burpsuite Intruder 暴力破jie实战
Burpsuite Intruder 暴力破jie实战
|
存储 运维 DataWorks
淘系数据模型治理最佳实践
本次分享题目为淘系数据模型治理,主要介绍过去一年淘系数据治理工作的一些总结。
1840 0
|
SQL 消息中间件 缓存
阿里云大数据开发三面面经,已过,面试题已配答案
阿里云大数据开发三面面经,已过,面试题已配答案
1526 1
|
JavaScript 开发者
vue3+vite+ts中的@的配置
vue3+vite+ts中的@的配置
400 0
|
存储 数据可视化 数据挖掘
MySQL数据分析实战:销售和用户行为分析案例分享
MySQL是一种常用的关系型数据库管理系统,可以用来存储和管理大量的数据。除了存储数据,MySQL还可以用来进行数据分析。在本文中,我将介绍如何使用MySQL进行数据分析,并提供一些实际的示例。
2392 3
|
存储 数据采集 分布式计算
什么是OneData?阿里数据中台实施方法论解读
什么是OneData?阿里数据中台实施方法论解读
15235 2
什么是OneData?阿里数据中台实施方法论解读
|
数据建模 定位技术
《全链路数据治理-智能数据建模 》——客户案例:大淘系数据模型治理最佳实践(5)
《全链路数据治理-智能数据建模 》——客户案例:大淘系数据模型治理最佳实践(5)
210 0