OneModel体系能给数据中台的建设带来什么?

简介: 作者:柯根 更多内容详见数据中台官网 https://dp.alibaba.com重要地位造成企业大数据建设的痛点原因,概括起来就是“烟囱式”开发造成数据不标准、不规范。所以数据中台建设的切入点需要以“数据公共层建设”消除因“烟囱式”开发给业务带来的困扰和造成的技术上的浪费。

作者:柯根 更多内容详见数据中台官网 https://dp.alibaba.com
重要地位
造成企业大数据建设的痛点原因,概括起来就是“烟囱式”开发造成数据不标准、不规范。所以数据中台建设的切入点需要以“数据公共层建设”消除因“烟囱式”开发给业务带来的困扰和造成的技术上的浪费。而OneModel方法论则是打开局面和推动数据中台建设的关键。
核心能力

  • 规范定义
    在业界中常用数据字典文档的方式维护标准规范定义,但是往往“计划很丰满,现实很骨感”,文档在项目实际实践过程中,很难保证及时维护,到最后往往变成无人问津的“空中楼阁”;并且文档与开发严重脱节,到最后形成“上有政策,下游对策”的混乱局面。

就算数据字典能及时维护并严格遵守,它也只能短暂缓解业务痛点,但只是治标,对技术痛点几乎无用。因此,必须从源头出发,找到可以同时解决业务痛点和技术痛点的方法,而全局规划和数据规范定义就是治本的方法。
OneModel方法论保障了数据唯一性的数据域、业务过程,以及在数据域、业务过程之下的指标、实体属性等的结构性封装、命名和定义。
数据规范定义是在开发之前,以业务的视角进行数据的统一和标准定义,确保计算口径一致、算法一致、命名一致,后续的数据模型设计和ETL开发都是在此基础上进行的。主要基于以下几部分内容:

  1. 基于对业务和数据的理解,对数据进行基于业务本身但超越和脱离业务需求限制的抽象。主要的抽象不随着业务团队的组织架构变动而变动,即抽象出业务板块、数据域、业务过程、维度。
  2. 基于以上抽象出的业务过程和维度,进一步定义原子指标、业务限定、计算周期、计算粒度。
  3. 基于定义的原子指标、业务限定、计算周期、计算粒度,可结构化定义出派生指标,并继承原子指标的数据类型、算法,并形成标准化的派生指标名称定义。
  4. 通过数据中台不断的迭代优化,积累大量统一、标准的指标。
  • 模型设计
    在数据模型设计中,OneModel方法论保障模型复用和稳定的数据基础层、数据中间层、数据应用层分层架构设计,以及各层模型设计的核心原则。

数据模型设计在数据规范定义的基础上,从业务应用或者需求来源端控制了数据模型设计的重要输入源头。其次,对数据模型严格分层,在统一数据公共层的同时允许数据应用层百花齐放。第三,从业务和技术双视角下,严格要求数据模型设计满足“高内聚、低耦合”的标准。

  • 数据开发
    在ETL开发中,开发过程遵循标准有效的开发规范,并将以往ETL开发人员所积累的经验做沉淀。

工具沉淀
仅仅有方法论是远远不够的,很多企业不乏拥有业界通用方法论以及成型的数据模型。但往往发现若没有产品做支撑,方法论落地存在很大的困难。需要有足够多建模经验丰富的模型架构师、经验丰富的数据研发工程师,以及要在企业内部对方法论达成绝对的一致。这对于有一定规模的企业来说都是很难实现的。
因此阿里巴巴云上数据中台团队基于多年在集团内部的实战经验,将OneModel方法论沉淀到数据中台产品Dataphin中。
Dataphin通过OneModel方法论为指导,沉淀出一站式的规范、工具型数据产品,产品主要包括以下几部分:规范化数据建模,特别关注数据规范定义、数据模型设计和ETL开发等全流程;落地和承载规范化数据建模的规范化研发工具;规范化建模产生的所有分层数据模型;所有数据在面对应用时都会被监控和调度,且对上线、下线调优监控会反馈到规范化数据建模中。
将原先割裂的数据规范定义、数据模型设计、ETL开发连接在一期,实现“设计即开发,所建即所得”。将数据规范定义从工具层面的数据命名+结构化抽象定义合二为一,并与数据模型设计连接,进而直接支撑ETL开发。当数据规范定义完成之后,每一个指标都可以根据结构化命名规则和计算逻辑快速映射到对应的物理表中。
只要某个指标能够被规范定义,针对该指标的代码即可自动化生成,而一系列经过规范定义的指标则会根据相同计算粒度,聚集到若干物理表或逻辑表中,这样形成的物理表或逻辑表,其全部代码和自动化生成。对于中间生成过程不必关心,因为这是系统内部的智能黑盒要以智能化的方式来解决的。并且智能黑盒不仅实现代码自动化生成,还关心优化生成代码及其任务调度所对应的计算逻辑。
下图为Dataphin通过基于逻辑模型的数据规范定义、智能设计及智能研发(黑盒实现代码自动化及任务优化)、基于逻辑模型的主题式查询等特性,带来全新、高效、标准的一体化设计及开发的数据中台构建和使用模式。
image

结语:
阿里巴巴数据中台团队,致力于输出阿里云数据智能的最佳实践,助力每个企业建设自己的数据中台,进而共同实现新时代下的智能商业!
阿里巴巴数据中台解决方案,核心产品:
Dataphin,以阿里巴巴大数据核心方法论OneData为内核驱动,提供一站式数据构建与管理能力;
Quick BI,集阿里巴巴数据分析经验沉淀,提供一站式数据分析与展现能力;
Quick Audience,集阿里巴巴消费者洞察及营销经验,提供一站式人群圈选、洞察及营销投放能力,连接阿里巴巴商业,实现用户增长。
欢迎志同道合者一起成长!更多内容详见数据中台官网 https://dp.alibaba.com

相关实践学习
AnalyticDB PostgreSQL 企业智能数据中台:一站式管理数据服务资产
企业在数据仓库之上可构建丰富的数据服务用以支持数据应用及业务场景;ADB PG推出全新企业智能数据平台,用以帮助用户一站式的管理企业数据服务资产,包括创建, 管理,探索, 监控等; 助力企业在现有平台之上快速构建起数据服务资产体系
目录
相关文章
|
2月前
|
Web App开发 数据采集 人工智能
|
3月前
|
人工智能 JavaScript 测试技术
从零开始:OpenCode AI 编程助手完整配置指南
本文详解OpenCode——一款终端优先、模型中立、本地优先的AI编程Agent。它不止补全代码,而是理解项目、规划任务、执行修改、生成测试,真正“替你写完代码”。涵盖安装配置、国内模型适配、Plan/Build双模式实战及不同角色提效路径。
|
数据采集 SQL 搜索推荐
大数据之路:阿里巴巴大数据实践——OneData数据中台体系
OneData是阿里巴巴内部实现数据整合与管理的方法体系与工具,旨在解决指标混乱、数据孤岛等问题。通过规范定义、模型设计与工具平台三层架构,实现数据标准化与高效开发,提升数据质量与应用效率。
4149 0
大数据之路:阿里巴巴大数据实践——OneData数据中台体系
|
数据采集 运维 DataWorks
DataWorks 千万级任务调度与全链路集成开发治理赋能智能驾驶技术突破
智能驾驶数据预处理面临数据孤岛、任务爆炸与开发运维一体化三大挑战。DataWorks提供一站式的解决方案,支持千万级任务调度、多源数据集成及全链路数据开发,助力智能驾驶模型数据处理与模型训练高效落地。
1245 0
|
9月前
|
数据采集 人工智能 监控
大型企业怎么做数据治理?(2025年12月更新)
瓴羊Dataphin是阿里云旗下一站式智能数据构建与管理平台,助力大型企业破解数据孤岛、标准不一、质量参差等治理难题。依托全链路智能化能力,支持50+异构数据源接入,实现数据采集、建模、治理、服务闭环。通过标准化建模、元数据管理、质量监控与血缘追踪,保障数据可信可控;以主题式服务赋能业务人员自助分析,推动数据价值落地。广泛应用于零售、餐饮、地产、制造、金融等行业,支撑会员运营、供应链优化、风险控制等场景。提供全托管服务与灵活部署方案,助力企业高效构建数据中台,释放数据要素价值。
|
人工智能 边缘计算 自然语言处理
CodeBuddy全新升级:体验Craft智能体的对话式编程革命
本文介绍了腾讯云代码助手CodeBuddy及其核心功能Craft智能体,展示了其在软件开发中的创新应用。Craft智能体通过自然语言理解、上下文感知的代码补全和多轮对话式调试等功能,显著提升了开发效率。文章详细解析了Craft的技术架构、实战应用、高级功能探索、最佳实践、性能优化策略以及与其他工具的集成。此外,还探讨了Craft在安全性与合规性、企业级定制、多模态编程支持、团队协作模式、边缘计算场景支持等方面的创新实践。Craft智能体代表了软件开发范式的重要转变,通过将自然语言理解与代码生成能力结合,降低
1387 1
|
Linux 网络虚拟化 Docker
新手向导:轻松掌握Docker搭建OpenVPN
OpenVPN 是一个开源的VPN软件包,支持多种操作系统和平台。它包含社区版(免费但需具备Linux命令
6519 2
|
消息中间件 存储 监控
|
机器学习/深度学习 存储 算法
One-Hot编码介绍
【10月更文挑战第2天】

热门文章

最新文章