带你读《构建企业级好数据(Dataphin智能数据建设与治理白皮书)》——(二)研发:集成、建模、发布、运维(3)

简介: 带你读《构建企业级好数据(Dataphin智能数据建设与治理白皮书)》——(二)研发:集成、建模、发布、运维(3)

《构建企业级好数据(Dataphin智能数据建设与治理白皮书)》——二、Dataphin 演进之路:产品大图及核心功能详解——(二)研发:集成、建模、发布、运维(2) https://developer.aliyun.com/article/1229664?groupCode=dataphin



4) 属性与约束


在概念建模中,创建好实体,配置好实体间的关系,整个业务的大图就已经清晰的落地到数据中台。但是不同实体除了名字不同,关系不一样之外,还有哪些区别呢?


例如,用户和会员有什么区别,这就是逻辑建模要来解决的问题。逻辑建模的核心工作是梳理实体的特征,即给实体添加属性,并明确属性的业务约束,一个实体有很多属性(也叫特征),这些属性可以用于区分实体。


属性按照类型,可以分为:


• 标识属性,即实体的某个具体实例的唯一标识。实体是一个抽象概念,实体实例是具体事物。比如,商品鞋是一个实体。一双 36 码、白色、编码为 6901234的鞋就是一个实例。一个实体可以有多个标识属性,如商品 ID、商品编码。


• 关联实体属性,实体的某个属性本身可能也是一个实体。比如,商品的卖家(货主)属性,卖家是一个独立的实体。


• 描述属性,表述实体某一个维度的特征的一般属性,实体中的定性属性,一般是文本字符类型,如名称。


• 度量属性,某个维度数量程度的属性,定量属性。一般是数值类型,如金额、价格。


• 时间属性,描述实体某个行为的时间。


根据实体的类型(业务对象或业务活动),每个实体都有一些必须有的属性,即关键属性:


• 业务对象至少有一个标识属性,根据业务可以添加其他关键属性。

• 业务活动必须有一个关联实体属性来标识活动的主体(发起人,比如订单活动中的买家),一个或多个时间属性来明确活动时间。


实体丰富了属性之后还不能完全反映业务现实,还需要给属性加上一些约束规则:


• 取值规则,约束属性的取值范围,即约束实体实例中该属性的具体内容的有效性。

• 枚举值,如鞋子颜色只有黑色和白色两个。


• 取值范围,如年龄一般是 0~150。

• 唯一性,除标识属性外,其他属性也可能有唯一性要求。

• 非空性,不允许该属性出现空值。

• 其他。


实例化


定义好逻辑模型后,映射数据到模型的过程就是模型的实例化,浅白的说就是将物理的数据映射到逻辑模型。实例化的数据来源是 ODS 数据,少数情形下,ODS 数据需要做一些额外处理,将其按照一定的规则注册挂载到逻辑模型。Dataphin 将根据映射自动生成计算代码和周期调度任务,并基于属性约束生成数据质量校验规则。到这一步,就完成了逻辑模型的构建。


5) 分析模型


逻辑模型构建后之后,基于逻辑模型可以构建分析模型,即下图中的业务分析模型。


image.png


分析模型的目标是快速生成业务分析中的指标,称为派生指标,且保障这些指标的可靠性和可维护性。最终使用的指标拆解为四个基本组成部分:


• 统计周期

• 原子指标

• 业务限定

• 统计粒度


以上描述可能还是让人无法准确明白分析模型是什么,可以参照下图,从传统 SQL视角来理解:


image.png


分析建模的步骤是,统计周期设置->原子指标/业务限定配置->派生指标配置,所有配置完成后,系统将自动生成计算代码和周期调度任务。


Dataphin 通过规范化、模块化的低代码配置式研发,有效的保证了模型与代码的一致性。



《构建企业级好数据(Dataphin智能数据建设与治理白皮书)》——二、Dataphin 演进之路:产品大图及核心功能详解——(二)研发:集成、建模、发布、运维(4) https://developer.aliyun.com/article/1229661?groupCode=dataphin

相关文章
|
SQL 人工智能 JSON
Flink 2.1 SQL:解锁实时数据与AI集成,实现可扩展流处理
简介:本文整理自阿里云高级技术专家李麟在Flink Forward Asia 2025新加坡站的分享,介绍了Flink 2.1 SQL在实时数据处理与AI融合方面的关键进展,包括AI函数集成、Join优化及未来发展方向,助力构建高效实时AI管道。
1444 43
|
SQL 分布式计算 关系型数据库
Dataphin x Paimon 开箱即用的数据湖治理解决方案
Dataphin深度集成Apache Paimon,通过全链路功能适配和性能优化,为企业提供开箱即用的数据湖治理解决方案。
656 2
|
SQL 人工智能 JSON
Flink 2.1 SQL:解锁实时数据与AI集成,实现可扩展流处理
本文整理自阿里云的高级技术专家、Apache Flink PMC 成员李麟老师在 Flink Forward Asia 2025 新加坡[1]站 —— 实时 AI 专场中的分享。将带来关于 Flink 2.1 版本中 SQL 在实时数据处理和 AI 方面进展的话题。
745 0
Flink 2.1 SQL:解锁实时数据与AI集成,实现可扩展流处理
|
SQL 运维 自然语言处理
Dataphin智能化重磅升级!编码难题一扫光,开发运维更高效!
Dataphin重磅推出三大核心智能化能力:智能代码助手提升SQL开发效率;智能运维助手实现移动化任务管理;智能分析通过自然语言生成SQL,助力数据价值释放。未来将持续开放智能ETL、安全助手等能力,助力企业构建高效、稳定的数据资产体系。
907 0
|
数据采集 运维 DataWorks
DataWorks 千万级任务调度与全链路集成开发治理赋能智能驾驶技术突破
智能驾驶数据预处理面临数据孤岛、任务爆炸与开发运维一体化三大挑战。DataWorks提供一站式的解决方案,支持千万级任务调度、多源数据集成及全链路数据开发,助力智能驾驶模型数据处理与模型训练高效落地。
1265 0
|
运维 安全 关系型数据库
【产品升级】Dataphin V5.1版本发布:跨云数据集成、指标管理、平台运维带来重大更新!
V5.1版本新增多项功能:对接AWS生态(支持Amazon EMR、Redshift等),强化研发技术支撑(如API认证升级、全量任务隔离),完善运营消费链路(新增业务指标管理、指标关系图),提升平台综合能力(自定义菜单、缩短升级停机时间)。这些功能助力企业实现高效数据治理与分析,未来还将拓展智能化与国际化支持。
779 0
|
人工智能 Java API
Java与大模型集成实战:构建智能Java应用的新范式
随着大型语言模型(LLM)的API化,将其强大的自然语言处理能力集成到现有Java应用中已成为提升应用智能水平的关键路径。本文旨在为Java开发者提供一份实用的集成指南。我们将深入探讨如何使用Spring Boot 3框架,通过HTTP客户端与OpenAI GPT(或兼容API)进行高效、安全的交互。内容涵盖项目依赖配置、异步非阻塞的API调用、请求与响应的结构化处理、异常管理以及一些面向生产环境的最佳实践,并附带完整的代码示例,助您快速将AI能力融入Java生态。
1700 12
|
SQL 关系型数据库 Apache
从 Flink 到 Doris 的实时数据写入实践 —— 基于 Flink CDC 构建更实时高效的数据集成链路
本文将深入解析 Flink-Doris-Connector 三大典型场景中的设计与实现,并结合 Flink CDC 详细介绍了整库同步的解决方案,助力构建更加高效、稳定的实时数据处理体系。
4178 0
从 Flink 到 Doris 的实时数据写入实践 —— 基于 Flink CDC 构建更实时高效的数据集成链路
|
运维 Kubernetes 测试技术
应用多、交付快,研发运维怎么管?看云效+SAE 如何一站式破局
通过在云效中创建 SAE 服务连接并关联集群,团队可将应用环境直接部署到 SAE,实现从代码提交、镜像构建到 SAE 部署的自动化流水线。该集成打通了研发与运维的壁垒,特别适用于应用数量多、团队规模大、交付节奏快的组织,助力企业实现敏捷、可靠的持续交付。

热门文章

最新文章

相关产品

  • 智能数据建设与治理 Dataphin