Dataphin功能Tips系列(96)Dataphin 构建外部数据系统血缘统一管理解决方案(2)

简介: Dataphin通过OpenAPI支持外部系统血缘纳管,可基于Catalog/Schema/Env等属性组合注册表级与字段级血缘,补全全链路数据地图,实现跨系统血缘可视化与影响分析。

👉🏻场景

在构建全链路数据地图时,如果上游来源系统或下游消费系统的血缘缺失,可能导致链路断裂。例如:某张表在被采集至Dataphin前已通过外部ETL从上游库同步而来,若这段血缘缺失,进入Dataphin后就难以回溯源头并评估变更对下游的影响。那Dataphin 是否支持对外部系统血缘进行统一纳管与可视化展示呢?

👉🏻 解决方案及功能

Dataphin 提供 OpenAPI 注册表血缘能力,补全全链路血缘。血缘注册时需指明以下三个核心部分:

  • Source:来源表。
  • Target:目标表。
  • DetailedLineages:表的字段血缘集合。

可通过id(guid)或属性组合来唯一定位血缘关系中的对象。本次介绍属性组合的方式,尤其适用于血缘关系中包含非Dataphin资产的情况。

  • 表级资产血缘请求参数配置(Source/Target):

字段名称

字段描述

填写示例

ReferenceType

资产引用类型:通过guid还是属性定位资产,此处选择填写BY_PROPERTY

BY_PROPERTY

MetadataType

资产类型:TABLE

TABLE

MetadataSubType

资产子类型,包括:PHYSICAL_TABLE, PHYSICAL_VIEW, PHYSICAL_MATERIALIZED_VIEW, DATASOURCE_TABLE, DATASOURCE_VIEW, DATASOURCE_MATERIALIZED_VIEW, DIM_NORMAL, DIM_LEVEL, DIM_ENUM, DIM_VIRTUAL, FACT_EVENT, FACT_PROCESS, FACT_SNAPSHOT, SUM_BIZ_UNIT

DATASOURCE_TABLE

Catalog

系统根据 catalog+schema+env 确定对应资产:

若资产为dataphin表,catalog 统一为 dataphin;数据源表,填写数据源名称。

dataphin

Schema

若资产为dataphin物理表,填写项目名;dataphin逻辑表,填写板块名;数据源表,填写所属数据源database/schema。

project_a_name

Env

资产所属环境,可填dev,prod

prod

Name

资产名称

table_a_name

  • 字段级血缘请求参数配置(Source/Target),可以为空:

字段名称

字段解释

填写示例

ReferenceType

资产引用类型:通过guid还是属性定位资产,此处选择填写BY_PROPERTY

BY_PROPERTY

MetadataType

资产类型COLUMN

COLUMN

Catalog

系统根据 catalog+schema+env 确定对应资产:

若字段所属表为dataphin表,catalog 统一为 dataphin;数据源表,填写数据源名称。

dataphin

Schema

若字段所属表为dataphin物理表,填写项目名;dataphin逻辑表,填写板块名;数据源表,填写所属数据源database/schema。

project_a_name

Env

资产所属环境,可填dev,prod

prod

Name

字段名称

column_a_name

👉🏻 操作验证:

  1. 当我们明确上游和下游资产的Catalog、Schema等信息时,在公共云环境进行参数填写并调用测试,可以看到返回数据成功

  2. 随后,我们便可以在资产目录看到注册成功的数据血缘。

相关文章
|
6月前
|
Kubernetes 调度 流计算
Flink on Kubernetes 自定义镜像能力:让企业存量实时任务零成本迁移,实现统一平台管控
Dataphin推出Flink on Kubernetes自定义镜像能力,支持企业直接复用存量业务镜像与K8s配置,零代码改造、零环境风险完成实时任务迁移,实现“业务不动、管控升级”,兼顾稳定性与平台化治理。
246 0
|
6月前
|
SQL 分布式计算 关系型数据库
Dataphin功能Tips系列(92)如何方便快速地通过SQL取数实现定制化数据同步
本文介绍如何在Dataphin中实现MySQL到MaxCompute的T-1增量数据同步:通过离线集成任务,将MySQL输入组件切换为脚本模式,利用`querySql`配合`${extract_date}`动态参数(默认`${yyyy-MM-dd}`),精准抽取前一日订单数据,配置调度后即可全自动运行。
381 5
|
3月前
|
数据采集 人工智能 数据可视化
从数据到知识:Dataphin 知识图谱,重新定义企业智能决策
Dataphin知识图谱助力企业从PB级数据迈向可理解、可推理、可决策的知识智能。它深度融合数据研发体系,支持可视化建模、结构化/非结构化数据双通道入图、Schema全生命周期管理及GraphRAG问答,真正实现“数据即知识”。
618 0
从数据到知识:Dataphin 知识图谱,重新定义企业智能决策
|
6月前
|
数据可视化 定位技术
Dataphin功能Tips系列(94)Dataphin 构建外部数据系统血缘统一管理解决方案(1)
Dataphin支持通过OpenAPI注册外部系统血缘,补全全链路数据地图断点。提供BY_GUID/BY_PROPERTY两种方式,支持表级与字段级血缘纳管及可视化展示,助力血缘追溯与影响分析。
292 1
|
3月前
|
人工智能 运维 数据可视化
非结构化数据处理,为什么是Dataphin?
Dataphin V6.1重磅推出非结构化数据处理能力,支持文档、音视频、图片等多模态数据的一站式资产化治理:提供7类50+开箱即用算子、可视化DAG编排、文件+元数据混合管理、细粒度权限与动态脱敏,实现与结构化数据统一治理、血缘追踪和版本管控。
487 2
|
10月前
|
SQL 数据可视化 大数据
Dataphin数据血缘:实现全面追溯,保障流转透明
数据血缘揭示数据从源头到应用的全链路流转关系,助力企业厘清数据来源、影响范围与质量问题根源。Dataphin通过自动采集、手动配置和OpenAPI注册三类方式构建全面的数据血缘,支持可视化展示与用于质量问题溯源,实现数据可查、可信、可管,推动高质量数据治理。
1140 1
|
6月前
Dataphin登录系统重磅升级:界面化SSO配置、多账号登录功能上线
Dataphin V6.0推出界面化SSO配置与多账号体系登录功能,支持CAS、OAuth2.0、SAML、飞书等多种协议,解决旧版配置复杂、不支持多源登录等痛点,提升企业单点登录体验与管理效率。
475 0
|
6月前
|
存储 数据采集 SQL
Dataphin功能Tips系列(91)统一采样配置,让样例数据“一次生成,多处可用”
Dataphin提供统一自动采样机制,预生成并集中管理样例数据,支持安全识别、数据预览、NL2SQL等多场景复用,避免重复查询,提升效率、节省资源。
202 3
|
10月前
|
数据采集 人工智能
Dataphin X-数据质量,智能分析质量问题并推荐整改建议
针对数据治理中质量问题难发现、根因定位难、整改效率低等痛点,推出AI驱动的数据质量问题智能分析功能。通过智能分析异常、追溯根因、构建数据证据链,自动生成含改进建议与影响评估的质量报告,提升治理效率与决策可靠性。
450 3
|
6月前
|
数据采集 运维 监控
Dataphin功能Tips系列(95)如何自定义Dataphin告警消息
Dataphin监控告警支持离线/实时任务、数据质量及服务的全链路异常检测,可基于规则自动触发告警。提供灵活的消息模板自定义能力,支持按事件类型、渠道(如钉钉机器人)配置内容,集成任务名、负责人、日志URL等元数据,提升告警精准性与响应效率。
242 2