数据资产的质量管理

简介: 数据资产的质量管理

基本概念:

数据资产质量:是指数仓数据资产表的质量,包含表的设计质量、开发质量、产出质量;

  • 设计质量:指资产表在业务数据链路中的定位是否合理,信息覆盖与整合是否达到要求;
  • 开发质量:指资产表在数据开发编码过程中,是否遵循约定的开发规范,数据加工逻辑是否正确;
  • 产出质量:指资产表对应任务的产出时间是否符合预期,产出结果数据是否达到要求;

影响因素:

  • 信息因素:开发人员是否了解资产表的具体需求目标,是否了解具体的业务数据链路和信息分布;
  • 工具因素:平台工具是否稳定,是否有DQC能力,是否有优先级控制能力
  • 流程因素:研发流程是否合理,是否有代码质量卡点,是否有数据质量卡点,是否有执行保障机制
  • 人为因素:人员编码水平是否打标,流程执行是否到位,需求理解是否到位

流程设计:

流程管理:

  • 需求文档落地:

数据类需求文档是数据开发前的资料收集与整理的重要产出,基于文档和业务方对齐具体数据需求,包括各种数据来源信息、加工逻辑信息、结果数据格式等等;

  • 需求迭代记录:

项目类数据需求往往因进度问题,需求调整较多,为保证信息对齐,建议使用迭代开发,使用aone或语雀 记录迭代需求;

非项目类需求迭代,必须提aone需求单排期处理;

  • 资产设计:

中间层资产按照中间层资产设计要求,需要在资产关联大图上标明,并给出明确的 实体&单据 定义,防止重复建设;

项目类应用层资产按需求逻辑,明确数据资产间的流转依赖关系,给出明确的数据 维度&粒度 定义,保证资产关系清晰;

非项目应用层资产按需求文档,给出明确的数据 维度&粒度 定义,保证资产关系清晰;

  • 数据自测:

所有数据表交付验收前,必须进行自测,保证数据表数据量符合预期,保证数据粒度符合预期,保证指标字段取值符合预期;

可通过查询数据进行观察,后期由平台提供校验工具,方便进行数据自测;

  • QA验收:

涉及业务回流的资产表,由业务QA同学负责验证数据质量;因数仓不存在测试环境,所以,可与QA同学沟通,采用uat、预发环境验证;

部分特殊情况下,可在数仓dev环境 人工写入数据进行逻辑验证;

  • 业务验收:

非业务回流类资产表,如报表等,由业务同学自行验收,部分高保障报表(如高管看板)可引入数据质量管理团队相关同学进行验收;

因统计指标等数据逻辑加工复杂,业务同学发现问题周期较长,可与业务同学约定部分验证case,通过后可先上线,再迭代;

  • 任务发布:

所有回流类任务发布,必须按要求注册业务风险场景( 无系统支持时 可采用文档记录),按业务产出要求配置任务优先级(如基线控制);

对于高风险场景任务,要求进行代码review ,保证代码质量;

  • DQC配置:

按需进行数据质量监控规则配置,要求中间表必须配置空表检测、重复值检测;高风险应用表必须配置空表检测、重复值检测、业务逻辑检测等;

全部采用强规则控制,检测异常时中断任务并告警,防止影响下游任务;

  • 资产文档更新:

中间层数据资产表上线后需要更新中间层资产文档,方便进行中间层数据资产管理;

项目类应用层数据资产表上线后,可在各自项目文档库维护,方便需求方查看项目产出数据资产情况;

非项目应用层数据资产表可不做要求,按需求交付即可;

目录
相关文章
|
9月前
|
安全 机器人 开发工具
解析支持Android SDK与深度Root权限的展厅机器人底盘选型指南
展厅机器人需兼顾实时控制与系统稳定,猎户星空豹小秘系列通过RT-Android调度与双闭环安全架构,实现高精度运动与开放开发;移远通信CR01提供深度定制自由,适合底层技术强的团队;小笨智能则聚焦快速落地,适配标准化场景。三者分别代表“安全开放”“极致掌控”“高效集成”的技术路径。
467 1
|
机器学习/深度学习 PyTorch 算法框架/工具
神经网络中的分位数回归和分位数损失
在使用机器学习构建预测模型时,我们不只是想知道“预测值(点预测)”,而是想知道“预测值落在某个范围内的可能性有多大(区间预测)”。例如当需要进行需求预测时,如果只储备最可能的需求预测量,那么缺货的概率非常的大。但是如果库存处于预测的第95个百分位数(需求有95%的可能性小于或等于该值),那么缺货数量会减少到大约20分之1。
1296 2
|
网络协议 图形学 Windows
unity获取本机IP地址
在 Unity 中,通过 .NET 框架的 System.Net 命名空间提供的 Dns 和 NetworkInterface 类,可以获取本机的 IPv4 和 IPv6 地址。使用 Dns.GetHostEntry 方法获取主机信息,并根据地址族(AddressFamily.InterNetwork 或 AddressFamily.InterNetworkV6)筛选出相应的 IP 地址。代码示例展示了如何分别获取 IPv4 和 IPv6 地址并输出到控制台。
934 10
|
SQL 存储 大数据
SQL Server 跨版本数据迁移实践
SQL Server 的导入和导出向导是一个非常有用的工具,可以帮助用户快速导入和导出数据,而无需编写复杂的 SQL 查询或程序代码。使用导入和导出向导,用户可以选择数据源、目标数据、映射源和目标列、指定导入或导出选项以及完成导入或导出操作,整个使用体验也非常简单便捷。
1161 0
|
存储 关系型数据库 MySQL
PACS系统 中 dicom 文件在mysql 8.0 数据库中的 存储和读取(pydicom 库使用)
PACS系统 中 dicom 文件在mysql 8.0 数据库中的 存储和读取(pydicom 库使用)
608 2
|
传感器 自动驾驶 安全
未来出行的智能革命:自动驾驶技术的现状与前景
在科技迅猛发展的今天,自动驾驶技术正逐步从科幻走进现实。本文将深入探讨自动驾驶的技术原理、当前发展现状以及未来的应用前景。我们将从感知、决策和执行三个核心层面剖析自动驾驶系统的工作机制,并讨论其在不同场景中的应用。同时,通过分析技术发展面临的挑战和瓶颈,我们展望了自动驾驶技术的未来图景,并思考其可能对社会、经济和法律等方面带来的深远影响。
1532 3
|
Web App开发 前端开发 UED
移动端适配布局指南:打造完美用户体验的秘密武器
【8月更文挑战第26天】在Web前端开发中,选择合适的移动端适配方案对确保跨设备的良好显示与用户体验至关重要。常用方案包括:媒体查询实现响应式布局;百分比、flexbox与CSS Grid布局提供更灵活的设计;结合viewport元标签和rem单位实现等比缩放;利用第三方库如Bootstrap加速开发。实践中应综合运用这些技术,并通过广泛测试保证兼容性和效果。
804 4
|
弹性计算 固态存储 开发者
阿里云99元服务器,性价比之王!新老用户都值得拥有!
阿里云99元服务器ECS经济型e实例,2核2G配置,3M固定带宽,40G ESSD Entry系统盘,适合个人开发者、学生和小微企业用于中小型网站建设和轻量级应用。CPU基于Intel Xeon Platinum架构,网络带宽支持最高2Gbps突发,云盘提供0.8万IOPS。3M带宽下载速度达384KB/s,上传速度1280KB/s,不限流量。续费仍为99元/年
1188 0
|
Linux API 调度
重温Linux内核:互斥和同步
本文全面回顾了Linux内核中的互斥和同步机制,包括中断屏蔽、原子变量、自旋锁、读写锁、顺序锁、信号量、互斥量、RCU机制以及完成量等,提供了它们的定义、实现原理、API用法和使用时的注意事项。
664 0
|
缓存 监控 时序数据库
influxdb报错:cache-max-memory-size exceeded
InfluxDB 错误显示超过最大缓存内存限制,可通过检查配置文件、监控系统资源、降低缓存大小、优化查询和增加硬件资源来解决。默认情况下,未配置 max-cache-size 时,InfluxDB 2.x 的缓存大小为单引擎500MB或多引擎10GB。要调整,找到配置文件(如 `/etc/influxdb/influxdb.conf`),设置 `max-cache-size` 参数,如 `max-cache-size = "1GB"`,然后重启服务。
1038 1