Dataphin V5.4版本发布:拥有「最强大脑」的数据中台,究竟智能在哪儿?

简介: Dataphin是阿里巴巴数据中台方法论的实践产品,助力企业构建湖仓一体、多云兼容的数据资产体系。V5.4版本升级集成、治理、安全与运维能力,新增API/FTP增强、数据质量智能分析、外部血缘注册、行级权限申请等特性,全面提升数据开发效率与治理水平。

关于Dataphin

Dataphin 是阿里巴巴十余年内部实践及方法论的产品化输出,为企业提供数据建设、治理、运营、消费的Data x AI全链路服务,深度适配湖仓一体架构,灵活兼容多云复杂环境,助力企业高效构建标准化数据资产体系,加速释放数据价值。


关于Dataphin V5.4

您是否曾设想,一个理想的数据平台应该是什么模样?

它应该足够强大,能轻松应对从API、FTP到各类数据源的复杂集成;它应该足够智能,能主动发现数据隐患并给出药方;它更应该足够贴心,让权限申请、资源监控、数据操作都像日常对话一样简单。

现在,这个理想的模样已清晰可见。

近日,Dataphin V5.4 正式登场,旨在成为您团队中无所不能拥有[最强大脑]的数据中台。 本次更新,我们围绕“集成、治理、安全、运维”四大核心场景,为您带来一系列重磅能力升级!


新版本重点特性详解及应用场景

特性 1:API组件升级:新增支持多个签名函数以及支持自定义签名串

背景:

在 ToB/ToG 多场景 API 集成过程中,不同合作方的接口签名规则存在显著差异 —— 部分场景需特定加密算法保障数据安全,部分场景要求灵活配置参数分隔符、键值连接符以适配个性化签名格式,传统 API 组件固定的签名逻辑和有限的算法支持,难以满足多样化对接需求,导致用户在集成不同来源 API 时需额外开发适配代码,效率低下且易出错。

功能概览:

  1. 支持自定义参数分隔符、建值连接符
  2. 签名函数新增支持SHA1HEX、SHA256、SHA256HEX、SHA512HEX、HMAC_SHA512
  3. 支持自定义签名串,通过“#{param}”方式引用参数,支持通过“@”可触发参数提示

 


特性 2:FTP 组件升级:支持tar.gz 解压 、压缩包下文件筛选以及JSONL文件读取

背景:

在企业数据集成场景中,FTP 作为常用文件传输工具,常需处理 tar.gz、zip 等压缩包文件。过去 FTP 组件仅支持基础文件传输,缺乏压缩包直接解压能力,需用户额外手动处理;并且面对压缩包内海量文件时,无法精准筛选目标文件,导致数据处理效率低下;在文件类型上缺乏对JSONL 格式支持,一般需借助第三方工具转换,增加了数据集成的复杂度与成本。

功能概览:

  1. 支持读取tar.gz压缩格式的文件
  2. 当压缩格式为tar.gz、zip格式时,支持配置文件匹配规则筛选压缩包下的文件
  3. 支持读取JSONL格式的文本数据,按行读取文本中的JSON数据

特性 3:数据源扩展:离线集成、实时集成数据源扩展

背景:

为满足企业对国产化适配、数据库新版本及湖表流读的需求,扩展离线与实时集成数据源,新增并优化多类核心引擎支持。

功能概览:

  1. 离线集成:输入输出组件支持Easysearch(国产化适配)、适配Hudi-1.0.2、人大金仓(国产化适配)特殊类型支持
  2. 实时集成:来源端自持MySQL8.4.4(适配特殊语法)、PolarDB-MySQL(全新支持)、Hudi(全新支持,单湖表流读)

   

   



特性 4:X-数据质量,智能分析质量问题并推荐整改建议

背景:

在数据治理的实际工作中,数据质量问题不仅影响数据的准确性和可信度,还直接影响业务分析和决策的可靠性。传统治理方式主要依赖人工异常排查,面对复杂的数据血缘关系和庞大的数据体量,难以及时发现质量缺陷、精准定位问题根因和高效完成整改,导致治理效率低下。

功能概览:

  1. 问题分析,根因追溯:依托AI驱动自动分析数据质量异常,层层深入查找问题根因,实现质量问题的精准溯源定位。
  2. 数据支撑,证据确凿:智能采样数据、解析数据血缘,构建问题分析证据链,为根因推断和决策提供有力数据依据。
  3. 整改建议,报告闭环:基于根因分析和证据链,自动生成质量问题整改建议及影响评估,形成完整质量报告,实现治理流程闭环。

特性 5:支持注册外部血缘关系

背景:

血缘关系是追溯数据来源、分析影响范围及资产价值的关键依据。当前大部分数据开发与治理平台的血缘关系仅支持基于任务自动解析或手动配置,无法覆盖外部系统的血缘信息,导致数据血缘存在断层。亟需实现外部系统血缘的批量导入和灵活配置,补全端(first mile ETL)到端(last mile BI)的血缘关系。

功能概览:

  1. 支持通过OpenAPI注册表级、字段级血缘关系
  2. 支持通过OpenAPI删除表级、字段级血缘关系


特性 6:支持增删改的数据操作类API

场景:

在数字化转型和智能化升级的浪潮中,企业对数据驱动能力的需求日益增长。为了帮助企业更高效、安全地管理和利用数据,Dataphin 5.4 版本推出了全新的增删改 API 功能,让开发团队能够以更低的成本和更短的时间将数据库中的数据转化为可管理且安全的 API 接口。

  • AI 编程与智能应用:快速为智能助手、自动化脚本或微服务提供结构化数据接口,简化API编程和数据应用中的数据接入工作,减少定制开发成本。支持实时或批量的数据读取/写回,确保数据访问的安全性和可追溯性。
  • 数据集成与ETL:轻松构建用于数据迁移、同步或集成的增删改 API,实现不同系统间的数据流转。支持参数化查询与批量操作,简化定时任务与数据流水线的开发和维护,提高数据处理效率。
  • 内部工具与业务中台:为后台管理系统、运营工具、BI 报表及移动端应用快速生成标准化的 CRUD 接口,缩短前后端联调周期。通过配置实现字段映射、输入校验与数据变换,提高一致性和安全性。
  • 低代码/无代码与快速原型:非技术人员也能通过简单配置生成所需的数据 API,加速原型验证与业务流程自动化落地。自动生成详细的 API 文档、示例请求及返回结构定义,降低使用门槛。

借助 Dataphin 5.4 的新增删改 API 功能,企业可以更加高效地管理和利用数据资源,加速业务创新与发展,充分释放数据的价值。

功能概览:

  1. 可视化创建:通过直观易用的界面,用户无需编写代码即可快速创建增删改 API,大大降低了技术门槛。
  2. 参数校验与默认值填充:自动进行参数校验并填充默认值,确保数据的完整性和合法性。
  3. 批量操作:支持单条和批量数据操作,性能更优,满足大规模数据处理需求。
  4. 事务控制:灵活选择单事务、无事务或分批独立事务模式,保证数据的一致性和可靠性。
  5. 错误处理与详细反馈:提供详尽的错误处理机制,支持部分成功和全部成功的选项,并返回具体的成功和失败记录,便于问题排查。
  6. 性能优化:针对不同数据量和并发情况自动优化性能,如批量操作时自动调整 JDBC 连接设置。
  7. 权限管理:支持 API 级别的权限申请,保障数据安全,目前暂不支持行级权限。
  8. 多种数据源支持:兼容 MySQL、Oracle、Microsoft SQL Server 和 PostgreSQL 等主流数据库,满足多样化的企业需求。


特性 7:行级权限支持申请

当前问题:

分析师在取数时发现,编写的SQL在执行后总是返回空数据。一番查找后,发现自己所查询的表命中了行级权限,系统自动添加了Where语句。在之前的版本中,分析师只能找管理员进行授权,无法自行申请。

功能概览:

  1. 清晰可见:代码开发者能清晰知道自己所查询的哪张表开启了行级权限、命中什么行级权限规则;
  2. 操作简便:支持用户一键申请字段权限+行级权限,也支持单独申请行级权限。



特性 8:支持查看注册调度集群的资源消耗趋势

场景:

Dataphin支持通过注册调度集群连接其余网络中的数据源,从而避免任务调度需要跨网络传输数据。为了高效分配和管理任务资源,集群管理员期望可以看见整个集群和不同资源组的资源消耗趋势。

功能概览:

  1. 界面配置:支持界面配置注册调度集群的Prometheus HTTP API和认证方式;
  2. 灵活操作和指标丰富:支持将注册调度集群设置为默认展示集群,支持查看集群下不同资源组的资源消耗趋势。

--使用须知:需要提前在注册调度集群中安装Prometheus组件




Dataphin 将持续迭代技术深度与场景覆盖能力,更多精彩功能,敬请期待!

相关文章
|
SQL 人工智能 分布式计算
【产品升级】Dataphin V5.3 全新上线:四大能力升级,数据管理更统一、更智能!
V5.3版本,Dataphin推出众多重磅功能:例如,全新的智能应用:X-数据标准、X-数据安全以及智能应用反馈看板;更前沿的数据研发能力:利用SelectDB/Doris/StarRocks查询加速Hive和MaxCompute的离线引擎、全面支持Paimon格式的数据湖构建;资产运营和数据服务持续提效。
589 0
|
4月前
|
SQL 数据可视化 大数据
Dataphin数据血缘:实现全面追溯,保障流转透明
数据血缘揭示数据从源头到应用的全链路流转关系,助力企业厘清数据来源、影响范围与质量问题根源。Dataphin通过自动采集、手动配置和OpenAPI注册三类方式构建全面的数据血缘,支持可视化展示与用于质量问题溯源,实现数据可查、可信、可管,推动高质量数据治理。
490 1
|
4月前
|
数据采集 人工智能
Dataphin X-数据质量,智能分析质量问题并推荐整改建议
针对数据治理中质量问题难发现、根因定位难、整改效率低等痛点,推出AI驱动的数据质量问题智能分析功能。通过智能分析异常、追溯根因、构建数据证据链,自动生成含改进建议与影响评估的质量报告,提升治理效率与决策可靠性。
219 3
|
3月前
|
数据采集 人工智能 运维
Dataphin功能Tips系列(85)告别“人肉排障”:AI驱动数据质量根因诊断,让治理效率跃升
传统数据治理中,数据质量问题依赖人工排查,效率低且难定位根因。Dataphin 5.4推出X-数据质量根因诊断功能,基于AI大模型分析数据血缘与采样,智能定位问题源头,自动生成整改建议与影响评估,实现从发现问题到闭环治理的自动化,大幅提升治理效率与准确性。
157 0
|
3月前
|
SQL 自然语言处理 BI
Dataphin功能Tips系列(87)Dataphin「X-分析」:自然语言开启自助取数新时代
Dataphin推出【X-分析】Agent,支持非技术用户通过自然语言提问,自动生成SQL并执行查询,快速获取数据结果。用户可新建分析专辑,结合业务数据与提示词优化模型理解,实现精准取数。支持SQL审核编辑、保存至Notebook或一键创建Quick BI数据集,打通从查询到分析的全流程,降低人力成本,提升数据消费效率,助力业务自助高效用数。
134 0
Dataphin功能Tips系列(87)Dataphin「X-分析」:自然语言开启自助取数新时代
|
3月前
|
存储 分布式计算 Hadoop
Dataphin功能Tips系列(86)Dataphin“查询加速”方案:提升大表分析性能,节省存储保障数据一致性
Dataphin推出“查询加速”功能,无需数据同步,通过一键映射外部Catalog,实现对MaxCompute/Hadoop大表的透明加速。利用StarRocks等引擎秒级响应即席查询,保障权限统一与数据安全,降低存储成本与运维压力。
|
4月前
|
SQL 关系型数据库 MySQL
释放数据潜能,加速业务创新 —— Dataphin 5.4 新增删改API功能
Dataphin 5.4推出数据增删改API功能,支持通过配置SQL快速生成安全、可管理的CRUD接口,覆盖AI编程、数据集成、低代码等场景,降低开发成本,提升数据治理与安全性,助力企业高效释放数据价值。
328 0
|
2月前
|
大数据 调度
实时数据入湖消费闭环利器:新增检查节点,破解离线任务依赖校验难题
新增“检查节点”功能,通过精准位点校验与灵活配置,解决实时数据入湖后离线任务依赖判断难题,提升数据链路稳定性与研发效率。
109 3
|
6月前
|
存储 SQL 分布式计算
终于!大数据分析不用再“又要快又要省钱”二选一了!Dataphin新功能太香了!
Dataphin推出查询加速新功能,支持用StarRocks等引擎直连MaxCompute或Hadoop查原始数据,无需同步、秒级响应。数据只存一份,省成本、提效率,权限统一管理,打破“又要快又要省”的不可能三角,助力企业实现分析自由。
329 49