Dataphin功能Tips系列(92)如何方便快速地通过SQL取数实现定制化数据同步

简介: 本文介绍如何在Dataphin中实现MySQL到MaxCompute的T-1增量数据同步:通过离线集成任务,将MySQL输入组件切换为脚本模式,利用`querySql`配合`${extract_date}`动态参数(默认`${yyyy-MM-dd}`),精准抽取前一日订单数据,配置调度后即可全自动运行。

👉🏻场景

一家电商公司的核心交易数据存储在MySQL的 online_orders 表中,数据量每天都在快速增长。数据团队需要每日将前一天产生的新订单数据同步到MaxCompute的表中,用于后续的分析。如何在Dataphin中实现这一增量同步工作的自动化呢?

👉🏻 解决方案及功能

Dataphin 支持将输入输出组件快速转换为脚本模式组件或直接编写离线集成脚本,实现复杂任务编辑的能力。同时配合 querySql 配置项以及灵活的调度参数,可以轻松实现动态SQL过滤等复杂逻辑,满足定制化的数据抽取需求。我们以从MySQL抽取T-1数据到MaxCompute为例,具体实现步骤如下:

  1. 在「研发」-「数据集成」中,新建一个离线管道任务。从组件面板拖入MySQL输入和MaxCompute输出组件,完成组件连接、来源与目标端的配置。

  2. 在MySQL输入组件的配置面板,点击右上角的“切换到脚本模式”。

  3. 在脚本编辑器中,找到 parameter 参数块,在 connection 中添加 querySql参数并使用${extract_date}作为日期占位符写入SQL语句:
"querySql": [
  "SELECT {$需要查询的字段} FROM online_orders WHERE create_time >= '${extract_date} 00:00:00' AND create_time < DATE_ADD('${extract_date}', INTERVAL 1 DAY)"
  ]

  1. 进入「属性」-「运行参数」,将自定义的参数{extract_date}设置为本地变量并指定参数的默认值为${yyyy-MM-dd}。例如,2026年1月19号时,系统会自动把18号生成新增的订单数据同步进来。

  1. 最后,点击“运行”,为参数指定具体日期验证SQL逻辑是否正确。测试通过后,提交并发布该任务,它将根据调度周期自动运行,每天精准地抽取前一日的增量数据,实现完全自动化同步。

相关文章
|
5月前
|
Kubernetes 调度 流计算
Flink on Kubernetes 自定义镜像能力:让企业存量实时任务零成本迁移,实现统一平台管控
Dataphin推出Flink on Kubernetes自定义镜像能力,支持企业直接复用存量业务镜像与K8s配置,零代码改造、零环境风险完成实时任务迁移,实现“业务不动、管控升级”,兼顾稳定性与平台化治理。
212 0
|
5月前
|
数据可视化 定位技术
Dataphin功能Tips系列(96)Dataphin 构建外部数据系统血缘统一管理解决方案(2)
Dataphin通过OpenAPI支持外部系统血缘纳管,可基于Catalog/Schema/Env等属性组合注册表级与字段级血缘,补全全链路数据地图,实现跨系统血缘可视化与影响分析。
229 1
|
7月前
|
大数据 调度
实时数据入湖消费闭环利器:新增检查节点,破解离线任务依赖校验难题
新增“检查节点”功能,通过精准位点校验与灵活配置,解决实时数据入湖后离线任务依赖判断难题,提升数据链路稳定性与研发效率。
300 3
|
5月前
|
存储 数据采集 SQL
Dataphin功能Tips系列(91)统一采样配置,让样例数据“一次生成,多处可用”
Dataphin提供统一自动采样机制,预生成并集中管理样例数据,支持安全识别、数据预览、NL2SQL等多场景复用,避免重复查询,提升效率、节省资源。
188 3
|
5月前
|
SQL 数据可视化 开发者
Dataphin功能Tips系列(90)告别“查无数据”,行级权限自助申请功能上线
Dataphin推出行级权限可视化提示与自助申请功能,帮助分析师快速识别“无数据”原因(如被自动过滤),并一键提交权限申请。审批通过后即可查询全量数据,大幅降低沟通成本,提升分析效率。
230 8
|
5月前
|
数据可视化 定位技术
Dataphin功能Tips系列(94)Dataphin 构建外部数据系统血缘统一管理解决方案(1)
Dataphin支持通过OpenAPI注册外部系统血缘,补全全链路数据地图断点。提供BY_GUID/BY_PROPERTY两种方式,支持表级与字段级血缘纳管及可视化展示,助力血缘追溯与影响分析。
266 1
|
2月前
|
人工智能 运维 数据可视化
非结构化数据处理,为什么是Dataphin?
Dataphin V6.1重磅推出非结构化数据处理能力,支持文档、音视频、图片等多模态数据的一站式资产化治理:提供7类50+开箱即用算子、可视化DAG编排、文件+元数据混合管理、细粒度权限与动态脱敏,实现与结构化数据统一治理、血缘追踪和版本管控。
419 2
|
2月前
|
数据采集 人工智能 数据可视化
从数据到知识:Dataphin 知识图谱,重新定义企业智能决策
Dataphin知识图谱助力企业从PB级数据迈向可理解、可推理、可决策的知识智能。它深度融合数据研发体系,支持可视化建模、结构化/非结构化数据双通道入图、Schema全生命周期管理及GraphRAG问答,真正实现“数据即知识”。
531 0
从数据到知识:Dataphin 知识图谱,重新定义企业智能决策
|
9月前
|
SQL 数据可视化 大数据
Dataphin数据血缘:实现全面追溯,保障流转透明
数据血缘揭示数据从源头到应用的全链路流转关系,助力企业厘清数据来源、影响范围与质量问题根源。Dataphin通过自动采集、手动配置和OpenAPI注册三类方式构建全面的数据血缘,支持可视化展示与用于质量问题溯源,实现数据可查、可信、可管,推动高质量数据治理。
1064 1
|
8月前
|
SQL 自然语言处理 BI
Dataphin功能Tips系列(87)Dataphin「X-分析」:自然语言开启自助取数新时代
Dataphin推出【X-分析】Agent,支持非技术用户通过自然语言提问,自动生成SQL并执行查询,快速获取数据结果。用户可新建分析专辑,结合业务数据与提示词优化模型理解,实现精准取数。支持SQL审核编辑、保存至Notebook或一键创建Quick BI数据集,打通从查询到分析的全流程,降低人力成本,提升数据消费效率,助力业务自助高效用数。
353 0
Dataphin功能Tips系列(87)Dataphin「X-分析」:自然语言开启自助取数新时代