DataWorks数据集成离线增量同步配置讲解

简介: 本篇为熟能生巧系列19期的离线增量同步讲解部分,鉴于用户咨询需求,单独成一篇,方便大家阅览

我们以MySQL数据增量同步到MaxCompute(ODPS)为例。

首先示例中我们创建了一个MySQL的数据库以及示例表demo_wpw_addsync。

该表有3列,分别存储id、name和时间戳

1.png

表内现在有一条8月8日的数据,我们需要配置增量同步规则,将这条数据同步到Max Compute中。

接下来我们进入到DataWorks数据开发界面,使用Di节点配置数据集成同步任务。

2.png

可以看到“数据来源”我们配置了刚才的MySQL数据库,“数据去向”是我们的一个ODPS实例里一张名字相同的表,列字段和MySQL保持一致。这里重点是数据过滤的条件配置,这里我们配置了col3 >=’${bizdate} 00:00:00’ 。意思就是源端数据抽取时col3这列的值要大于等于我们配置的值,col3我们存的是数据的时间戳,bizdate是我们配置的一个参数变量。

3参数配置.png

点开调度配置我们可以看到参数这栏里我们配置bizdate = ${yyyy-mm-dd+1},也就是取“业务时间+1”天,一般离线同步今天同步昨天的数据,示例中当天是8月8日,所以业务时间为8月7日,那么加一天就是8月8日了。

我们将任务提交后,可以去运维中心开发环境测试运行

4.png

右键点击节点后点测试

5.png

弹出来冒烟测试框,可以看到业务日期是8月7日,我们直接点确定新建实例运行测试


6.png

我们点击最新的实例,点击“查看日志”,可以查看执行日志

7.png

可以看到实际执行时变量bizdate解析成了8月8日


8.png

这样我们实际读取MySQL时,where条件就会解析成col3 >= ’2021-08-08 00:00:00’,也就是创建时时间戳大于8月8日0点的数据都会被读取


9.png


我们在DataWorks中可以查询ODPS表,可以看到MySQL中的这条数据已经同步过来了。当然,我们可以设置更加复杂的数据过滤条件,来满足实际使用的场景需要


10.png

比如上图中,我们在右侧“参数”配置中,定义了 bizdate、canshu2、bizdate2这三个参数,分别赋值‘${yyyy-mm-dd+1}’、‘$[hh24:mi:ss]’、‘${yyyy-mm-dd+2}’。

最终bizdate=20210808,canshu2= 00:29:00,bizdate2=20210809。这里canshu2取值是等于定时调度时间。


对调度参数不熟悉的用户,调度参数配置规则可以查看这篇文章:

https://developer.aliyun.com/article/784963


那么左侧的数据过滤条件就会解析成col3 >= ‘20210808 00:29:00’ and col3 <= ‘20210809 23:59:59’

也就是8月8日定时调度时间之后到8月9日最后一秒钟(8月10日前)的所有数据。

这里的条件依用户的使用场景定义即可。


增量同步的核心就是数据源存在一个DateTime类型的列,通过定义调度参数以及该列的过滤条件,来实现增量同步。实际任务执行时是每天一次,业务日期自动顺延,那bizdate解析出来的日期也会自动增加。


另外,实时同步的话大体都是增量同步的,需要注意的是配置一个重置位点

11.png

通常大家数据上云时会做一次全量同步后增量同步的配置,增量同步任务如果需要修改配置的话可以先暂停任务,记下任务暂停时间,然后重启任务时配置这个“重置位点”,取任务暂停时间,这样,实时同步任务会从重置位点向后同步数据,避免重复消费之前的数据。


DataWorks使用过程中有任何问题,欢迎加入我们的大群咨询:

https://developer.aliyun.com/article/740906






相关文章
|
传感器 人工智能 自然语言处理
火热邀测!DataWorks数据集成支持大模型AI处理
阿里云DataWorks数据集成新增大模型AI处理功能,支持在数据同步中无缝调用通义千问等AI模型,实现文本翻译、情感分析、摘要生成等功能。适用于电商客服、智能汽车、供应链、医疗、金融、法律及教育等多个场景,大幅提升数据处理效率与洞察深度。用户可通过自然语言配置,快速完成高级数据分析与处理,无需额外部署调试。立即申请测试资格,体验智能化数据处理!
1812 4
火热邀测!DataWorks数据集成支持大模型AI处理
|
数据采集 运维 DataWorks
DataWorks 千万级任务调度与全链路集成开发治理赋能智能驾驶技术突破
智能驾驶数据预处理面临数据孤岛、任务爆炸与开发运维一体化三大挑战。DataWorks提供一站式的解决方案,支持千万级任务调度、多源数据集成及全链路数据开发,助力智能驾驶模型数据处理与模型训练高效落地。
1097 0
|
测试技术 数据处理 调度
Dataphin功能Tips系列(57)「预览」vs「运行」:离线集成的神奇按钮
在数据开发过程中,使用Dataphin处理离线集成任务时,可能遇到数据过滤和字段计算组件配置正确性的验证问题。通过「预览」功能,可快速验证处理逻辑而不影响目标表;对于需要调度的任务,担心资源占用和耗时超出预期时,可使用「运行」功能进行全流程测试,评估实际耗时与资源消耗。「预览」适合逻辑验证,「运行」用于真实环境模拟,两者结合助力高效开发与调试。
409 5
|
SQL Java 关系型数据库
Dataphin功能Tips系列(53)-离线集成任务如何合理配置JVM资源
本文探讨了将MySQL数据同步至Hive时出现OOM问题的解决方案。
482 5
|
人工智能 自然语言处理 DataWorks
DataWorks Copilot 集成Qwen3-235B-A22B混合推理模型,数据开发与分析效率再升级!
阿里云DataWorks平台正式接入Qwen3模型,支持最大235B参数量。用户可通过DataWorks Copilot智能助手调用该模型,以自然语言交互实现代码生成、优化、解释及纠错等功能,大幅提升数据开发与分析效率。Qwen3作为最新一代大语言模型,具备混合专家(MoE)和稠密(Dense)架构,适应多种应用场景,并支持MCP协议优化复杂任务处理。目前,用户可通过DataWorks Data Studio新版本体验此功能。
2955 23
DataWorks Copilot 集成Qwen3-235B-A22B混合推理模型,数据开发与分析效率再升级!
|
JSON JavaScript API
MCP 实战:用配置与真实代码玩转 GitHub 集成
MCP 实战:用配置与真实代码玩转 GitHub 集成
2983 4
|
缓存 前端开发 API
(网页系统集成CAD功能)在线CAD中配置属性的使用教程
本文介绍了Mxcad SDK在线预览和编辑CAD图纸的功能及配置方法。通过Vite、CDN或Webpack实现集成,用户可自定义设置以满足项目需求。主要内容包括:1)`createMxCad()`方法的初始属性配置,如画布ID、WASM文件路径、字体加载路径等;2)`MxFun.setIniset()`方法提供的更多CAD初始配置;3)`McObject`对象API用于动态调整视图背景色、浏览模式等。此外,还提供了在线Demo(https://demo2.mxdraw3d.com:3000/mxcad/)供用户测试实时效果。
|
DataWorks 监控 数据建模
DataWorks产品体验评测
DataWorks产品体验评测
|
数据采集 人工智能 DataWorks
DataWorks产品最佳实践测评
DataWorks产品最佳实践测评
|
SQL DataWorks 搜索推荐
DataWorks产品评测与最佳实践体验报告
DataWorks是阿里巴巴云推出的一款高效数据处理平台,通过内置的数据集成工具和ETL功能,实现了多源数据的自动化处理与分析。本文介绍了DataWorks在用户画像分析中的应用实践,展示了其如何帮助企业高效管理数据资源,支持决策制定及营销优化。同时,文章还评测了DataWorks的产品体验,包括开通流程、功能满足度等方面,并与其它数据开发平台进行了比较,突出了DataWorks在易用性、性能和生态完整性上的优势。最后,对Data Studio新版本中的Notebook环境进行了初步探索,强调了其在提升开发效率方面的价值。
610 16

相关产品

  • 大数据开发治理平台 DataWorks