【云栖号案例 | 交通&物流】中邮智递通过数加和datav将系统和服务迁移到大数据平台

简介: 中邮智递数据平台发展到现在经历了四个阶段,最近通过数加和datav将系统和服务迁移到大数据平台,以及使用ADB实现实时OLAP达到低延迟、高并发。

云栖号案例库:【点击查看更多上云案例】
不知道怎么上云?看云栖号案例库,了解不同行业不同发展阶段的上云方案,助力你上云决策!

概述

中邮智递数据平台发展到现在经历了四个阶段:

(1) 直接在业务生产系统开发生成报表,提供业务部门查询
(2) 采用kettle等工具抽取各业务系统数据并处理生成报表
(3) 使用hive构建离线数据仓库,抽取业务数据统一处理并生成报表推送至报表系统
(4) canal+kafka+tidb构建实时数仓进行实时OLAP分析,spark streaming+kafka+redis构建实时数据展示

最近我们在尝试把现在ECS主机上的系统和服务迁移到阿里云的大数据平台中,例如数加和datav。以及使用ADB实现实时OLAP达到低延迟,高并发。

数加使用实例

我们将数据仓库一个非关键主题-基点模型的全部业务链路迁移到数加中,使用数加的数据集成可以进行数据加载和数据导出,数据开发可以进行数据仓库模型开发。能够进行调度依赖配置和血缘关系、生命周期管理,如图1所示。

数加的运维中心能够查看任务的运行情况,与历史运行情况的对比。以及查看具体的任务运行日志、配置告警监控,能够完美替换类似azkaban,airflow等工作流调度工具,如图2,3所示:

image

图1

image

图2

image

图3

数加数据集成模块自带各种数据源的接入,包括阿里云的各种组件以及一些常用的数据源。满足从关系数据库,现有大数据平台,nosql等数据源接入和导出数据。结构清楚,配置简单,避免了以前接入异构数据需要开发多种接入程序的问题。如图4所示。

image

图4

数加数据开发模块可以完成离线数据仓库hive的模型开发功能,如图5所示。数据管理模块可以查看数据开发概览,元数据管理、权限管理、血缘关系管理、查找数据,如图6所示。也可以通过客户端操作odps的数据,如图7所示。

image

图5

image

图6

image

图7

datav使用实例

中邮智递以前的实时数据大屏展示是由数据开发使用spark streaming+redis+前端开发的模式来完成的,优点是自定义程度比较高,前端同事可以使用各种图表框架进行数据实时展示,权限接入和业务系统接入也能完美兼容我们现在的统一系统接入平台。缺点当然也很明显,每次任务开发需要前端参与开发,需要占用前端开发资源,迭代的时效性也比较差。特别是一些非长期型的实时展示项目,需要快速迭代上线,一定时间周期之后会废弃。例如短期活动开展,类似双11营销活动,以前的开发模式就不是很适用。Datav可以同步简单配置使用各种图表和特性,非前端开发人员通过配置就能使用地图、散点图、柱状图、飞线,并将生成的图标发布到现有的统一业务接入系统.如图8所示。

image

图8

云栖号案例库:【点击查看更多上云案例】
不知道怎么上云?看云栖号案例库,了解不同行业不同发展阶段的上云方案,助力你上云决策!

相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
12月前
|
存储 数据采集 搜索推荐
Java 大视界 -- Java 大数据在智慧文旅旅游景区游客情感分析与服务改进中的应用实践(226)
本篇文章探讨了 Java 大数据在智慧文旅景区中的创新应用,重点分析了如何通过数据采集、情感分析与可视化等技术,挖掘游客情感需求,进而优化景区服务。文章结合实际案例,展示了 Java 在数据处理与智能推荐等方面的强大能力,为文旅行业的智慧化升级提供了可行路径。
Java 大视界 -- Java 大数据在智慧文旅旅游景区游客情感分析与服务改进中的应用实践(226)
|
12月前
|
机器学习/深度学习 传感器 大数据
大数据真能治堵吗?聊聊交通行业用数据疏通“城市血管”
大数据真能治堵吗?聊聊交通行业用数据疏通“城市血管”
378 4
|
自然语言处理 大数据 应用服务中间件
大数据-172 Elasticsearch 索引操作 与 IK 分词器 自定义停用词 Nginx 服务
大数据-172 Elasticsearch 索引操作 与 IK 分词器 自定义停用词 Nginx 服务
422 5
|
存储 数据采集 监控
大数据技术:开启智能决策与创新服务的新纪元
【10月更文挑战第5天】大数据技术:开启智能决策与创新服务的新纪元
|
存储 数据采集 数据可视化
Java 大视界 -- 基于 Java 的大数据可视化在城市交通拥堵溯源与治理策略展示中的应用(191)
本项目探索了基于Java的大数据可视化技术在城市交通拥堵溯源与治理策略中的应用。通过整合多源交通数据,利用Java生态中的大数据处理与可视化工具,构建了交通拥堵分析模型,并实现了拥堵成因的直观展示与治理效果的可视化评估。该方案为城市交通管理提供了科学、高效的决策支持,助力智慧城市建设。
|
分布式计算 搜索推荐 算法
Java 大视界 -- Java 大数据在智慧养老服务需求分析与个性化服务匹配中的应用(186)
本篇文章探讨了Java大数据技术在智慧养老服务需求分析与个性化服务匹配中的应用。通过整合老年人健康数据与行为数据,结合机器学习与推荐算法,实现对老年人健康风险的预测及个性化服务推荐,提升养老服务的智能化与精准化水平,助力智慧养老高质量发展。
|
SQL 缓存 监控
大数据之路:阿里巴巴大数据实践——实时技术与数据服务
实时技术通过流式架构实现数据的实时采集、处理与存储,支持高并发、低延迟的数据服务。架构涵盖数据分层、多流关联,结合Flink、Kafka等技术实现高效流计算。数据服务提供统一接口,支持SQL查询、数据推送与定时任务,保障数据实时性与可靠性。
1832 0
|
关系型数据库 MySQL 大数据
大数据新视界--大数据大厂之MySQL 数据库课程设计:MySQL 数据库 SQL 语句调优的进阶策略与实际案例(2-2)
本文延续前篇,深入探讨 MySQL 数据库 SQL 语句调优进阶策略。包括优化索引使用,介绍多种索引类型及避免索引失效等;调整数据库参数,如缓冲池、连接数和日志参数;还有分区表、垂直拆分等其他优化方法。通过实际案例分析展示调优效果。回顾与数据库课程设计相关文章,强调全面认识 MySQL 数据库重要性。为读者提供综合调优指导,确保数据库高效运行。
|
分布式计算 大数据 Linux
大数据体系知识学习(二):WordCount案例实现及错误总结
这篇文章介绍了如何使用PySpark进行WordCount操作,包括环境配置、代码实现、运行结果和遇到的错误。作者在运行过程中遇到了Py4JJavaError和JAVA_HOME未设置的问题,并通过导入findspark初始化和设置环境变量解决了这些问题。文章还讨论了groupByKey和reduceByKey的区别。
390 1
|
11月前
|
机器学习/深度学习 传感器 分布式计算
数据才是真救命的:聊聊如何用大数据提升灾难预警的精准度
数据才是真救命的:聊聊如何用大数据提升灾难预警的精准度
657 14