中邮智递阿里云大数据服务使用实例

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: 中邮智递数据平台发展到现在经历了四个阶段,最近正在尝试把现在ECS主机上的系统和服务迁移到阿里云的大数据平台中,那么中邮智递大数据平台时间离线究竟是什么样子的呢?

一、概述

中邮智递数据平台发展到现在经历了四个阶段:
(1) 直接在业务生产系统开发生成报表,提供业务部门查询
(2) 采用kettle等工具抽取各业务系统数据并处理生成报表
(3) 使用hive构建离线数据仓库,抽取业务数据统一处理并生成报表推送至报表系统
(4) canal+kafka+tidb构建实时数仓进行实时OLAP分析,spark streaming+kafka+redis构建实时数据展示
最近我们在尝试把现在ECS主机上的系统和服务迁移到阿里云的大数据平台中,例如数加和datav。以及使用ADB实现实时OLAP达到低延迟,高并发。

二、数加使用实例

我们将数据仓库一个非关键主题-基点模型的全部业务链路迁移到数加中,使用数加的数据集成可以进行数据加载和数据导出,数据开发可以进行数据仓库模型开发。能够进行调度依赖配置和血缘关系、生命周期管理,如图1所示。
数加的运维中心能够查看任务的运行情况,与历史运行情况的对比。以及查看具体的任务运行日志、配置告警监控,能够完美替换类似azkaban,airflow等工作流调度工具,如图2,3所示:

image.png

图1


image.png

图2


image.png

图3

数加数据集成模块自带各种数据源的接入,包括阿里云的各种组件以及一些常用的数据源。满足从关系数据库,现有大数据平台,nosql等数据源接入和导出数据。结构清楚,配置简单,避免了以前接入异构数据需要开发多种接入程序的问题。如图4所示.

image.png

图4

数加数据开发模块可以完成离线数据仓库hive的模型开发功能,如图5所示。数据管理模块可以查看数据开发概览,元数据管理、权限管理、血缘关系管理、查找数据,如图6所示。也可以通过客户端操作odps的数据,如图7所示。

image.png

图5


image.png

图6


image.png

图7

三、datav使用实例

中邮智递以前的实时数据大屏展示是由数据开发使用spark streaming+redis+前端开发的模式来完成的,优点是自定义程度比较高,前端同事可以使用各种图表框架进行数据实时展示,权限接入和业务系统接入也能完美兼容我们现在的统一系统接入平台。缺点当然也很明显,每次任务开发需要前端参与开发,需要占用前端开发资源,迭代的时效性也比较差。特别是一些非长期型的实时展示项目,需要快速迭代上线,一定时间周期之后会废弃。例如短期活动开展,类似双11营销活动,以前的开发模式就不是很适用。Datav可以同步简单配置使用各种图表和特性,非前端开发人员通过配置就能使用地图、散点图、柱状图、飞线,并将生成的图标发布到现有的统一业务接入系统.如图8所示。

image.png

图8

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
25天前
|
自然语言处理 大数据 应用服务中间件
大数据-172 Elasticsearch 索引操作 与 IK 分词器 自定义停用词 Nginx 服务
大数据-172 Elasticsearch 索引操作 与 IK 分词器 自定义停用词 Nginx 服务
50 5
|
25天前
|
存储 数据采集 监控
大数据技术:开启智能决策与创新服务的新纪元
【10月更文挑战第5天】大数据技术:开启智能决策与创新服务的新纪元
|
2天前
|
人工智能 Cloud Native 数据管理
媒体声音|重磅升级,阿里云发布首个“Data+AI”驱动的一站式多模数据平台
在2024云栖大会上,阿里云瑶池数据库发布了首个一站式多模数据管理平台DMS:OneMeta+OneOps。该平台由Data+AI驱动,兼容40余种数据源,实现跨云数据库、数据仓库、数据湖的统一数据治理,帮助用户高效提取和分析元数据,提升业务决策效率10倍。DMS已服务超10万企业客户,降低数据管理成本高达90%。
|
4天前
|
分布式计算 Java 开发工具
阿里云MaxCompute-XGBoost on Spark 极限梯度提升算法的分布式训练与模型持久化oss的实现与代码浅析
本文介绍了XGBoost在MaxCompute+OSS架构下模型持久化遇到的问题及其解决方案。首先简要介绍了XGBoost的特点和应用场景,随后详细描述了客户在将XGBoost on Spark任务从HDFS迁移到OSS时遇到的异常情况。通过分析异常堆栈和源代码,发现使用的`nativeBooster.saveModel`方法不支持OSS路径,而使用`write.overwrite().save`方法则能成功保存模型。最后提供了完整的Scala代码示例、Maven配置和提交命令,帮助用户顺利迁移模型存储路径。
|
27天前
|
消息中间件 监控 Ubuntu
大数据-54 Kafka 安装配置 环境变量配置 启动服务 Ubuntu配置 ZooKeeper
大数据-54 Kafka 安装配置 环境变量配置 启动服务 Ubuntu配置 ZooKeeper
63 3
大数据-54 Kafka 安装配置 环境变量配置 启动服务 Ubuntu配置 ZooKeeper
|
26天前
|
存储 分布式计算 druid
大数据-155 Apache Druid 架构与原理详解 数据存储 索引服务 压缩机制
大数据-155 Apache Druid 架构与原理详解 数据存储 索引服务 压缩机制
44 3
|
2月前
|
人工智能 分布式计算 DataWorks
连续四年!阿里云领跑中国公有云大数据平台
近日,国际数据公司(IDC)发布《中国大数据平台市场份额,2023:数智融合时代的真正到来》报告——2023年中国大数据平台公有云服务市场规模达72.2亿元人民币,其中阿里巴巴市场份额保持领先,占比达40.2%,连续四年排名第一。
177 12
|
2月前
|
人工智能 Cloud Native 数据管理
重磅升级,阿里云发布首个“Data+AI”驱动的一站式多模数据平台
阿里云发布首个AI多模数据管理平台DMS,助力业务决策提效10倍
272 17
|
2月前
|
SQL 人工智能 大数据
阿里云牵头起草!首个大数据批流融合国家标准发布
近日,国家市场监督管理总局、国家标准化管理委员会正式发布大数据领域首个批流融合国家标准GB/T 44216-2024《信息技术 大数据 批流融合计算技术要求》,该标准由阿里云牵头起草,并将于2025年2月1日起正式实施。
78 7
|
2月前
|
数据采集 分布式计算 MaxCompute
MaxCompute 分布式计算框架 MaxFrame 服务正式商业化公告
MaxCompute 分布式计算框架 MaxFrame 服务于北京时间2024年09月27日正式商业化!
69 3