Spark Streaming 妙用之实现工作流调度器

本文涉及的产品
云数据库 RDS MySQL,集群系列 2核4GB
推荐场景:
搭建个人博客
RDS MySQL Serverless 基础系列,0.5-2RCU 50GB
公共DNS(含HTTPDNS解析),每月1000万次HTTP解析
简介:

之前有说过要设计一个工作流调度器。开发一个完善的工作流调度器应该并不是一件简单的事情。但是通过Spark Streaming(基于Transfomer架构的理念),我们可能能简化这些工作。我在这块并没有什么经验,这只是一个存在于脑海中的东西。

下面是Azkaban的架构图:

也就是说要搭建一个稳定可靠的Azkaban的工作流调度器,你可能需要

  • 两台 互为主备MySQL
  • 两台Executor Server
  • 一台Web Server

你需要做架构设计,考虑WebServer 和 Executor Server的通讯问题

扩展性问题。Executor 能够动态调整?

稳定性问题。毕竟24小时运行的

然而,我们其实是不需要关注这么多东西的。我们真正关注的是:

  • Web UI
  • 工作流的生成,解析,运行和存储

其他的都是基础设施。按照Transfomer架构的设计理念,我们应该可以找到一个Estimator ,作为我们的基础设施,我们只要关注上面两点即可,不需要为部署,高可用,稳定等发愁。同时我们也希望譬如WebUI等工作不是从头开始,而是按部就班添加新功即可。所以有了Estimator,我们只要做三点:

  • 实现业务逻辑,也就是工作流的生成,解析,运行和存储等操作。
  • 实现管理页面逻辑
  • 指定需要的资源cpu/内存,就能Run起来这个Transformer

我搜罗了一圈,发现Spark Streaming 是能够满足该需求的一个Estimator。

这得益于,Spark Streaming 从某个角度而言就是个定时任务调度系统,也就是我们说的微批处理。对于工作流调度器而言,无非就是每个周期(duration)在Driver端启动线程扫描MySQL,实现任务的分发和执行。

那如果实现一个类似Azkaban 能够的做的事情,前面我们提到,要做三件事情,分别对应为:

1.实现业务逻辑,也就是工作流的生成,解析,运行和存储等操作。其中生成,解析,存储 三个环节可以放在Driver端,也可以都放在Executor 端。也就是说:Driver的设计可重可轻。重的设计可由Driver读取MySQL 并且解析成工作流任务,然后发送给Executor 去执行。轻的设计Driver仅仅是读取MySQL,然后就简单将id分发给各个Executor,各个Executor 负责解析执行和反馈结果。

2.增强 Spark Streaming UI,添加管理页面,实现Azkaban Web Server类似界面。

3.按标准的Spark Streaming 程序提交该实现到集群即可完成部署。

我们看到,我们真正做到了只关注核心业务逻辑的实现,所谓部署,安装,运行等环节都实现了平台化(其实Estimator完成了)。 而且实现了资源的细粒度(CPU/内存)划分,而不再是以服务器为基本单元。

事实上,我们也可以将一个Spark Streaming当做一个crontab 任务,这样就自然具有了一个分布式的crontab系统,并且提供更友好的管理,甚至能将任务本身融入到crontab中。

后话

Spark Streaming 不一定是最合适的Estimator,你可以自己实现一套类似的Estimator,最终形成所谓的 Azkaban On Yarn的程序。

作者:祝威廉

来源:51CTO

相关实践学习
如何在云端创建MySQL数据库
开始实验后,系统会自动创建一台自建MySQL的 源数据库 ECS 实例和一台 目标数据库 RDS。
全面了解阿里云能为你做什么
阿里云在全球各地部署高效节能的绿色数据中心,利用清洁计算为万物互联的新世界提供源源不断的能源动力,目前开服的区域包括中国(华北、华东、华南、香港)、新加坡、美国(美东、美西)、欧洲、中东、澳大利亚、日本。目前阿里云的产品涵盖弹性计算、数据库、存储与CDN、分析与搜索、云通信、网络、管理与监控、应用服务、互联网中间件、移动服务、视频服务等。通过本课程,来了解阿里云能够为你的业务带来哪些帮助     相关的阿里云产品:云服务器ECS 云服务器 ECS(Elastic Compute Service)是一种弹性可伸缩的计算服务,助您降低 IT 成本,提升运维效率,使您更专注于核心业务创新。产品详情: https://www.aliyun.com/product/ecs
相关文章
|
机器学习/深度学习 SQL 存储
图解大数据 | 工作流与特征工程@Spark机器学习
本文介绍Spark中用于大数据机器学习的板块MLlib/ML,讲解机器学习工作流(Pipeline)及其构建方式,并详解讲解基于DataFrame的Spark ML特征工程,包括二值化、定边界离散化、标准化、特征抽取等。
574 0
图解大数据 | 工作流与特征工程@Spark机器学习
|
分布式计算 大数据 Java
Apache Spark + 海豚调度:PB 级数据调度挑战,教你如何构建高效离线工作流
Apache Spark Meetup | 1 月线上直播报名通道已开启,赶快报名预约吧!
549 0
Apache Spark + 海豚调度:PB 级数据调度挑战,教你如何构建高效离线工作流
|
机器学习/深度学习 数据采集 分布式计算
大数据 | Spark机器学习工作流开发指南
Spark.ml是在Spark 1.2开始引入的一个包,它旨在提供一套统一的高级API,帮助用户创建和优化实用的机器学习工作流,它在原来的MLlib的基础上进行了大量的改进和优化,让Spark生态更见坚不可摧,本文就来详细介绍一下Spark机器学习工作流的基本概念和用法。
大数据 | Spark机器学习工作流开发指南
|
SQL 存储 分布式计算
【译】使用Spark SQL 运行大规模基因组工作流
将数据提取到Spark中是大多数大数据作业的第一步,但这并不是大数据旅途的终点。
|
分布式计算 Spark SQL
【译】使用Spark SQL 运行大规模基因组工作流
原文链接:https://databricks.com/blog/2019/06/26/scaling-genomic-workflows-with-spark-sql-bgen-and-vcf-readers.html
1769 0
|
分布式计算 调度 Spark
Spark DAG调度器事件循环处理器
Spark DAG调度器事件循环处理器 更多资源 github: https://github.com/opensourceteams/spark-scala-maven csdn(汇总视频在线看): https://blog.
1671 0
|
存储 分布式计算 资源调度
|
机器学习/深度学习 分布式计算 Apache

相关实验场景

更多