Spark Streaming 妙用之实现工作流调度器

之前有说过要设计一个工作流调度器。开发一个完善的工作流调度器应该并不是一件简单的事情。但是通过Spark Streaming(基于Transfomer架构的理念),我们可能能简化这些工作。我在这块并没有什么经验,这只是一个存在于脑海中的东西。

下面是Azkaban的架构图:

也就是说要搭建一个稳定可靠的Azkaban的工作流调度器,你可能需要

  • 两台 互为主备MySQL
  • 两台Executor Server
  • 一台Web Server
  • 你需要做架构设计,考虑WebServer 和 Executor Server的通讯问题
  • 扩展性问题。Executor 能够动态调整?
  • 稳定性问题。毕竟24小时运行的

然而,我们其实是不需要关注这么多东西的。我们真正关注的是:

  • Web UI
  • 工作流的生成,解析,运行和存储

其他的都是基础设施。按照Transfomer架构的设计理念,我们应该可以找到一个Estimator ,作为我们的基础设施,我们只要关注上面两点即可,不需要为部署,高可用,稳定等发愁。同时我们也希望譬如WebUI等工作不是从头开始,而是按部就班添加新功即可。所以有了Estimator,我们只要做三点:

  • 实现业务逻辑,也就是工作流的生成,解析,运行和存储等操作。
  • 实现管理页面逻辑
  • 指定需要的资源cpu/内存,就能Run起来这个Transformer

我搜罗了一圈,发现Spark Streaming 是能够满足该需求的一个Estimator。

这得益于,Spark Streaming 从某个角度而言就是个定时任务调度系统,也就是我们说的微批处理。对于工作流调度器而言,无非就是每个周期(duration)在Driver端启动线程扫描MySQL,实现任务的分发和执行。

那如果实现一个类似Azkaban 能够的做的事情,前面我们提到,要做三件事情,分别对应为:

  1. 实现业务逻辑,也就是工作流的生成,解析,运行和存储等操作。其中生成解析存储 三个环节可以放在Driver端,也可以都放在Executor 端。也就是说:Driver的设计可重可轻。重的设计可由Driver读取MySQL 并且解析成工作流任务,然后发送给Executor 去执行。轻的设计Driver仅仅是读取MySQL,然后就简单将id分发给各个Executor,各个Executor 负责解析执行和反馈结果。
  2. 增强 Spark Streaming UI,添加管理页面,实现Azkaban Web Server类似界面。
  3. 按标准的Spark Streaming 程序提交该实现到集群即可完成部署。

我们看到,我们真正做到了只关注核心业务逻辑的实现,所谓部署,安装,运行等环节都实现了平台化(其实Estimator完成了)。 而且实现了资源的细粒度(CPU/内存)划分,而不再是以服务器为基本单元。

事实上,我们也可以将一个Spark Streaming当做一个crontab 任务,这样就自然具有了一个分布式的crontab系统,并且提供更友好的管理,甚至能将任务本身融入到crontab中。

后话

Spark Streaming 不一定是最合适的Estimator,你可以自己实现一套类似的Estimator,最终形成所谓的 Azkaban On Yarn的程序。

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏ytkah

“我的小程序”来了 新版微信v6.7.1下拉就能找到

  今天iOS版微信迎来v6.7.1正式版发布,本次升级主要是可以把常用的小程序添加到“我的小程序”。近期版本微信可以直接浏览订阅号的消息,扫一扫可拍照翻译整页...

7920
来自专栏FreeBuf

macOS 0-day漏洞详情披露,可被利用完全接管系统

2017 年 12 月 31 日,一名推特账号为 Siguza 的安全研究人员公布了 macOS 0-day 漏洞的详情。该漏洞是一个本地提权漏洞,影响到所有 ...

20570
来自专栏架构师小秘圈

日订单50万级分布式事务

作者:伈情,喜玩Java、Python、Golang!热爱架构设计、SOA、微服务、高并发、分布式、性能优化、DevOps、大数据、消息队列等....!在互联网...

89580
来自专栏嵌入式程序猿

赶快来更新你的bootloader吧

不知大家是否还记得在之前给大家介绍过NXP的kinetis bootloader1.2版本的, 嵌入式工程师必须会的技能:玩转bootloader 时隔一年多,...

38990
来自专栏架构师小秘圈

Hive极简教程

一、HIVE架构 Hive 是建立在 Hadoop 上的数据仓库基础构架。它提供了一系列的工具,可以用来进行数据提取转化加载(ETL),这是一种可以存储、查询和...

61460
来自专栏魏艾斯博客www.vpsss.net

owncloud 轻松搭建私有云盘 Windows/android/ios/Mac/Linux 全平台支持

1.4K30
来自专栏微服务生态

Faas,又一个未来?

云计算时代出现了大量XaaS形式的概念,从IaaS、PaaS、SaaS到容器云引领的CaaS,再到火热的微服务架构,以及现在越来越多被谈起的Serverless...

12940
来自专栏Java技术栈

ElasticJob-分布式作业调度神器,你们还在用Quartz吗?!

简介 Elastic-Job是一个分布式调度解决方案,由两个相互独立的子项目Elastic-Job-Lite和Elastic-Job-Cloud组成。 Ela...

48360
来自专栏PPV课数据科学社区

实用 | Apache Hadoop 3.0.0-alpha2版本发布

作者:Andrew Wang,Ray Chiang Andrew Wang是Cloudera公司HDFS团队的一名软件工程师、Apache Hadoop PMC...

28940
来自专栏编程一生

架构必会的性能指标及分析策略

12520

扫码关注云+社区

领取腾讯云代金券