开发者社区大数据文章正文

【Spark Summit East 2017】Kafka、YARN与Spark Streaming作为一个服务

2017-02-20 3622

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 本讲义出自Jim Dowling在Spark Summit East 2017上的演讲，主要介绍了在容易进行调试的YARN上构建多租户Spark streaming应用程序的过程中遇到的挑战，并展示了如何使用ELK技术栈对Spark streaming应用程序进行日志记录和调试，以及如何使用Graphana和Graphite对应用进行监控以及优化以及使用Dr Elephant终止Spark streaming任务。

更多精彩内容参见云栖社区大数据频道https://yq.aliyun.com/big-data；此外，通过Maxcompute及其配套产品，低廉的大数据分析仅需几步，详情访问https://www.aliyun.com/product/odps。

本讲义出自Jim Dowling在Spark Summit East 2017上的演讲，主要介绍了在容易进行调试的YARN上构建多租户Spark streaming应用程序的过程中遇到的挑战，并展示了如何使用ELK技术栈对Spark streaming应用程序进行日志记录和调试，以及如何使用Graphana和Graphite对应用进行监控以及优化以及使用Dr Elephant终止Spark streaming任务。

492b1ca960022958ad63a93f1998dea1ac034d7d

7b66b3701a1091c381306813faed697c15e24b39

02871e535180064c299d98d52163f67aa1a7ae70

13706f08e976f171c55e70b5b4d754997fdf34bb

293a94a22a18a869d71e6de0aa47d16c2476713c

e02c364b450414cd0baec8fe62126db64ac49448

c7932676561028e07ac5176a832b7947588a39db

5039b973479339465e8bb29162173a08d9ba1ee1

13ef0c332b9357de845b7e46825d16a8781c4fce

f6b2e978164d9177e21f20fb00626688450a653a

f5bfa0b68262925a3737022d0067d90b5a8c7c81

9ebca785fcf9156e1cd2889decd81a1d31eeae07

f6dd6d30c256d9a5153bebe39f9b20bc052912a2

03349a99901633e32e769e38add8e175de63639a

d80238814c61daf82fc9d5cae4534f25cb679cf5

873a5470ca02cbb9c51d9ec2db0dec4d271c408d

39fc8943328997e335522a893537728c00a7b0c6

0e7414c1c345625e35c27ce4c9fc8ce06e69a175

979aa165d6875735b22bd9b52c160b51fc958a6e

39f78ec224143b13b97e98bf2c308b9638d5486a

80e44c967c73022e15ba0f7fd8e965e5d0c3ff32

a5734d1c5a5602f94092b2d257a0aea74d77a026

69a306ab2505b9641d223cee47c0864be85f94b4

302924497d2a15f81b4a9841f3ea761254ad7ef4

3baf35608840b9757bc505384fa55b478d625251

6d4eea35e72a3286e314a7c679e8456119068518

f5bb21edb933e9702c46c7cbe85e624e390a50cb

0756d53824c764ef6015fa7be0ce715c4cc07e87

c52c569790c1a82f75d2f85b61f8d0234bb75b4e

18095263c9b36295b440c441135e4757ee47e1b7

b7aaf2b91ddaeae706989010550656fb759348ab

c0fc7314d602ed3670b3de1c7d448454e1c4769d

acdf80e3d585f20c3f974feca847202228b7fcc4

65b87a5b6d4be2df40d28c958fb7e95e902adba0

8a1ad3795ece0f2b720c4f9fb9e38f1db6abec68

db03753a43d419aa6d21a80dea6340160312ecc5

589951dd57a433e8c424e2d78f695b87d2a5a0b2

文章标签：

云消息队列 Kafka 版

分布式计算

监控

大数据

Spark

流计算

关键词：

apache spark streaming

apache spark yarn

apache spark kafka

spark云消息队列 Kafka 版

云消息队列 Kafka 版服务

小猫吃鱼569

武子康

2月前

消息中间件分布式计算 NoSQL

大数据-104 Spark Streaming Kafka Offset Scala实现Redis管理Offset并更新

武子康

48 0 0

武子康

2月前

消息中间件存储分布式计算

大数据-103 Spark Streaming Kafka Offset管理详解 Scala自定义Offset

武子康

104 0 0

众所周知

1月前

分布式计算资源调度 Hadoop

Spark Standalone与YARN的区别？

本文详细解析了 Apache Spark 的两种常见部署模式：Standalone 和 YARN。Standalone 模式自带轻量级集群管理服务，适合小规模集群；YARN 模式与 Hadoop 生态系统集成，适合大规模生产环境。文章通过示例代码展示了如何在两种模式下运行 Spark 应用程序，并总结了两者的优缺点，帮助读者根据需求选择合适的部署模式。

众所周知

80 3 3

赵渝强老师

1月前

分布式计算流计算 Spark

【赵渝强老师】Spark Streaming中的DStream

本文介绍了Spark Streaming的核心概念DStream，即离散流。DStream通过时间间隔将连续的数据流转换为一系列不连续的RDD，再通过Transformation进行转换，实现流式数据的处理。文中以MyNetworkWordCount程序为例，展示了DStream生成RDD的过程，并附有视频讲解。

赵渝强老师

49 0 0

众所周知

2月前

分布式计算资源调度 Hadoop

Spark Standalone与YARN的区别？

【10月更文挑战第5天】随着大数据处理需求的增长，Apache Spark 成为了广泛采用的大数据处理框架。本文详细解析了 Spark Standalone 与 YARN 两种常见部署模式的区别，并通过示例代码展示了如何在不同模式下运行 Spark 应用程序。Standalone 模式自带轻量级集群管理，适合小规模集群或独立部署；YARN 则作为外部资源管理器，能够与 Hadoop 生态系统中的其他应用共享资源，更适合大规模生产环境。文章对比了两者的资源管理、部署灵活性、扩展性和集成能力，帮助读者根据需求选择合适的部署模式。

众所周知

40 1 1

武子康

2月前

消息中间件分布式计算 Kafka

大数据-102 Spark Streaming Kafka ReceiveApproach DirectApproach 附带Producer、DStream代码案例

武子康

61 0 0

武子康

2月前

SQL 分布式计算大数据

大数据-101 Spark Streaming DStream转换窗口操作状态跟踪操作附带多个案例（一）

武子康

58 0 0

尹正杰

3月前

资源调度分布式计算 Hadoop

YARN(Hadoop操作系统)的架构

本文详细解释了YARN（Hadoop操作系统）的架构，包括其主要组件如ResourceManager、NodeManager和ApplicationMaster的作用以及它们如何协同工作来管理Hadoop集群中的资源和调度作业。

尹正杰

173 3 3

尹正杰

3月前

资源调度分布式计算 Hadoop

使用YARN命令管理Hadoop作业

本文介绍了如何使用YARN命令来管理Hadoop作业，包括查看作业列表、检查作业状态、杀死作业、获取作业日志以及检查节点和队列状态等操作。

尹正杰

78 1 1

土木林森

4月前

资源调度分布式计算算法

【揭秘Yarn调度秘籍】打破资源分配的枷锁，Hadoop Yarn权重调度全攻略！

【8月更文挑战第24天】在大数据处理领域，Hadoop Yarn 是一种关键的作业调度与集群资源管理工具。它支持多种调度器以适应不同需求，默认采用FIFO调度器，但可通过引入基于权重的调度算法来提高资源利用率。该算法根据作业或用户的权重值决定资源分配比例，权重高的可获得更多计算资源，特别适合多用户共享环境。管理员需在Yarn配置文件中启用特定调度器（如CapacityScheduler），并通过设置队列权重来实现资源的动态调整。合理配置权重有助于避免资源浪费，确保集群高效运行，满足不同用户需求。

土木林森

71 3 3

【Spark Summit East 2017】Kafka、YARN与Spark Streaming作为一个服务

热门文章

最新文章

相关课程

相关电子书

热门

活动广场

任务中心

开发者评测

高校计划

乘风者计划

训练营

阿里云MVP

话题

直播

下载

镜像站

技术资料

插件

【Spark Summit East 2017】Kafka、YARN与Spark Streaming作为一个服务

热门文章

最新文章

相关课程

相关电子书