【Spark Summit East 2017】虚拟化分析,Spark是最好的答案么?

简介: 本讲义出自Arsalan Tavakoli在Spark Summit East 2017上的演讲,主要对于虚拟化分析的技术路线的发展进行了探讨。

更多精彩内容参见云栖社区大数据频道https://yq.aliyun.com/big-data;此外,通过Maxcompute及其配套产品,低廉的大数据分析仅需几步,详情访问https://www.aliyun.com/product/odps

本讲义出自Arsalan Tavakoli在Spark Summit East 2017上的演讲,主要对于虚拟化分析的技术路线的发展进行了探讨。


对于企业而言,往往希望数据积累的越多,获取的智能也就越多。但是怎样才能做到这一点呢?其实需要依靠三大支撑:数据、分析以及人。面对参差不齐并且传播速度非常快的大量数据,多种多样,越来越复杂的分析手段以及需要涉及更多的人、更多的职责以及人与人之间工作交接的低效的挑战,今天的技术栈足以应对了么?


从最初的数据仓库、到第二代的Hadoop+Data Lake,再到如今,经过了三代技术栈的更新,目前Databricks + Apache Spark成为了最好的解决方案,然而技术还需要不断进步与发展。


a0263ca2857d0968ca271b7e62a104215cb55c99

c5fac30c6814da8dd2b973b5b8bc538a6aa2adb9

6cf7945a3e3857073b71e2e956095aa1da212d73

f1b3f08f4214a5ae15dc33dad9bee89cbddb4932

0795ac9dfb73aa280cdee81712549aebc4dac63c


1ab509b776a4dae9d664d66c9a654a3e0d6adf96

15692d3237c54a8a8e5662972e4066263dabc92d

6ebc2aa6fb5239900adca588598157114bb4b457

9c237def3a42efa78c865a21f4c0674976dbe115

b95d11c5d28c80172a7392b5c421d2ab9e400d70

f160e386635920356732532ce0718d45865a24df

d9fa91f277f907dd4813de734e0d5f489dae94d3

784d9f8f9b9ce2c97a15596b1f6759cc810a8fbc

011c19a1818cba30c5f4cdc4d70703fabd62030e

c3e5f2eeb0e7a6e86436daa770eb36a21fc46ebf






相关文章
|
2月前
|
机器学习/深度学习 分布式计算 算法
Spark快速大数据分析PDF下载读书分享推荐
《Spark快速大数据分析》适合初学者,聚焦Spark实用技巧,同时深入核心概念。作者团队来自Databricks,书中详述Spark 3.0新特性,结合机器学习展示大数据分析。Spark是大数据分析的首选工具,本书助你驾驭这一利器。[PDF下载链接][1]。 ![Spark Book Cover][2] [1]: https://zhangfeidezhu.com/?p=345 [2]: https://i-blog.csdnimg.cn/direct/6b851489ad1944548602766ea9d62136.png#pic_center
111 1
Spark快速大数据分析PDF下载读书分享推荐
|
4月前
|
移动开发 分布式计算 Spark
Spark的几种去重的原理分析
Spark的几种去重的原理分析
67 0
|
4月前
|
机器学习/深度学习 SQL 分布式计算
Apache Spark 的基本概念和在大数据分析中的应用
介绍 Apache Spark 的基本概念和在大数据分析中的应用
236 0
|
4月前
|
机器学习/深度学习 SQL 分布式计算
介绍 Apache Spark 的基本概念和在大数据分析中的应用。
介绍 Apache Spark 的基本概念和在大数据分析中的应用。
|
4月前
|
SQL 分布式计算 HIVE
Spark数据倾斜问题分析和解决
Spark数据倾斜问题分析和解决
70 0
|
2月前
|
弹性计算 分布式计算 Serverless
全托管一站式大规模数据处理和分析Serverless平台 | EMR Serverless Spark 评测
【7月更文挑战第6天】全托管一站式大规模数据处理和分析Serverless平台 | EMR Serverless Spark 评测
23681 42
|
4月前
|
SQL 分布式计算 监控
基于阿里云 EMR Serverless Spark 版快速搭建OSS日志分析应用
本文演示了使用 EMR Serverless Spark 产品搭建一个日志分析应用的全流程,包括数据开发和生产调度以及交互式查询等场景。
56571 7
基于阿里云 EMR Serverless Spark 版快速搭建OSS日志分析应用
|
3月前
|
机器学习/深度学习 数据采集 分布式计算
基于spark的大数据分析预测地震受灾情况的系统设计
基于spark的大数据分析预测地震受灾情况的系统设计
|
4月前
|
SQL 分布式计算 关系型数据库
Spark 分析计算连续三周登录的用户数
本文介绍了如何使用窗口函数`range between`来查询`login_time`为2022-03-10的用户最近连续三周的登录数。首先在MySQL中创建`log_data`表并插入数据,接着定义需求为找出该日期前连续三周活跃的用户数。通过Spark SQL,分步骤实现:1)确定统计周期,2)筛选符合条件的数据,3)计算用户连续登录状态。在初始实现中出现错误,因未考虑日期在周中的位置,修正后正确计算出活跃用户数。
|
3月前
|
分布式计算 定位技术 Scala
使用spark基于出租车GPS数据实现车辆数量统计以及北京每个城区的车辆位置点数分析
使用spark基于出租车GPS数据实现车辆数量统计以及北京每个城区的车辆位置点数分析