【Spark Summit EU 2016】Apache Kudu&Spark SQL:对快数据进行快速分析

简介: 本讲义出自 Mike Percy在Spark Summit EU上的演讲,主要介绍了Cloudera开发的大型开源储存引擎 Kudu,该引擎用于储存和服务大量不同类型的非结构化数据,并且介绍了使用Kudu+Spark SQL对于数据进行快速分析的方法,并分享了多个使用Kudu+Spark SQL进行数据分析的实际案例。

更多精彩内容参见云栖社区大数据频道https://yq.aliyun.com/big-data;此外,通过Maxcompute及其配套产品,低廉的大数据分析仅需几步,详情访问https://www.aliyun.com/product/odps

本讲义出自 Mike Percy在Spark Summit EU上的演讲,主要介绍了Cloudera开发的大型开源储存引擎 Kudu,该引擎用于储存和服务大量不同类型的非结构化数据,并且介绍了使用Kudu+Spark SQL对于数据进行快速分析的方法,并分享了多个使用Kudu+Spark SQL进行数据分析的实际案例。


41eb70c4ff86f0995da0c3f99845799566f68d05

189bec42a6827768693dfcc82fc3f7d4d864effe

fddc86132c7eb3ca1d229a950e87d32d3a51f79f

0e3fe94d42c79ab6a3a827529707a370672a8032

9ac1180be026f2ab8b6d1aa5c809000d97e945b2

ac6e84d823968344e47a14498c8873e6080ae7e3

efeda8a0a8ea64fade1331458c7358820ad51169

a073e78e1d26f0121ea0dd924ef02c0dbb74812e

4e9434c2025d130421244ff0e913221e4bbe117a

2f90d649805c5b19485d74faf09f976e00fa430a

049c1090b31d6eedde85f1762734c253aa3c2873

92d45605846a51271e0a0eba29ccb6a5afc22cc8

4fa6c906fcd5f46f3fc71aeb8a0780d673d4de54

95bc9555073a20495d8f02a4464d70ca5d29b37b

a098f085db124abd6c7f05bbed4a0ef37ac18ae9

cb425d1fc6c5085d027bb5a0edc81b1d27117388

8a6c505b9e0265c2be3e3fa17fe09b2694a6a95e

3203fa966ac3d4cffe5437fc468ea05d9c35b735

e25607b47d1098a18b4b076db1d515607062f887

a60e9da8ef0da7dbf0dff6ee2c36ae35af4c40e2

ca677abb59a6f60e89b9820d46618d864062ddb1

ece3fd8d401aa2cc1589b697b36945c57b8f82d3

be0e560360ee7330d77024ef9ceb061d8ef90285

8d887d3a71e6afe56bf2f97b9e91f995fea5d7e2

8f4a9ca34c91c0787ead542418a2014bfdd88515

49774dd4c664673f25e48a28c2fc53b71949b546

4a76ddc19aadbc07b8e189cdb6c90b7293f7f056

6d09b166021743864a6093727f7e412268ca385b

f25eb947f2f3ed4724c55abbf72b5b5074d689c0

1778af8668ef6b76c8ba6494cf7984a9c744417c

475c436b244634914cc46e4151e732c4dfa28e16

88060f5eed8f4c51f822948e03d8dfcbb3b81cb1

4aa3fd523d1abf92dcef821208b9110a34a0a563

c663c3d15f3624fbdbd4f436a159b2780947b5cc

1155bae45d59646e2d9117f8b75e1df803adbd91

f6c707b478a68a968edae2daa2ab0e0b1a7be387

32c3a0484d973379c4c01f13946dba21d2fa1563

58af816cddc1034ee4180553eddfea2329c4292e

b6aa8c508511f7f7f8a9965362aeb9a7233933ab

418e3f5435232b17ed2ab5080c5d785fe54f35ff

dfad7e71fabaf01f8574ead62a3cae58d056ad46

8459bf50834c6de4a33e46f64e8de7541b121f87

c9565e2978fd159aa194dc96965de670be4af440

77935ff0192dd57a1753116538d21ad2e6c53e8f

c572ab80685faaad57ddcf72f4749e4dd35d1df2

1b0272c7d235816a7abae7ebfe983b7a72c651d2

1158acaa0cd13a586c10162822d4fbfe74b40618

相关文章
|
SQL 人工智能 JSON
Flink 2.1 SQL:解锁实时数据与AI集成,实现可扩展流处理
简介:本文整理自阿里云高级技术专家李麟在Flink Forward Asia 2025新加坡站的分享,介绍了Flink 2.1 SQL在实时数据处理与AI融合方面的关键进展,包括AI函数集成、Join优化及未来发展方向,助力构建高效实时AI管道。
1400 43
|
12月前
|
SQL 数据可视化 关系型数据库
MCP与PolarDB集成技术分析:降低SQL门槛与简化数据可视化流程的机制解析
阿里云PolarDB与MCP协议融合,打造“自然语言即分析”的新范式。通过云原生数据库与标准化AI接口协同,实现零代码、分钟级从数据到可视化洞察,打破技术壁垒,提升分析效率99%,推动企业数据能力普惠化。
935 3
|
SQL 人工智能 JSON
Flink 2.1 SQL:解锁实时数据与AI集成,实现可扩展流处理
本文整理自阿里云的高级技术专家、Apache Flink PMC 成员李麟老师在 Flink Forward Asia 2025 新加坡[1]站 —— 实时 AI 专场中的分享。将带来关于 Flink 2.1 版本中 SQL 在实时数据处理和 AI 方面进展的话题。
700 0
Flink 2.1 SQL:解锁实时数据与AI集成,实现可扩展流处理
|
12月前
|
存储 自然语言处理 分布式计算
Apache Doris 3.1 正式发布:半结构化分析全面升级,湖仓一体能力再跃新高
Apache Doris 3.1 正式发布!全面升级半结构化分析,支持 VARIANT 稀疏列与模板化 Schema,提升湖仓一体能力,增强 Iceberg/Paimon 集成,优化存储引擎与查询性能,助力高效数据分析。
1302 4
Apache Doris 3.1 正式发布:半结构化分析全面升级,湖仓一体能力再跃新高
|
SQL 关系型数据库 MySQL
凌晨2点报警群炸了:一条sql 执行200秒!搞定之后,我总结了一个慢SQL查询、定位分析解决的完整套路
凌晨2点报警群炸了:一条sql 执行200秒!搞定之后,我总结了一个慢SQL查询、定位分析解决的完整套路
凌晨2点报警群炸了:一条sql 执行200秒!搞定之后,我总结了一个慢SQL查询、定位分析解决的完整套路
|
SQL 算法 数据挖掘
【SQL周周练】:利用行车轨迹分析犯罪分子作案地点
【SQL破案系列】第一篇: 如果监控摄像头拍下了很多车辆的行车轨迹,那么如何利用这些行车轨迹来分析车辆运行的特征,是不是能够分析出犯罪分子“踩点”的位置
433 15
|
SQL 数据挖掘 关系型数据库
【SQL 周周练】一千条数据需要做一天,怎么用 SQL 处理电表数据(如何动态构造自然月)
题目来自于某位发帖人在某 Excel 论坛的求助,他需要将电表缴费数据按照缴费区间拆开后再按月份汇总。当时用手工处理数据,自称一千条数据就需要处理一天。我将这个问题转化为 SQL 题目。
589 12
|
SQL 关系型数据库 MySQL
SQL如何对不同表的数据进行更新
本文介绍了如何将表A的Col1数据更新到表B的Col1中,分别提供了Microsoft SQL和MySQL的实现方法,并探讨了多表合并后更新的优化方式,如使用MERGE语句提升效率。适用于数据库数据同步与批量更新场景。

推荐镜像

更多