为什么说大数据和云计算的深度融合是大势所趋?

简介: 为什么说大数据和云计算的深度融合是大势所趋?

image.png

随着整个IT生态的进一步发展,在2021年,IT从业人员对大数据的发展趋势有一个普遍的共识,就是大数据和云计算的进一步深度融合的趋势,即大数据拥抱云计算,走向云原生化。

我们在这里,就跟大家一起看下,大数据与云计算的深度融合具体体现在哪些地方。

大数据与云计算的深度融合,体现在以下几个方面:

一是应用方的大数据平台上云:使用大数据技术的业务应用建设方,不再自建数据中心,而是将大数据平台搬到了云上,有的是在云厂商的 IaaS 层上自建大数据平台(现在以这种方式在云上使用大数据的案例已经比较少了),有的直接使用云厂商提供的 PaaS 层大数据相关产品(aws 的 emr,阿里云的 e-MapReduce等),有的甚至直接使用云厂商推出的 SaaS层大数据相关产品(aws的redshift, 阿里云的maxcompute等)。现在“上云”有一点趋势需要强调下,就是大家都很重视不 vendor-lockin,底层的云可能是多个公有云和私有的的融合的 hybrid-cloud;

二是云计算厂商在不断推出自己基于大数据的各种增值服务:为了提高自己的市场竞争力,以进一步巩固/拓宽自己的市场地位,各大云厂商也在积极推出自己整合的大数据相关产品,有最基础的 s3/oss, emr/e-mapreduce,有上文的aws redshift, 阿里云的maxcompute,除此之外,还有各种云上数据库,云上 serverless 形态的各种大数据服务等等,这个名单还在不断增长中,以下截图可见一斑:

image.png

aws的大数据相关产品

image.png

阿里云的大数据相关产品

三是各传统大数据厂商已经转向依托云来提供自己的产品和服务:如 elastic 很早就开始基于云交付自己的 elk 技术栈了,如 databricks 的大数据平台和产品一直都是基于云来向客户提供服务的(可以对接 aws, gcp, azure 等云平台),如 cloudera 不断探索改变自己的商业模式(从大数据三驾马车的辉煌期,到业绩下滑下的和 hortorworks 的合并,再到主动改变商业模式基于云来交付自己的产品和服务,甚至数据中心版的大数据平台都改名为了 cdp private cloud base);

image.png

elastic 的云上部署

image.png

砖厂的大数据产品都是基于云来交付的

四是各个具体的大数据组件都在主动改变自身架构,积极向云原生靠拢以“云化”:这才是大数据具体组件伤筋动骨的改变,是大数据主动的改变以适应云时代。从理念层面讲,大数据已经从最早的强调“数据本地性”和“移动数据不如移动计算”的理念,演进到了现在的强调“存储计算分离”的理念。各个新推出的组件和框架主动拥抱云原生,如pulsa,TiDB 等都是依托于存储计算分离的云原生架构; 各个传统的组件虽然有历史包袱,也在不断求新求变,如flink/spark 都深度整合支持了 kubernetes 集群模式;如 kafka 也在不断探索如花云化:包括完全去掉 zookeeper 依赖,包括 Rebalance Protocol 的 Static Membership 等;正如古语所言,“顺则昌不顺则亡”,一些不适应云原生架构的技术组件,其市场正在不断萎缩,如很多场景下,kubernetes 都替代了 yarn, 对象存储 oss/s3 等也在替代hdfs (笔者也注意到了apache 社区推出的 Ozone,该组件在对象存储的基础上,也融合推出了文件系统api,该组件的背后有很多原 hdfs 社区的 committer 在贡献代码,在 cloudera 的cdp平台中也内嵌支持了该组件)。下图展示了 flink/spark 跟kubernetes的深度整合:(注意不是简单的使用k8s operator 将 spark/flink 作业运行在k8s集群中,而是native的深度的整合)。

image.png

spark on kubernetes

image.png

flink on kubernetes


综合来讲,大数据云计算的深度融合是大势所趋,其主要体现在以上四个方面。需要说明的是,以上四个方面是相辅相成,互相促进的。如应用方的大数据平台上云的需求,促使了云计算厂商推出更好的托管的大数据增值服务,而云计算厂商推出的更多更好的大数据增值服务,也反过来促使了更多的应用方大数据平台上云;如基础设施上云的大趋势,促使了具体的大数据组件调整自身架构从而云化(因为顺则昌不顺则亡),而大数据具体组件云原生化的架构调整,也反过来促使了云计算厂商和大数据厂商能够基于云基础设施推出更多更好的大数据服务。正所谓 “it不分家,技术无疆界”是也。

参考链接


相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
SQL 分布式计算 大数据
大数据新视界 --大数据大厂之Hive与大数据融合:构建强大数据仓库实战指南
本文深入介绍 Hive 与大数据融合构建强大数据仓库的实战指南。涵盖 Hive 简介、优势、安装配置、数据处理、性能优化及安全管理等内容,并通过互联网广告和物流行业案例分析,展示其实际应用。具有专业性、可操作性和参考价值。
大数据新视界 --大数据大厂之Hive与大数据融合:构建强大数据仓库实战指南
|
存储 弹性计算 分布式计算
云端智链:挖掘云计算中的大数据潜能
云端智链:挖掘云计算中的大数据潜能
361 21
|
安全 大数据 虚拟化
随着云计算和大数据技术的发展,Hyper-V在虚拟化领域的地位日益凸显
随着云计算和大数据技术的发展,Hyper-V在虚拟化领域的地位日益凸显。作为Windows Server的核心组件,Hyper-V具备卓越的技术性能,支持高可用性、动态迁移等功能,确保虚拟机稳定高效运行。它与Windows深度集成,管理便捷,支持远程管理和自动化部署,降低管理成本。内置防火墙、RBAC等安全功能,提供全方位安全保障。作为内置组件,Hyper-V无需额外购买软件,降低成本。其广泛的生态系统支持和持续增长的市场需求,使其成为企业虚拟化解决方案的首选。
|
存储 分布式计算 大数据
大数据与云计算:无缝结合,开启数据新纪元
大数据与云计算:无缝结合,开启数据新纪元
950 11
|
人工智能 大数据
阿里云云计算ACA、大数据ACA、人工智能ACA三门认证升级调整公告
阿里云云计算ACA、大数据ACA、人工智能ACA三门认证升级调整公告
|
人工智能 新能源 调度
中国信通院栗蔚:云计算与AI加速融合,如何开启智算时代新纪元?
中国信通院栗蔚:云计算与AI加速融合,如何开启智算时代新纪元?
647 17
|
人工智能 分布式计算 大数据
MaxFrame 产品评测:大数据与AI融合的Python分布式计算框架
MaxFrame是阿里云MaxCompute推出的自研Python分布式计算框架,支持大规模数据处理与AI应用。它提供类似Pandas的API,简化开发流程,并兼容多种机器学习库,加速模型训练前的数据准备。MaxFrame融合大数据和AI,提升效率、促进协作、增强创新能力。尽管初次配置稍显复杂,但其强大的功能集、性能优化及开放性使其成为现代企业与研究机构的理想选择。未来有望进一步简化使用门槛并加强社区建设。
760 8
|
人工智能 分布式计算 数据处理
MaxCompute Data + AI:构建 Data + AI 的一体化数智融合
本次分享将分为四个部分讲解:第一部分探讨AI时代数据开发范式的演变,特别是MaxCompute自研大数据平台在客户工作负载和任务类型变化下的影响。第二部分介绍MaxCompute在资源大数据平台上构建的Data + AI核心能力,提供一站式开发体验和流程。第三部分展示MaxCompute Data + AI的一站式开发体验,涵盖多模态数据管理、交互式开发环境及模型训练与部署。第四部分分享成功落地的客户案例及其收益,包括互联网公司和大模型训练客户的实践,展示了MaxFrame带来的显著性能提升和开发效率改进。
|
人工智能 运维 安全
中企出海大会|打造全球化云计算一张网,云网络助力中企出海和AI创新
阿里云网络作为全球化战略的重要组成部分,致力于打造具备AI技术服务能力和全球竞争力的云计算网络。通过高质量互联网服务、全球化网络覆盖等措施,支持企业高效出海。过去一年,阿里云持续加大基础设施投入,优化海外EIP、GA产品,强化金融科技与AI场景支持。例如,携程、美的等企业借助阿里云实现业务全球化;同时,阿里云网络在弹性、安全及性能方面不断升级,推动中企迎接AI浪潮并服务全球用户。
2120 8
|
监控 安全 网络安全
云计算与网络安全:技术挑战与解决方案
随着云计算技术的飞速发展,其在各行各业的应用越来越广泛。然而,随之而来的网络安全问题也日益凸显。本文将从云服务、网络安全和信息安全等技术领域出发,探讨云计算面临的安全挑战及相应的解决方案。通过实例分析和代码示例,旨在帮助读者更好地理解云计算与网络安全的关系,提高网络安全防护意识。
462 56

热门文章

最新文章