成本性能要兼得?简化Hadoop云部署有高招

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介:

对于大数据管理和分析应用程序云服务,用户的关注度正不断增长,而为了应对这一趋势,供应商已经开始努力简化Hadoop的云部署流程,并试图降低云端Hadoop的购买价格。

大数据和云计算现在对于Hadoop供应商和一些大数据技术公司来说,已经变得十分重要。这些公司正在尝试使用新方法,来简化用户部署Hadoop云系统的步骤,并降低用户的部署成本。

成本性能要兼得?简化Hadoop云部署有高招

例如,Cloudera将计量功能加入其Cloudera Director工具中,以管理构建在Hadoop中的分布式集群。这允许Cloudera用户采用一种基于使用的定价模型,而不必以节点为单位进行支付,这让他们能够运行一些因特定目的搭建起来的临时系统,使用完后可以释放资源,从而避免成本的上升。

在单个Cloudera Director实例的大数据云环境中,用户现在可以在其中的多个区域内部署集群。此外,新版本的Cloudera Enterprise(一个基于Hadoop的大数据平台)实现了在Amazon Simple Storage Service(S3)数据存储上直接运行Apache Impala SQL-on-Hadoop 查询引擎。这使得不需要移动数据到Hadoop分布式文件系统就可以实现查询操作,这也为用户在AWS云上部署临时系统提供了便利。

按需定价以及对Impala-on-S3的支持,在Narasimhan Sampath看来是非常有用的,他是Choice Hotels International Inc.公司的系统架构师,这家公司在AWS云上运行着Cloudera-based集群,这些集群与Spark数据处理引擎和Kafka信息查询系统等技术协同工作,以支持各种自助分析应用程序。

把你的集群迁移到云上

在Strata + Hadoop World 2016会谈中,Sampath表示,Choice遵循了BYOC的方式,将自己的集群,以按需的方式部署到云环境。例如,营销部门的集群可以部署到云中,完成一项工作,然后释放资源。同样地,开发团队的集群每天运行12小时,然后在夜间关闭,以节省公司在AWS云上的投入。

Cloudera的计量定价方式非常适合这种情景,Sampath在会谈结束后说道。“我并不需要购买500个(Cloudera)许可证,除非我无时无刻都在使用这些资源。这和亚马逊的模型是一样的。”

他补充道,Choice过去六个月与Cloudera进行了十分紧密的合作,试图连接S3和Impala,Impala最初由Cloudera作为开源软件发布。Choice使用S3作为数据存储。Sampath说,Impala对新查询的支持为BYOC策略提供了额外的灵活性。

Cloudera负责云产品营销的主管David Tishgart表示,他们已经越来越乐意在客户中推广云。但直到现在,他们对临时系统也没有太好的解决方案,也不能随便增加或减少工作负载。他承认,由于这个原因,大多数Cloudera用户选择了在云中长期运行集群,而不是采取临时的方式。

追上Hadoop 云的脚步

随着越来越多的用户展示出对云的兴趣,Clouder需要与Amazon Elastic MapReduce(EMR),AWS提供的Hadoop云平台进行竞争。此外,Cloudera还发现,自己在与微软Azure HDInsight大数据云服务的竞争中也处于劣势,该平台基于Hortonworks Inc .的Hadoop的分布式环境。

根据Gartner分析师Merv Adrian所述,从用户数量的角度看,EMR已经让AWS成为了最大的Hadoop供应商。AWS最初落后于其他Apache Hadoop竞争对手,但两年前这种情况得以改变,现在AWS Hadoop用户数比其他厂商总和还要多。

Hortonworks还专注于扩展Hadoop云功能,他们表示,HDInsight现在运行着2.5版的Hortonworks数据平台(HDP)。此外,Hortonworks现在还支持Microsoft’s Azure Active Directory service 和Apache Ranger的集成。(Apache Ranger是一个用来管理Hadoop数据安全性和用户访问权限的框架)

尽管与微软云环境关系密切,但Hortonworks也提供HDP的技术预览版,以便AWS用户使用Spark和Apache Hive搭建临时集群。“我们了解所有云环境上的工作负载情况,”该公司主管全球营销的高级副总裁Matt Morgan说道。

Paxata公司也开始使用云环境。这家自助服务数据准备软件的供应商提供了一个新工具,叫做Paxata Connect,它可以汇总运行在不同Hadoop集群上的数据,其中也包括独立云平台中的数据。Paxata首席产品官Nenshad Bardoliwalla说道,很多Hadoop的工作负载都已迁移到云,能够创建“临时”集群,运行特定的工作,然后释放资源,这种模式的诱惑十分巨大。


本文作者:Craig Stedman

来源:51CTO

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
2月前
|
分布式计算 资源调度 Hadoop
大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比
大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比
70 2
|
4月前
|
存储 分布式计算 资源调度
Hadoop入门基础(三):如何巧妙划分Hadoop集群,全面提升数据处理性能?
Hadoop入门基础(三):如何巧妙划分Hadoop集群,全面提升数据处理性能?
|
24天前
|
分布式计算 资源调度 Hadoop
【赵渝强老师】部署Hadoop的本地模式
本文介绍了Hadoop的目录结构及本地模式部署方法,包括解压安装、设置环境变量、配置Hadoop参数等步骤,并通过一个简单的WordCount程序示例,演示了如何在本地模式下运行MapReduce任务。
|
4月前
|
分布式计算 资源调度 Hadoop
Hadoop入门基础(二):Hadoop集群安装与部署详解(超详细教程)(二)
Hadoop入门基础(二):Hadoop集群安装与部署详解(超详细教程)(二)
|
4月前
|
分布式计算 Ubuntu Hadoop
Hadoop入门基础(二):Hadoop集群安装与部署详解(超详细教程)(一)
Hadoop入门基础(二):Hadoop集群安装与部署详解(超详细教程)(一)
|
4月前
|
SQL 分布式计算 Hadoop
centos7通过CDH部署Hadoop
centos7通过CDH部署Hadoop
|
4月前
|
分布式计算 Java Linux
centos7通过Ambari2.74部署Hadoop
centos7通过Ambari2.74部署Hadoop
|
4月前
|
存储 分布式计算 监控
Hadoop在云计算环境下的部署策略
【8月更文第28天】Hadoop是一个开源软件框架,用于分布式存储和处理大规模数据集。随着云计算技术的发展,越来越多的企业开始利用云平台的优势来部署Hadoop集群,以实现更高的可扩展性、可用性和成本效益。本文将探讨如何在公有云、私有云及混合云环境下部署和管理Hadoop集群,并提供具体的部署策略和代码示例。
140 0
|
4月前
|
缓存 分布式计算 算法
优化Hadoop MapReduce性能的最佳实践
【8月更文第28天】Hadoop MapReduce是一个用于处理大规模数据集的软件框架,适用于分布式计算环境。虽然MapReduce框架本身具有很好的可扩展性和容错性,但在某些情况下,任务执行可能会因为各种原因导致性能瓶颈。本文将探讨如何通过调整配置参数和优化算法逻辑来提高MapReduce任务的效率。
580 0
|
5月前
|
存储 分布式计算 Hadoop
Hadoop性能问题
【7月更文挑战第12天】
73 11