开发者社区> 青衫无名> 正文
阿里云
为了无法计算的价值
打开APP
阿里云APP内打开

SQL Server+Hadoop 变身大数据解决方案

简介:
+关注继续查看
文章讲的是SQL Server+Hadoop 变身大数据解决方案在数据库市场中,微软的SQL Server是最受关注的产品之一。在数据库知识网站DB-Engines每月公布的数据库流行度排行榜中,SQL Server几乎稳占第二名的位置。但从这个榜单每月的变化中也可以看出,大量NoSQL数据库的排名不断上升,已经开始威胁到传统数据库的地位。

  “以不变应万变”不再是大数据时代应有的策略,老牌数据库厂商在保持传统市场领先的基础上,不断拓展新市场,微软就是其中的一个代表。微软的改变最早是为了向Bing提供高质量的搜索结果,这与Google的情况类似,互联网行业总是最早面临大数据挑战的。

SQL Server+Hadoop 变身大数据解决方案

  微软端到端的大数据解决方案可以总结为SQL Server、Windows Azure和Hadoop,用微软自己的话说就是数据管理、数据扩充和洞察力。下面笔者将按照自下而上的顺序盘点微软大数据解决方案的具体内容:

  一、数据管理

  在微软的大数据解决方案中,数据管理是最底层和最基础的一环。灵活的数据管理层,可以支持所有数据类型,包括结构化、半结构化和非结构化的静态或动态数据。在数据管理层中主要包括三款产品:SQL Server、SQL Server并行数据仓库和Hadoop on Windows。

  针对不同的数据类型,微软提供了不同的解决方案。具体来说,针对结构化数据可以使用SQL Server和SQL Server并行数据仓库处理;非结构化数据可以使用Windows Azure和Windows Server上基于Hadoop的发行版本处理;而流数据可以使用SQL Server StreamInsight管理,并提供接近实时的分析。

SQL Server+Hadoop 变身大数据解决方案

  1、SQL Server。去年发布的SQL Server 2012针对大数据做了很多改进,其中最重要的就是全面支持Hadoop,这也是SQL Server 2012与SQL Server 2008最重要的区别之一。今年年底即将正式发布的SQL Server 2014中,SQL Server进一步针对大数据加入内存数据库功能,从硬件角度加速数据的处理,也被看为是针对大数据的改进。

  2、SQL Server并行数据仓库。并行数据仓库(Parallel Data Warehouse Appliance,简称PDW)是在SQL Server 2008 R2中推出的新产品,目前已经成为微软主要的数据仓库产品,并将于今年发布基于SQL Server 2012的新款并行数据仓库一体机。SQL Server并行数据仓库采取的是大规模并行处理(MPP)架构,与传统的单机版SQL Server存在着根本上的不同,它将多种先进的数据存储与处理技术结合为一体,是微软大数据战略的重要组成部分。

  3、Hadoop on Windows。微软同时在Windows Azure平台和Windows Server上提供Hadoop,把Hadoop的高性能、高可扩展与微软产品易用、易部署的传统优势融合到一起,形成完整的大数据解决方案。微软大数据解决方案还通过简单的部署以及与Active Directory和System Center等组件的集成,为Hadoop提供了Windows的易用性和可管理性。凭借Windows Azure上基于Hadoop的服务,微软为其大数据解决方案在云端提供了灵活性。

  二、数据扩充

  社交媒体的兴起给企业带来独特的计划,以获取更多商业价值,最终实现竞争优势。微软大数据解决方案将数据和模型与公用的数据和服务(包括Twitter、Facebook和LinkedIn等社交媒体网站)相结合,从而能够实现突破性的发现。在数据扩充层,微软提供的最重要的平台是Windows Azure Marketplace。

  Windows Azure Marketplace是一个在线市场,用于购买和销售完成的软件即服务(SaaS)应用程序和高级数据集。Windows Azure Marketplace可以帮助将寻求基于云的创新解决方案的公司与开发了准备使用的解决方案的合作伙伴连接到一起,使客户能够使用Windows Azure Marketplace上的应用程序和挖掘算法来发现隐藏的模式。

SQL Server+Hadoop 变身大数据解决方案

  ·通过Windows Azure Marketplace进行共享和协作:微软大数据解决方案可让客户通过Windows Azure Marketplace共享数据并发现新的洞察力,Windows Azure Marketplace可通过开放数据协议(OData)展露数百种来自微软和第三方的应用程序和数据挖掘算法。

  ·与社交媒体集成:微软大数据解决方案可让客户通过来自社交媒体网站(例如Twitter和Facebook)的公用数据来扩展他们的分析。微软的一款代号为“Social Analytics”的基于云的项目允许企业将社交媒体信息与业务应用程序相集成。

  ·借助Hadoop执行高级分析:微软大数据解决方案支持传统的BI以及高级分析(例如数据挖掘和图形挖掘),从而可让客户从他们所有的数据中发现新价值。Hive ODBC Driver可让客户使用SQL Server数据挖掘工具执行预测分析。微软还将支持Mahout等其他高级分析工具,以及使用C++、C#、Python、Ruby和Pearl编写的挖掘算法。

  三、洞察力

  企业收集、存储和处理数据,最终目的还是要获得洞察力。企业需要能够轻松处理和分析PB 级的新数据,而不用担心建立复杂的分布式存储和计算集群,并且要能够随着需求的增加实现缩放。微软大数据解决方案可让客户用熟悉的BI工具从他们的结构化和非结构化数据中获得可执行的洞察力。

  从洞察力的层面,微软提供了两款主要的产品,分别是Office Powerpivot和SharePoint Power View。PowerPivot和Power View工具,能够帮助企业快速的从数据中发现信息,从而解决业务问题。其中,PowerPivot可以用来设计数据模型,Power View可以用来设计可视化报表,报表还可以发布到SharePoint平台上。最终用户能够根据自己业务视角及要求设计数据模型并展示出来,充分利用数据和前台界面的力量,满足业务需求。

SQL Server+Hadoop 变身大数据解决方案

  ·使用熟悉的工具分析Hadoop数据:微软可让用户利用Excel的Hive组件在熟悉的Excel环境中与Hadoop中的非结构化数据进行交互并加以分析。

  ·通过任何数据获得深入的洞察力:企业可以用熟悉的BI工具(例如Microsoft SQL Server Analysis Services (SSAS)、PowerPivot和Power View)通过Hive Open Database Connectivity (ODBC) Driver来分析Hadoop中的非结构化数据。企业还可以用SQL Server 2012上的PowerPivot和Power View对关系型数据采用自助服务的 BI 产品。

  ·通过简化的编程驱动洞察力:微软通过与.NET和新的JavaScript库集成简化了Hadoop的编程。开发人员可以在JavaScript中使用新的JavaScript库来轻松编写MapReduce程序,然后通过简单的浏览器来部署他们的JavaScript代码。

  小结

  微软的大数据解决方案从本质上看还是原有SQL Server和Office产品的升级,最大的亮点是在SQL Server、Windows Server和Windows Azure中都集成了Hadoop功能,使Hadoop成为连接这三者之间的桥梁。微软的大数据解决方案产品丰富、功能齐全,但相对缺乏创新。在用户看来,微软最大的特色就是产品的易用性和界面的友好性,这也是用户选择微软的主要原因。

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
SQL点滴9—SQL Server中的事务处理以及SSIS中的内建事务
我们可以把SSIS中的整个package包含在一个事务中,但是如果在package的执行过程中有一个表需要锁定应该怎么处理呢?SSIS内建的事务处理可以解决这个问题。在此之前首先来熟悉一下SQL Server中的事务的概念。
661 0
SQL SERVER 取所有表及注释 和 字段属性
取表信息   select   sysobjects.name,sys.extended_properties.value   from   sysobjects left join sys.
712 0
【2011-04-06】SQL Server 2000 日志传送搭建
基本参考:   http://www.99inf.net/DB/SqlServer/223.htm 里面的内容很全。 有以下几点需要提前做的。   用来放置主服务器的日志备份的文件夹我们就叫 logfile    错误:无法访问 logfile   原因:没有设置共享的权限  解决办法:logfile 里面只是设置了安全里面的权限是不够的,要需要设置共享里面的权限   错误:错误代码 14261 指定的 primary_server_name.primary_database_name('S')已经存在。
801 0
+关注
文章
问答
文章排行榜
最热
最新
相关电子书
更多
SQL Server在电子商务中的应用与实践
立即下载
SQL Server云化思考与实践
立即下载
原生SQL on Hadoop引擎- Apache HAWQ 2.x最新技术解密malili
立即下载