大数据导论之为何需要引入大数据

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: 一、引言   最近各种客户咨询项目中,往往涉及大数据引入必要性和价值意义的深层次挖掘,客户有数据,有平台,但是不知到底要不要上大数据,为何要上大数据和大数据可以带来哪些价值和意义。本文关于大数据的必要性进行阐述,来源实际项目,算是分享吧。

一、引言

  最近各种客户咨询项目中,往往涉及大数据引入必要性和价值意义的深层次挖掘,客户有数据,有平台,但是不知到底要不要上大数据为何要上大数据和大数据可以带来哪些价值和意义。本文关于大数据的必要性进行阐述,来源实际项目,算是分享吧。

二、突破技术瓶颈

  

  互联网技术催生了大数据时代的来临,大数据时代的数据形态有四大特点:首先数据体量巨大,非结构化数据的超大规模和增长占总数据量的80%至90%,比结构化数据增长快10到50倍;其次、大数据的异构和多样性,比如图片、新闻、博客、微博、微信等,比大更重要的是数据的复杂性,有时甚至大数据中的小数据如一条微博就具有颠覆性的价值;第三,价值密度低,大量的不相关信息,需要沙里淘金;第四,传播速度快,因此,需要实时分析而非批量式分析。

  在大数据时代,面对如此海量快速的信息,纯人工监测互联网已经不可行了。自动化舆情软件成为大数据环境下舆情监测和分析的引擎。监测舆情可以设立一些关键词,首先要与自己机构相关,可以包括竞争者或者是合作伙伴,然后要放在特定网络媒体进行搜集。所有“信息碎片”搜集完之后,我们开始聚合信息,判断哪些和产品相关,哪些跟区域相关,哪些跟自己相关。把这些信息进行精确地采集和过滤、炼化分析,包括传播统计和分析(媒介分析、主体传播分布、传播路径分析、传播源头追踪)、敏感(负面)舆情、舆情信息传播趋势分析,预判所收集到舆情信息的未来走势。在此基础上生成舆情简报,舆情简报由系统自动生成,以日或周为单位,对本阶段监测到的舆情进行统计和分析,包括舆情分布、热点舆情排行、负面舆情分析、正面舆情排行等情况。

  大数据时代自身的特点决定了我们既面临数据体量巨大的存储压力,同时面临海量数据信息过滤,数据加工、数据分析和平台运算瓶颈。要想突破传统技术瓶颈的约束,我们必须引入大数据技术。

三、摆脱成本枷锁

  

  基于传统模式的舆情分析和历史数据存储,是建立在高性能服务器硬件和昂贵的关系型数据基础之上的。一方面硬件技术掌握在几大IT巨头手中,服务器的性能是以高昂的成本为支撑的;另外一方面硬件基础之上操作系统、应用软件和关系型数据库同样掌握在几大巨头手中,其价格同样不菲。此外规模的扩展、软件的升级和每年的服务费用也是非常昂贵。

  基于互联网技术发展起来的大数据,以开源框架Hadoop、HBase为基础,以Hive、Sqoop、Pig、Flume等软件为工具,建立在X86-PC服务器和开源Linux操作系统之上。一方面硬件成本得以降低、另外一方面再无须为操作系统和应用软件支付高昂的Licence费用。可以说大数据技术将使我所在很大程度上摆脱传统IT厂商巨额的成本依赖。

四、促进业务创新

  

  这部分涉及具体应用,视行业而定。在此制作一个方向说明:大数据的应用可以衍生新的服务,新的产品。

  大数据实施方案咨询和技术交流群:293503507,敬请关注。


作者:张子良
出处:http://www.cnblogs.com/hadoopdev
本文版权归作者所有,欢迎转载,但未经作者同意必须保留此段声明,且在文章页面明显位置给出原文连接,否则保留追究法律责任的权利。

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
14天前
|
存储 SQL 分布式计算
大数据学习
【10月更文挑战第15天】
22 1
|
3月前
|
机器学习/深度学习 分布式计算 NoSQL
大数据学习的基础指南‌
随着信息技术的迅猛发展,‌大数据已成为当今社会的热门话题。‌无论是企业决策、‌市场分析还是科学研究,‌大数据都扮演着举足轻重的角色。‌对于想要投身这一领域的学习者来说,‌制定一份清晰、‌系统的大数据学习路线是至关重要的。
35 3
|
分布式计算 搜索推荐 大数据
大数据入门
大数据入门
116 0
大数据入门
|
存储 传感器 运维
大数据入门-大数据是什么
大数据入门-大数据是什么
175 0
大数据入门-大数据是什么
|
存储 分布式计算 资源调度
【大数据】入门知识介绍
【大数据】入门知识介绍
366 0
|
存储 分布式计算 大数据
图解大数据 | 大数据生态与应用导论
随着互联网高速发展,网络数据呈现出指数级别的快速增长,针对海量数据处理的大数据解决方案应运而生。ShowMeAI将在接下来的内容中逐步展开讲解大数据生态工具的应用,以及大数据的处理分析挖掘方法。
239 0
图解大数据 | 大数据生态与应用导论
|
机器学习/深度学习 SQL 分布式计算
大数据学习之路
大数据学习之路
大数据学习之路
|
机器学习/深度学习 存储 分布式计算
轻松学习大数据
诸如大数据、数据科学家等等概念刚刚兴起,我也是那时候受一位我十分尊敬的媒体人前辈的邀请,加入到他的读书群,写了一个学习“数据科学:从入门到进阶”的经验贴,我就直接把它贴在下面了。虽然题主问的是大数据的入门,但在我看来“大数据”就是数据科学的一个高阶状态。以下内容中除个别情况,我基本上都会使用“数据科学”这个概念。
141 0