《Hadoop与大数据挖掘》一1.1 大数据概述

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介:

本节书摘来华章计算机《Hadoop与大数据挖掘》一书中的第1章 ,第1.1节,张良均 樊 哲 位文超 刘名军 许国杰 周 龙 焦正升 著 更多章节内容可以访问云栖社区“华章计算机”公众号查看。

1.1 大数据概述

来看看所谓官网定义的大数据:大数据(Big data)或称巨量数据、海量数据、大资料,指的是所涉及的数据量规模巨大到无法通过人工或者计算机,在合理的时间内达到截取、管理、处理并整理成为人类所能解读的形式的信息。
看得懂吗?好像也不是那么难以理解。首先,这些数据要够多,即规模巨大;第二,这些数据不能够在合理的时间内被处理并分析,也就意味着,对于一个人来说,如果让他在1天内看完1万本书,并写相应的书评,那么这1万本书对于这个人来说就是大数据;但是,如果让1万个人在1天内看1万本书,并写对应书评,那么其实是可以完成的任务,这样这1万本书对于这1万个人来说就不是大数据了。
大数据有哪些特点呢?
首先,可以肯定的是数据量比较大,它才能被称为大数据,所以其第一个特点就是数据体量巨大。其次,数据的类型多样也是大数据的一个特征,数据类型不仅指文本形式,更多指的是图片、视频、音频、地理位置信息等多类型的数据,个性化数据占绝大多数。第三,处理速度快也是大数据的一个特征,数据处理遵循“1秒定律”,可从各种类型的数据中快速获得高价值的信息。最后,大数据具有价值密度低的特点,以视频为例,1小时的监控视频,在不间断的监控过程中,可能有用的数据仅仅只有一两秒。
生活中大数据有哪些应用呢?
随着大数据的应用越来越广泛,应用的行业也越来越多,我们每天都可以看到大数据的一些新奇的应用,从而帮助人们从中获取到真正有用的价值信息。
(1)理解客户,满足客户服务需求
大数据的应用目前在这个领域是最广为人知的。重点是如何应用大数据更好地了解客户以及他们的爱好和行为。企业非常喜欢搜集社交方面的数据、浏览器的日志、分析文本和传感器的数据,从而更加全面地了解客户。在一般情况下,企业会采用建立数据模型的方式进行预测。
比如美国的著名零售商Target就是通过大数据分析得到有价值的信息,精准地预测到客户在什么时候想要小孩。再比如,通过大数据应用,电信公司可以更好地预测出流失的客户,沃尔玛则更加精准地预测出哪个产品会大卖,汽车保险行业会更加了解客户的需求和驾驶水平,外国候选政党也能了解到选民的偏好。
(2)提高医疗水平和研发效率
大数据分析应用的计算能力可以让我们能够在几分钟内解码整个DNA,并且制定出最新的治疗方案,同时更好地了解和预测疾病。大数据技术目前已经在医疗中应用,如监视早产婴儿和患病婴儿的情况,通过记录和分析婴儿的心跳,对婴儿的身体可能出现的不适症状做出预测,从而更好地救治婴儿。
(3)改善安全和执法
目前来说,大数据已经广泛应用到安全执法的过程当中。想必大家都知道美国安全局已经开始利用大数据打击恐怖主义,甚至监控可疑人的日常生活。而企业则应用大数据技术防御网络攻击,警察应用大数据工具捕捉罪犯,信用卡公司应用大数据工具来检测欺诈性交易等。
(4)改善我们的城市
大数据还被用来改善我们所生活的城市。例如基于城市实时交通信息、利用社交网络和天气数据来优化最新的交通情况。目前很多城市都在进行相关的大数据分析和试点。
(5)金融交易
大数据在金融行业主要是用于金融交易。高频交易(HFT)是大数据应用比较多的领域,其中大数据算法被应用于交易决定。现在很多股权的交易都是利用大数据算法进行的,这些算法越来越多地考虑了社交媒体和网站新闻来决定在未来几秒内是买入还是卖出。
通过上面的描述也可以看出,大数据不只是适用于企业和政府,同样也适用于我们生活当中的每个人。我们可以利用可穿戴装备(如智能手表或者智能手环)生成最新的数据,对热量的消耗以及睡眠模式进行追踪;还可以利用大数据分析来寻找属于我们的爱情,大多数的交友网站就是应用大数据工具来帮助需要的人匹配合适的对象。

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
1月前
|
存储 分布式计算 Hadoop
大数据之hadoop3入门到精通(一)
大数据之hadoop3入门到精通(一)
|
1月前
|
分布式计算 Hadoop 分布式数据库
Hadoop生态系统介绍(二)大数据技术Hadoop入门理论系列之一----hadoop生态圈介绍
Hadoop生态系统介绍(二)大数据技术Hadoop入门理论系列之一----hadoop生态圈介绍
91 2
|
1月前
|
存储 分布式计算 Hadoop
Spark和Hadoop都是大数据处理领域的重要工具
【6月更文挑战第17天】Spark和Hadoop都是大数据处理领域的重要工具
134 59
|
19天前
|
分布式计算 Hadoop Java
优化大数据处理:Java与Hadoop生态系统集成
优化大数据处理:Java与Hadoop生态系统集成
|
25天前
|
存储 分布式计算 大数据
Hadoop 生态圈中的组件如何协同工作来实现大数据处理的全流程
Hadoop 生态圈中的组件如何协同工作来实现大数据处理的全流程
|
1月前
|
分布式计算 资源调度 Hadoop
大数据Hadoop集群部署与调优讨论
大数据Hadoop集群部署与调优讨论
|
1月前
|
存储 分布式计算 Hadoop
Hadoop是如何支持大数据处理的?
【6月更文挑战第17天】Hadoop是如何支持大数据处理的?
32 1
|
1月前
|
分布式计算 Hadoop 大数据
大数据技术:Hadoop与Spark的对比
【6月更文挑战第15天】**Hadoop与Spark对比摘要** Hadoop是分布式系统基础架构,擅长处理大规模批处理任务,依赖HDFS和MapReduce,具有高可靠性和生态多样性。Spark是快速数据处理引擎,侧重内存计算,提供多语言接口,支持机器学习和流处理,处理速度远超Hadoop,适合实时分析和交互式查询。两者在资源占用和生态系统上有差异,适用于不同应用场景。选择时需依据具体需求。
|
1月前
|
存储 分布式计算 安全
大数据之hadoop3入门到精通(三)
大数据之hadoop3入门到精通(三)
|
1月前
|
SQL 资源调度 大数据
大数据之hadoop3入门到精通(二)
大数据之hadoop3入门到精通(二)