《Hadoop与大数据挖掘》一1.1 大数据概述

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介:

本节书摘来华章计算机《Hadoop与大数据挖掘》一书中的第1章 ,第1.1节,张良均 樊 哲 位文超 刘名军 许国杰 周 龙 焦正升 著 更多章节内容可以访问云栖社区“华章计算机”公众号查看。

1.1 大数据概述

来看看所谓官网定义的大数据:大数据(Big data)或称巨量数据、海量数据、大资料,指的是所涉及的数据量规模巨大到无法通过人工或者计算机,在合理的时间内达到截取、管理、处理并整理成为人类所能解读的形式的信息。
看得懂吗?好像也不是那么难以理解。首先,这些数据要够多,即规模巨大;第二,这些数据不能够在合理的时间内被处理并分析,也就意味着,对于一个人来说,如果让他在1天内看完1万本书,并写相应的书评,那么这1万本书对于这个人来说就是大数据;但是,如果让1万个人在1天内看1万本书,并写对应书评,那么其实是可以完成的任务,这样这1万本书对于这1万个人来说就不是大数据了。
大数据有哪些特点呢?
首先,可以肯定的是数据量比较大,它才能被称为大数据,所以其第一个特点就是数据体量巨大。其次,数据的类型多样也是大数据的一个特征,数据类型不仅指文本形式,更多指的是图片、视频、音频、地理位置信息等多类型的数据,个性化数据占绝大多数。第三,处理速度快也是大数据的一个特征,数据处理遵循“1秒定律”,可从各种类型的数据中快速获得高价值的信息。最后,大数据具有价值密度低的特点,以视频为例,1小时的监控视频,在不间断的监控过程中,可能有用的数据仅仅只有一两秒。
生活中大数据有哪些应用呢?
随着大数据的应用越来越广泛,应用的行业也越来越多,我们每天都可以看到大数据的一些新奇的应用,从而帮助人们从中获取到真正有用的价值信息。
(1)理解客户,满足客户服务需求
大数据的应用目前在这个领域是最广为人知的。重点是如何应用大数据更好地了解客户以及他们的爱好和行为。企业非常喜欢搜集社交方面的数据、浏览器的日志、分析文本和传感器的数据,从而更加全面地了解客户。在一般情况下,企业会采用建立数据模型的方式进行预测。
比如美国的著名零售商Target就是通过大数据分析得到有价值的信息,精准地预测到客户在什么时候想要小孩。再比如,通过大数据应用,电信公司可以更好地预测出流失的客户,沃尔玛则更加精准地预测出哪个产品会大卖,汽车保险行业会更加了解客户的需求和驾驶水平,外国候选政党也能了解到选民的偏好。
(2)提高医疗水平和研发效率
大数据分析应用的计算能力可以让我们能够在几分钟内解码整个DNA,并且制定出最新的治疗方案,同时更好地了解和预测疾病。大数据技术目前已经在医疗中应用,如监视早产婴儿和患病婴儿的情况,通过记录和分析婴儿的心跳,对婴儿的身体可能出现的不适症状做出预测,从而更好地救治婴儿。
(3)改善安全和执法
目前来说,大数据已经广泛应用到安全执法的过程当中。想必大家都知道美国安全局已经开始利用大数据打击恐怖主义,甚至监控可疑人的日常生活。而企业则应用大数据技术防御网络攻击,警察应用大数据工具捕捉罪犯,信用卡公司应用大数据工具来检测欺诈性交易等。
(4)改善我们的城市
大数据还被用来改善我们所生活的城市。例如基于城市实时交通信息、利用社交网络和天气数据来优化最新的交通情况。目前很多城市都在进行相关的大数据分析和试点。
(5)金融交易
大数据在金融行业主要是用于金融交易。高频交易(HFT)是大数据应用比较多的领域,其中大数据算法被应用于交易决定。现在很多股权的交易都是利用大数据算法进行的,这些算法越来越多地考虑了社交媒体和网站新闻来决定在未来几秒内是买入还是卖出。
通过上面的描述也可以看出,大数据不只是适用于企业和政府,同样也适用于我们生活当中的每个人。我们可以利用可穿戴装备(如智能手表或者智能手环)生成最新的数据,对热量的消耗以及睡眠模式进行追踪;还可以利用大数据分析来寻找属于我们的爱情,大多数的交友网站就是应用大数据工具来帮助需要的人匹配合适的对象。

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
13天前
|
分布式计算 Kubernetes Hadoop
大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS
大数据-82 Spark 集群模式启动、集群架构、集群管理器 Spark的HelloWorld + Hadoop + HDFS
76 6
|
12天前
|
存储 分布式计算 API
大数据-107 Flink 基本概述 适用场景 框架特点 核心组成 生态发展 处理模型 组件架构
大数据-107 Flink 基本概述 适用场景 框架特点 核心组成 生态发展 处理模型 组件架构
42 0
|
8天前
|
分布式计算 Hadoop 大数据
大数据体系知识学习(一):PySpark和Hadoop环境的搭建与测试
这篇文章是关于大数据体系知识学习的,主要介绍了Apache Spark的基本概念、特点、组件,以及如何安装配置Java、PySpark和Hadoop环境。文章还提供了详细的安装步骤和测试代码,帮助读者搭建和测试大数据环境。
19 1
|
10天前
|
SQL 分布式计算 大数据
大数据平台的毕业设计01:Hadoop与离线分析
大数据平台的毕业设计01:Hadoop与离线分析
|
12天前
|
存储 分布式计算 NoSQL
大数据-144 Apache Kudu 基本概述 数据模型 使用场景
大数据-144 Apache Kudu 基本概述 数据模型 使用场景
24 0
|
12天前
|
SQL 存储 OLAP
大数据-133 - ClickHouse 基础概述 全面了解
大数据-133 - ClickHouse 基础概述 全面了解
31 0
|
12天前
|
存储 分布式计算 算法
大数据-105 Spark GraphX 基本概述 与 架构基础 概念详解 核心数据结构
大数据-105 Spark GraphX 基本概述 与 架构基础 概念详解 核心数据结构
27 0
|
12天前
|
消息中间件 分布式计算 Kafka
大数据-98 Spark 集群 Spark Streaming 基础概述 架构概念 执行流程 优缺点
大数据-98 Spark 集群 Spark Streaming 基础概述 架构概念 执行流程 优缺点
26 0
|
13天前
|
SQL 存储 分布式计算
大数据-93 Spark 集群 Spark SQL 概述 基本概念 SparkSQL对比 架构 抽象
大数据-93 Spark 集群 Spark SQL 概述 基本概念 SparkSQL对比 架构 抽象
17 0
|
12天前
|
存储 机器学习/深度学习 分布式计算
大数据技术——解锁数据的力量,引领未来趋势
【10月更文挑战第5天】大数据技术——解锁数据的力量,引领未来趋势