你需要的不是大数据——而是正确的数据

本文涉及的产品
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
简介:

“ 大数据”这个词这几年火的不得了。各种企业都宣称自己掌握着大量的数据,好像有了大数据,就能解决一切问题一样。

然而现实情况时,很多时候我们对数据的痴迷,却将我们引上了歧途。是的,在一些情况下,要想从数据中萃取有用的东西,我们的确需要大量的这类数据,然而对于创新者来说,数据的数量和规模并不是最关键的因素 ——正确性才是最重要的东西。

数据正确性无关大小

在谈到大数据的作用的时候,我们总是拿 Uber 来举例,他们好像是用大数据获得成功的最典型的例子。毫无疑问, Uber 从数据中获得了财富。依靠他们的应用, Uber 从司机和乘客那里获得了实时的数据,让他们能够知道何时、何处人们对车辆有着较高的需求。

但是 Uber 的成功,依靠的并不是他们所收集的大数据。如果你仔细分析一下,就会发现,他们的成功依靠的是规模并不大的正确的数据 ——车辆 派遣数据 。

在可以用手机叫车以前,我们依靠的是传统的出租车。虽然传统出租车看上去与互联网没有什么关系,但是其实它们才是一种依靠大数据的东西。原因是,传统出租车依赖的是 “人眼网络 ”:无数人站在城市中的某一个点,在看到出租车后马上招手。虽然貌似与信息科技无关,但是实际上人们在打车的过程中,同样使用了计算 ——人脑的计算:我们在大脑中收集并且分析数据。

Uber 提出了一个更好的解决方案,人们不再需要自己跑到街上去用眼睛收集数据,不用再用大脑去处理数据,转而开始让 Uber 为我们提供正确的数据来完成打车任务。城市中谁需要打车?他在哪里?离他最近的车在哪里?需要多长时间能接到乘客?正是凭借这些正确的数据, Uber 才得以成功的在出租车行业内掀起了革命。

用正确的数据完成任务

有的时候,正确的数据规模很大;也有的时候,正确的数据规模很小。对于创新者来说,关键在于分析出那些数据对我们来说最有帮助。要想找到正确的数据,我建议你去思考下面三个问题。

问题1 :哪些因素会浪费公司的资源?大多数企业都会在日常运营中浪费许多资源。用鲜花零售业务来举例,大多数花店中 50% 的库存都会被最终浪费掉。因此 UrbanStems 和 Bouqs 这样的鲜花配送服务应运而生,他们的作用就在于利用正确的数据帮助花店减少浪费。

无论你是工业生产、零售还是法务调查公司,搞清楚哪些因素会浪费你的资源,都能够帮你找到正确的数据。

问题 2 :如何利用自动化来减少浪费?在确定哪些因素会造成资源浪费之后,下一步就是要减少浪费。人类的优势,在于分析问题。但是在实施方面,尤其是大量计算方面,计算机有着人类难以比拟的能力。在当今这个计算能力爆炸的时代,我们应该利用自动化技术来解决问题。

例如,有消息称亚马逊正在计划删除大量定价团队,让算法来给产品进行定价。在很多零售商看来,这是一个不可思议的行为。但是如果亚马逊的算法能够胜任定价工作,它将能够亚马逊带来巨大的好处,例如减少积压库存。

问题 3 :针对问题 1 和 2 ,你需要哪些数据?最后一步,就是确定你需要哪些数据才能减少浪费,并且完成自动化。

还是用 Uber 来举例,他们需要知道潜在乘客的具体位置,才能完成自动化司机指派工作,从而减少浪费(车辆闲置、乘客司机在街上打车)。

这就是你所需要的正确的数据。很多企业都在花费大量的时间去研究大数据,但是却没有花足够的时间去考虑哪些数据才是真正有用的数据。

本文转自d1net(转载)

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
9天前
|
分布式计算 DataWorks NoSQL
DataWorks产品使用合集之同步Holo数据到ODPS的过程中,出现部分数据的值变为星号(),是什么原因
DataWorks作为一站式的数据开发与治理平台,提供了从数据采集、清洗、开发、调度、服务化、质量监控到安全管理的全套解决方案,帮助企业构建高效、规范、安全的大数据处理体系。以下是对DataWorks产品使用合集的概述,涵盖数据处理的各个环节。
DataWorks产品使用合集之同步Holo数据到ODPS的过程中,出现部分数据的值变为星号(),是什么原因
|
18天前
|
数据采集 自然语言处理 大数据
​「Python大数据」词频数据渲染词云图导出HTML
使用Python,本文展示数据聚类和办公自动化,焦点在于通过jieba分词处理VOC数据,构建词云图并以HTML保存。`wordCloud.py`脚本中,借助pyecharts生成词云,如图所示,关键词如"Python"、"词云"等。示例代码创建了词云图实例,添加词频数据,并输出到"wordCloud.html"。
38 1
​「Python大数据」词频数据渲染词云图导出HTML
|
1天前
|
存储 分布式计算 监控
日志数据投递到MaxCompute最佳实践
日志服务采集到日志后,有时需要将日志投递至MaxCompute的表中进行存储与分析。本文主要向用户介绍将数据投递到MaxCompute完整流程,方便用户快速实现数据投递至MaxCompute。
45 2
|
8天前
|
SQL 机器学习/深度学习 分布式计算
MaxCompute产品使用合集之数据删除之后,是否支持回滚
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
9天前
|
分布式计算 DataWorks 关系型数据库
DataWorks产品使用合集之同样的表和数据,在PolarDB执行LEFT JOIN查询可以得到结果,但在MaxCompute中却返回为空,是什么原因
DataWorks作为一站式的数据开发与治理平台,提供了从数据采集、清洗、开发、调度、服务化、质量监控到安全管理的全套解决方案,帮助企业构建高效、规范、安全的大数据处理体系。以下是对DataWorks产品使用合集的概述,涵盖数据处理的各个环节。
|
9天前
|
分布式计算 DataWorks API
DataWorks产品使用合集之使用REST API Reader往ODPS写数据时,如何获取入库时间
DataWorks作为一站式的数据开发与治理平台,提供了从数据采集、清洗、开发、调度、服务化、质量监控到安全管理的全套解决方案,帮助企业构建高效、规范、安全的大数据处理体系。以下是对DataWorks产品使用合集的概述,涵盖数据处理的各个环节。
|
8天前
|
JSON 分布式计算 大数据
MaxCompute产品使用合集之使用数据服务功能,但发现ODPS数据源不支持,该如何解决
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
8天前
|
SQL 分布式计算 DataWorks
MaxCompute产品使用合集之整库离线同步至MC的配置中,是否可以清除原表所有分区数据的功能
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
8天前
|
机器学习/深度学习 分布式计算 DataWorks
MaxCompute产品使用合集之如何将数据映射成Holo表的语句
MaxCompute作为一款全面的大数据处理平台,广泛应用于各类大数据分析、数据挖掘、BI及机器学习场景。掌握其核心功能、熟练操作流程、遵循最佳实践,可以帮助用户高效、安全地管理和利用海量数据。以下是一个关于MaxCompute产品使用的合集,涵盖了其核心功能、应用场景、操作流程以及最佳实践等内容。
|
8天前
|
分布式计算 运维 DataWorks
MaxCompute操作报错合集之用户已在DataWorks项目中,并有项目的开发和运维权限,下载数据时遇到报错,该如何解决
MaxCompute是阿里云提供的大规模离线数据处理服务,用于大数据分析、挖掘和报表生成等场景。在使用MaxCompute进行数据处理时,可能会遇到各种操作报错。以下是一些常见的MaxCompute操作报错及其可能的原因与解决措施的合集。