从另一个视角看大数据

本文涉及的产品
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
简介:

大数据是当下最时髦的话题之一,依照迈尔·舍恩伯格及库克在《大数据时代》的描述,数据被定义为不用随机分析法(抽样调查)而运用所有数据的方法。除了对于社会组织、公共服务、人们生活的重大影响之外,这一热潮背后的关注焦点,其实还是商业模式,即相关数据仓库、数据安全、数据分析、数据挖掘等围绕大数据的商业价值利用。

  大数据之所以在我国引起如此大的关注,也是由于在传统文化理念中,“大概齐、差不多”的习惯深入人心,在公共决策、商业选择、个人行为中充斥着“拍脑袋”现象。正如历史学家黄仁宇在《赫逊河畔谈中国历史》所论述的那样,“西欧和日本都已以商业组织的精神一切按实情主持国政的时候,中国仍然是亿万军民不能在数目字上管理。”当然,这种模糊管理下的信息不对称,亦成为另外一种既定利益格局的存在基础。正因为此,当信息爆炸时代快速来临之时,对数据信息的渴望迅速在社会不同层面体现出来。据报,汪洋副总理就曾向广东财政厅干部推荐涂子沛写的《大数据》。

  要论大数据的历史,或可追溯到19世纪末。美国统计学家赫尔曼·霍尔瑞斯为统计1890年的人口普查数据,发明了一台电动器来读取卡片上的洞数,该设备用一年时间完成了原本需耗时八年的人口普查,由此开启了数据处理的新纪元。进入21世纪,随着信息技术、云计算的高速发展,以及社交网络的普及,大数据被赋予了全新含义。应该说,基于数据化严重不足的大背景,在我国经济社会发展中强调大数据的作用,其积极意义非常深远,但与此同时,也要避免走向另外的某些极端,这就需要相应的冷思考。

  比如,在大数据的推动者之中,一方面各类新兴互联网企业成为主力,另一方面传统企业也在着力跟随,其根本动力都是在于发掘新的商业利润来源,以弥补我国经济转型期的投资迷茫。在此过程中,对于个人的利益和诉求还缺乏合理的认识和定位。虽然大数据对于进一步理解和服务消费者起到重要作用,但从其他侧面看,无序的、低效的、无用的信息轰炸,往往给个人带来“信息过度”的不佳体验,而在数据成为财富的狂热驱动下,对于个人信息权利的侵犯几乎无处不在,尤其在我国缺乏个人信息保护规则的条件下,数据渴望和采集很可能成为激怒消费者的动因,且拉大了与真正的消费者主权社会的距离。

  另外,更值得我们思考的是,如果信息产生基础或其环境存在问题,那么大数据的技术是否会造成更大的信息扭曲?从金融市场的角度看,大数据在深刻改变高频交易方式、信贷风险判断等环节同时,也带来了其他潜在风险的积累,如信息误读造成的市场波动突然被放大,以及难以监管的新型金融产品创新等等。可以说,在诸多领域都缺乏法律游戏规则约束,更缺乏职业道德约束的情况下,如果初始数据就存在问题,那么在此基础上的大数据分析手段,恐怕就只有“南辕北辙”的效果了。从大处说,各类统计数据造假历年来都是被舆论广泛质疑的焦点;从小处说,在很多领域数据失真已经成为常态。例如,据5月7日的《北京青年报》报道,由于受到利益绑架,北京地区的电视收视率数据或许已被污染。再如,我国赴海外留学生的国内学校成绩,就一度存在许多造假行为,直到欧美出现更严厉的制约才有所收敛。无论如何,一旦数据本身的问题太多,则带来的只有大数据的灾难。

  我们知道,信息不对称的后果是扭曲了市场机制的作用,误导了市场信息,造成市场失灵。如果处在普遍的信息数据缺乏状态下,经济行为的不确定性也会增加,往往会降低市场效率。反之,是过犹不及,即便是在上世纪末所谓“信息爆炸”年代,也远不如当前阶段如此快速的信息积累。据统计,互联网上的数据每两年翻一番,而全球绝大多数数据都是最近几年才产生的。面对似乎逐渐“供大于求”的数据,如何找到有用的信息,成为利用大数据的关键问题。正如美国颇有影响力的预测专家纳特·西尔弗在《信号与噪声》一书中所分析的:“如果信息的数量以每天250兆亿字节的速度增长,其中有用的信息肯定接近于零。大部分信息都只是噪声而已,而且噪声的增长速度要比信号快得多。”由此看来,当数据信息铺天盖地而来之时,也可能距离真相越来越远。在现实中,对于一哄而上追求大数据的企业来说,也需要冷静思考下,在信息过度充分的年代,如何把数据真正变成真正的价值?

  大数据如同一把双刃剑,正如不少好莱坞电影中政府对公众无所不在的监控,大数据的爆炸,也让现代人对个人信息安全失控充满了担忧。斯诺登和棱镜事件,进一步在全球范围的国家之间提出这个疑问。一方面,在不可避免地拥抱大数据时代之前,可能更需要加强对其潜在风险的认识,做好基础数据净化、个人信息保护、国家信息安全等基础性建设;另一方面,大数据既可用来推动新商业模式演进,也可用来通过“抓坏蛋”,间接促进社会信息环境的完善,从而夯实大数据根基。

  via:上海证券报作者:杨涛作者系中国社会科学院金融研究所金融市场研究室主任

原文发布时间为:2014-06-05
本文来自云栖社区合作伙伴至顶网,了解相关信息可以关注至顶网。
相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
存储 资源调度 分布式计算
LC3|视角 开源大数据生态下的高性能分布式文件系统
## 背景介绍 盘古是阿里云自主研发的高可靠、高可用、高性能分布式文件系统,距今已经有将近10年的历史。盘古1.0作为阿里云的统一存储核心,稳定高效的支撑着阿里云ECS、NAS、OSS、OTS、ODPS、ADS等多条业务线的迅猛发展。但最近几年,基于如下两方面的原因,盘古还是重新设计实现了第二代存储引擎盘古2.0,其不只为阿里云,也为集团、蚂蚁金服的多种业务提供了更佳优异的存储服务 #
2901 0
|
存储 人工智能 大数据
从技术视角看大数据行业的发展趋势
从技术视角看大数据行业的发展趋势
|
SQL 分布式计算 Hadoop
【小白视角】大数据基础实践(七) Spark的基本操作
目录 1. Spark概述 1.1 背景 1.2 特点 1.3 使用趋势 2. Spark生态系统 2.1 Spark与Hadoop的对比。 2.2 Job 2.3 容错率 2.4 通用性 2.5 实际应用 2.6 Spark生态系统组件的应用场景 2.7 Spark组件 2.7.1 Spark Core 2.7.2 Spark SQL 2.7.3 Spark Streaming 2.7.4 MLlib 2.7.5 Graphx 2.7.6 Cluster Managers 3. Spark运行架构 3.1 基本概念 3.2 架构设计 3.3 Spark 运行基本流程 3.4 Spark 运行
369 0
【小白视角】大数据基础实践(七) Spark的基本操作
|
分布式计算 IDE Java
【小白视角】大数据基础实践(四) 分布式数据库HBase的常用操作
目录 1. 环境配置 2. 操作步骤: 2.1 环境搭建 2.2 Hbase Shell 2.3 Java Api 3. 结论 最后 1. 环境配置 ⚫ 操作系统:Linux(建议 Ubuntu18.04); ⚫ Hadoop 版本:3.1.3; ⚫ JDK 版本:1.8; ⚫ Java IDE:IDEA; ⚫ Hadoop 伪分布式配置 ⚫ HBase1.1.5
255 0
【小白视角】大数据基础实践(四) 分布式数据库HBase的常用操作
|
存储 分布式计算 网络协议
【小白视角】大数据基础实践(三)HDFS的简单基本操作
HDFS的简单基本操作 1. 实验环境 2. HDFS 2.1 简介 2.2 体系结构 2.2.1 NameNode 2.2.2 SecondaryNameNode 2.2.3 DataNode 2.2.4 通讯协议 2.2.5 局限性 3. 利用Shell命令HDFS进行交互 3.1 概要 3.2 目录操作 3.3 文件操作 4. 利用web界面管理HDFS 5. 使用JavaApi进行管理HDFS 5.1 导包并测试 5.2 题目 第一题 第二题 第三题 6. 在集群上运行 7. 结语 最后
398 0
【小白视角】大数据基础实践(三)HDFS的简单基本操作
|
存储 SQL 分布式计算
【小白视角】大数据基础实践(二)Hadoop环境搭建与测试
【小白视角】大数据基础实践(二)Hadoop环境搭建与测试
333 0
【小白视角】大数据基础实践(二)Hadoop环境搭建与测试
|
分布式计算 Ubuntu 网络协议
【小白视角】大数据基础实践(一)搭建Hadoop集群
【小白视角】大数据基础实践(一)搭建Hadoop集群
218 0
【小白视角】大数据基础实践(一)搭建Hadoop集群
|
存储 NoSQL 大数据
大数据小视角2:ORCFile与Parquet,开源圈背后的生意
上一篇文章聊了聊基于PAX的混合存储结构的RCFile,其实这里笔者还了解一些八卦,RCfile的主力团队都是来自中科院的童鞋在Facebook完成的,算是一个由华人主导的编码项目。
1545 0

热门文章

最新文章