《大数据原理:复杂信息的准备、共享和分析》一一2.1 背景-阿里云开发者社区

开发者社区> 华章计算机> 正文

《大数据原理:复杂信息的准备、共享和分析》一一2.1 背景

简介: 本节书摘来自华章出版社《大数据原理:复杂信息的准备、共享和分析》一 书中的第2章,第2.1节,作者:[美] 朱尔斯 J. 伯曼(Jules J. Berman)著 ,更多章节内容可以访问云栖社区“华章计算机”公众号查看。
+关注继续查看

2.1 背景
数据标识无疑是最被低估和最不被理解的大数据问题。数据测量、注释、特性和类信息本身是没有任何意义的,只有当一个整合了这些信息的标识符能够对众多数据对象加以区分时,它们才是有意义的(见术语表,Annotation)。识别方法、待识别对象和类的选择,从根本上来讲,与大数据资源的组织模型相关。如果忽视或不恰当地进行数据标识,大数据资源就会出现问题。
本章将深入描述数据标识的可用方法以及标识信息的最小属性(包括唯一性、排他性、完整性、真实性和协调性)。我们会对不充分的识别行为带来的可怕后果进行讨论,并给出现实案例。可以对已识别出的数据对象进行去标识操作,在某些情况下,也可进行重标识(见术语表,Deidentification,Reidentification)。当遇到保密、隐私和知识产权问题时,拥有去标识化数据对象的能力将极为重要(见术语表,Privacy and confidentiality,Intellectual property)。错误检测、误差修正和数据验证等过程,要求有对去标识化的数据对象重新进行标识的能力。
标识系统的核心是其良好的信息系统,它提供了一种数据对象命名方式,这样可以通过数据对象的名字和检索方式将每个对象与系统中的其他对象区分开来。如果数据管理员正确地标识他们的数据,他们不用做任何事,就会获得一个比许多现有的大数据资源更有价值数据对象的集合。想象这样一个场景:为了治病,你出现在你出生的医院接受治疗,并且看到了自你出生以来的各种疾病记录。有可能:
1.医院的医疗记录中有你的名字,但不是你。多次努力后,他们发现另一个医疗卡记录了你的名字。这再一次证实这条记录是别人的。耗费大量的时间和精力后,你被告知,医院不能调出你的医疗记录。他们否认失去你的记录,只承认他们无法从信息系统中检索记录。
2.医院的医疗记录中有你的名字,但不是你。你和你的医生都不知道身份信息的错误。医生在认为别人的医疗记录是你的医疗记录的前提下,给你提供了不当的治疗。由于这个错误,你死了,但医院信息系统却没有明显的损失。
3.医院有你的医疗记录。随着最近有关测试和程序的完成,你的医生发现记录丢失了大量信息。在过去,没有人能发现这些失踪的记录。你询问医生你的记录是否可能与另一个病人或多个病人的记录搞混了,医生只是耸了耸肩。
4.医院有你的医疗记录,但该记录包含其他患者做的各种检查。其他一些患者的医疗记录里也有你的名字,并显示名字不同。似乎没有人明白有关其他病人的这些记录是如何进入你的图表中的。
5.你被告知该院已改变了其医院信息系统,旧的电子记录将不再可用。你被要求回答关于你的一长串病史问题。你的回答将被添加到新病历中,但许多情况你已经忘记了。
6.你被告知你的电子记录被转移到一个大型医院的医院信息系统中。发生这种情况是一个复杂的收购兼并的结果。你正在接受治疗的医院尚未部署多医院系统的信息结构,对你的医疗记录没有访问权限。你放心,你的记录没有丢失,医院可在十年之内获得访问权限。
7.你到达医院时发现,曾经医院引以为傲的大厦已经拆除,被一个大型购物中心所取代。你的电子记录已经一去不复返了,值得安慰的是你知道JC Penney公司现在在搞六折的珠宝促销活动。
医院信息系统是典型的大数据资源。与大多数大数据资源一样,医疗记录必须是唯一的、可访问的、完整的、未受掺杂(与其他人的记录混淆)的、永久性的和保密的数据。而如果没有适当标识系统,这一切是不可能达到的。

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
《大数据原理:复杂信息的准备、共享和分析》一一2.4 糟糕的标识方法
本节书摘来自华章出版社《大数据原理:复杂信息的准备、共享和分析》一 书中的第2章,第2.4节,作者:[美] 朱尔斯 J. 伯曼(Jules J. Berman)著 ,更多章节内容可以访问云栖社区“华章计算机”公众号查看。
907 0
分享7家典型大数据公司
          Skybox、Prismatic、SAGA、Zest Finance、Expect Labs、Decide、Trifacta这7家公司告诉了我们:大数据绝不仅仅是互联网。 【1】 Skybox  http://www.skyboximaging.com/ 大数据绝不仅仅是互联网!这家位于美国的公司利用便宜的低轨卫星和普通用户生活照片分享等数据开展基于地理位置的服务。
1208 0
如何搭建亿级社交信息分享平台?
由于移动互联网的兴起,人与人之间的交流、信息分享能够以电子信号的速度传递在各个终端设备之间,像朋友圈、微博、Twitter等社交平台的出现,大大方便和丰富了人们的日常生活。通过本文,我们来看看如何搭建一个高并发、低延时、能够承受亿级活跃用户的社交信息分享平台。
6972 0
中国电信集团产业互联网产品中心主任张东:工业大数据之路探索分享
5月5日,“2017中国工业大数据大会·钱塘峰会”在杭州国际博览中心举办。本届峰会以“数据驱动创新 融合引领变革”为主题,围绕工业大数据展开分享与交流。中国电信集团产业互联网产品中心主任张东,以“工业大数据之路探索分享“为题探讨了自己的看法。
1443 0
PgSQL · 应用案例 · 经营、销售分析系统DB设计之共享充电宝
背景 共享充电宝、共享单车、共享雨伞,共享女朋友^|^,共享汽车,。。。 共享经济最近几年发展确实非常迅猛。 共享必定涉及被共享对象的管理、会员的管理等,实际上也属于一种物联网系统。 本文以共享充电宝的场景为例,分享一下共享充电宝的经营分析、销售管理系统的后台数据库的设计。(老板关心的是整体销售的业绩,以及各个渠道的透视等。销售经理关心的是他管辖片区的销售业绩,运维人员关心的是设备的状态。)
1405 0
IDA反汇编/反编译静态分析iOS模拟器程序(四)反汇编的符号信息与改名
首先看看windows IDA和xcode的反汇编有什么不同。因为不确定直接分析UIKit的代码会不会有法律问题,还是自己写个例子吧。分析UIKit的时候因为没有完整的debugging symbols,所以得到的反汇编信息会比自己写的代码较少。
855 0
《数据挖掘:实用案例分析》——1.3 信息类BI应用与知识类BI应用
本节书摘来自华章计算机《数据挖掘:实用案例分析》一书中的第1章,第1.3节,作者 张良均 陈俊德 刘名军 陈荣,更多章节内容可以访问云栖社区“华章计算机”公众号查看。
1103 0
10059
文章
0
问答
来源圈子
更多
+ 订阅
文章排行榜
最热
最新
相关电子书
更多
《零基础CSS入门教程》
立即下载
《零基础HTML入门教程》
立即下载
《2021云上架构与运维峰会演讲合集》
立即下载