《大数据原理:复杂信息的准备、共享和分析》一一2.2 标识符系统的特征

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: 本节书摘来自华章出版社《大数据原理:复杂信息的准备、共享和分析》一 书中的第2章,第2.2节,作者:[美] 朱尔斯 J. 伯曼(Jules J. Berman)著 ,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

2.2 标识符系统的特征
对象标识符是与对象相关联的字母数字字符串。对于很多大数据资源,人是最受关注的数据管理对象。一个原因是,许多大数据资源被用来存储和检索个人有关信息。另一个原因是数据管理的当务之急是以绝对的确定性建立涉及人类重要信息的标识符(例如,银行交易、输血记录等)。我们会看到,在有关不变性的讨论中(见第6章),有充足的理由存储大数据资源中数据对象包含的全部信息,以及提供每个数据对象的标识符(见术语表,Immutability,Mutability)。因此,数据管理的重要任务之一就是建立一个可靠的标识系统23。
一个好的标识符系统具备如下特征:
1.完整性。每个数据对象必须指定一个标识符。
2.唯一性。每个标识符都是唯一的序列。
3.排他性。每个标识符只分配给一个唯一的对象,而不是没有其他对象。
4.真实性。接受标识的对象必须验证为就是计划被标识的对象。例如,如果一个年轻人走进一家银行,并声称自己是Richie Rich,那么银行必须确保他是,事实上,他说他是谁不管用。
5.聚合性。大数据资源必须有一个机制来聚合所有与标识符相关的数据(即捆绑所有属于唯一标识对象的数据)。在银行,这可能意味着收集所有与账户相关联的交易。在医院,这可能意味着收集所有与病人的标识符相关联的数据:就诊报告、用药情况、外科手术和化验结果。如果标识符系统执行适当,聚合方法将始终收集所有与某个对象相关联的数据,并且绝不会收集与不同对象相关联的任何数据。
6.永久性。标识符和相关联的数据必须是永久保存的。在医院系统中,当消失30年的患者返回医院,该记录系统必须能够访问他的标识符和相关数据。如果患者死亡,患者的标识符也不能消失。
7.协调性。应当有一种多个大数据资源的同一个数据对象的合并机制。这个过程被称为调谐,需要实施比较、验证和合并。医疗记录的可移植性需要调谐,当病人到医院就诊,可能需要从其他医院调用她的电子医疗记录(见术语表,Ectronic medical record)。两家医院需要确认病人的身份,并合并医疗记录。
8.不变性。标识符除了具有永久性之外(即从来没有被破坏或丢失),还必须永远不会改变(见第6章)24。倘若两大数据资源合并,或将遗留数据合并到一个大数据资源,或对两个不同的大数据资源的个别数据对象合并,每个数据对象会有两个数据资源分配的标识符。在这种情况下,两个标识符必须毫无修改地都被保留下来。合并后的数据对象必须有注释性信息,提供每个标识符的确切起源(即说明该标识符是来自哪个大数据资源)。
9.安全性。标识系统很容易受到恶意攻击。如果标识符被篡改,大数据资源会出现不可逆的损坏。在关于人的标识系统中,被盗标识符可用于多种针对个人的恶意活动。
10.文档和质量保证。应当有发现和改正病人识别系统的错误的系统。必须编写用于建立标识系统、分配标识符、保护系统和监视系统的协议。遇到的每个问题和采取的每个纠正措施都必须记录在案并通过检验。检验程序应当确定纠正措施是否有效,并保证标识系统性能的持续监控。所有检验程序、采取的行动以及所有系统修改情况都应当有详细的记录,这是一个大工程。
11.向心性。判断信息系统是属于一家储蓄银行、一家航空公司、监狱系统或一家医院,标识符发挥核心作用。你可以将信息系统看作标识符与数据连接的桥梁。例如,在医院信息系统里,病人的标识符是连接病人每次医疗记录的密钥。
12.自主权。标识系统有它独立于大数据资源的生命周期。即使大数据的所有数据资源突然消失(即所有的数据中包含的所有数据对象被删除),标识系统还可以持续运转下去,记录和整理现有的和未来的数据对象。

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
10天前
|
传感器 监控 大数据
指挥学校大数据系统解决方案
本系统集成九大核心平台,包括中心化指挥、数据处理、学生信息、反校园欺凌大数据、智慧课堂、学生行为综合、数据交换及其他外部系统云平台。通过这些平台,系统实现对学生行为、课堂表现、校园安全等多维度的实时监控与数据分析,为教育管理、执法机关、心理辅导等提供强有力的数据支持。特别地,反校园欺凌平台利用多种传感器和智能设备,确保及时发现并处理校园霸凌事件,保障学生权益。同时,系统还涵盖超市、食堂、图书馆、消防安全等辅助云平台,全面提升校园智能化管理水平。
|
2月前
|
传感器 人工智能 大数据
高科技生命体征探测器、情绪感受器以及传感器背后的大数据平台在健康监测、生命体征检测领域的设想与系统构建
本系统由健康传感器、大数据云平台和脑机接口设备组成。传感器内置生命体征感应器、全球无线定位、人脸识别摄像头等,搜集超出现有科学认知的生命体征信息。云平台整合大数据、云计算与AI,处理并传输数据至接收者大脑芯片,实现实时健康监测。脑机接口设备通过先进通讯技术,实现对健康信息的实时感知与反馈,确保身份验证与数据安全。
|
3天前
|
SQL 分布式计算 数据挖掘
从湖仓分离到湖仓一体,四川航空基于 SelectDB 的多源数据联邦分析实践
川航选择引入 SelectDB 建设湖仓一体大数据分析引擎,取得了数据导入效率提升 3-6 倍,查询分析性能提升 10-18 倍、实时性提升至 5 秒内等收益。
从湖仓分离到湖仓一体,四川航空基于 SelectDB 的多源数据联邦分析实践
|
7天前
|
机器学习/深度学习 数据采集 分布式计算
大数据分析中的机器学习基础:从原理到实践
大数据分析中的机器学习基础:从原理到实践
46 3
|
2月前
|
数据采集 存储 机器学习/深度学习
数据的秘密:如何用大数据分析挖掘商业价值
数据的秘密:如何用大数据分析挖掘商业价值
61 9
|
3月前
|
机器学习/深度学习 数据可视化 大数据
机器学习与大数据分析的结合:智能决策的新引擎
机器学习与大数据分析的结合:智能决策的新引擎
301 15
|
3月前
|
SQL 分布式计算 DataWorks
DataWorks产品测评|基于DataWorks和MaxCompute产品组合实现用户画像分析
本文介绍了如何使用DataWorks和MaxCompute产品组合实现用户画像分析。首先,通过阿里云官网开通DataWorks服务并创建资源组,接着创建MaxCompute项目和数据源。随后,利用DataWorks的数据集成和数据开发模块,将业务数据同步至MaxCompute,并通过ODPS SQL完成用户画像的数据加工,最终将结果写入`ads_user_info_1d`表。文章详细记录了每一步的操作过程,包括任务开发、运行、运维操作和资源释放,帮助读者顺利完成用户画像分析。此外,还指出了文档中的一些不一致之处,并提供了相应的解决方法。
|
3月前
|
分布式计算 DataWorks 搜索推荐
用户画像分析(MaxCompute简化版)
通过本教程,您可以了解如何使用DataWorks和MaxCompute产品组合进行数仓开发与分析,并通过案例体验DataWorks数据集成、数据开发和运维中心模块的相关能力。
|
4月前
|
机器学习/深度学习 存储 大数据
在大数据时代,高维数据处理成为难题,主成分分析(PCA)作为一种有效的数据降维技术,通过线性变换将数据投影到新的坐标系
在大数据时代,高维数据处理成为难题,主成分分析(PCA)作为一种有效的数据降维技术,通过线性变换将数据投影到新的坐标系,保留最大方差信息,实现数据压缩、去噪及可视化。本文详解PCA原理、步骤及其Python实现,探讨其在图像压缩、特征提取等领域的应用,并指出使用时的注意事项,旨在帮助读者掌握这一强大工具。
240 4
|
4月前
|
关系型数据库 分布式数据库 数据库
PolarDB 以其出色的性能和可扩展性,成为大数据分析的重要工具
在数字化时代,企业面对海量数据的挑战,PolarDB 以其出色的性能和可扩展性,成为大数据分析的重要工具。它不仅支持高速数据读写,还通过数据分区、索引优化等策略提升分析效率,适用于电商、金融等多个行业,助力企业精准决策。
87 4