《大数据原理:复杂信息的准备、共享和分析》一一2.2 标识符系统的特征

本文涉及的产品
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: 本节书摘来自华章出版社《大数据原理:复杂信息的准备、共享和分析》一 书中的第2章,第2.2节,作者:[美] 朱尔斯 J. 伯曼(Jules J. Berman)著 ,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

2.2 标识符系统的特征
对象标识符是与对象相关联的字母数字字符串。对于很多大数据资源,人是最受关注的数据管理对象。一个原因是,许多大数据资源被用来存储和检索个人有关信息。另一个原因是数据管理的当务之急是以绝对的确定性建立涉及人类重要信息的标识符(例如,银行交易、输血记录等)。我们会看到,在有关不变性的讨论中(见第6章),有充足的理由存储大数据资源中数据对象包含的全部信息,以及提供每个数据对象的标识符(见术语表,Immutability,Mutability)。因此,数据管理的重要任务之一就是建立一个可靠的标识系统23。
一个好的标识符系统具备如下特征:
1.完整性。每个数据对象必须指定一个标识符。
2.唯一性。每个标识符都是唯一的序列。
3.排他性。每个标识符只分配给一个唯一的对象,而不是没有其他对象。
4.真实性。接受标识的对象必须验证为就是计划被标识的对象。例如,如果一个年轻人走进一家银行,并声称自己是Richie Rich,那么银行必须确保他是,事实上,他说他是谁不管用。
5.聚合性。大数据资源必须有一个机制来聚合所有与标识符相关的数据(即捆绑所有属于唯一标识对象的数据)。在银行,这可能意味着收集所有与账户相关联的交易。在医院,这可能意味着收集所有与病人的标识符相关联的数据:就诊报告、用药情况、外科手术和化验结果。如果标识符系统执行适当,聚合方法将始终收集所有与某个对象相关联的数据,并且绝不会收集与不同对象相关联的任何数据。
6.永久性。标识符和相关联的数据必须是永久保存的。在医院系统中,当消失30年的患者返回医院,该记录系统必须能够访问他的标识符和相关数据。如果患者死亡,患者的标识符也不能消失。
7.协调性。应当有一种多个大数据资源的同一个数据对象的合并机制。这个过程被称为调谐,需要实施比较、验证和合并。医疗记录的可移植性需要调谐,当病人到医院就诊,可能需要从其他医院调用她的电子医疗记录(见术语表,Ectronic medical record)。两家医院需要确认病人的身份,并合并医疗记录。
8.不变性。标识符除了具有永久性之外(即从来没有被破坏或丢失),还必须永远不会改变(见第6章)24。倘若两大数据资源合并,或将遗留数据合并到一个大数据资源,或对两个不同的大数据资源的个别数据对象合并,每个数据对象会有两个数据资源分配的标识符。在这种情况下,两个标识符必须毫无修改地都被保留下来。合并后的数据对象必须有注释性信息,提供每个标识符的确切起源(即说明该标识符是来自哪个大数据资源)。
9.安全性。标识系统很容易受到恶意攻击。如果标识符被篡改,大数据资源会出现不可逆的损坏。在关于人的标识系统中,被盗标识符可用于多种针对个人的恶意活动。
10.文档和质量保证。应当有发现和改正病人识别系统的错误的系统。必须编写用于建立标识系统、分配标识符、保护系统和监视系统的协议。遇到的每个问题和采取的每个纠正措施都必须记录在案并通过检验。检验程序应当确定纠正措施是否有效,并保证标识系统性能的持续监控。所有检验程序、采取的行动以及所有系统修改情况都应当有详细的记录,这是一个大工程。
11.向心性。判断信息系统是属于一家储蓄银行、一家航空公司、监狱系统或一家医院,标识符发挥核心作用。你可以将信息系统看作标识符与数据连接的桥梁。例如,在医院信息系统里,病人的标识符是连接病人每次医疗记录的密钥。
12.自主权。标识系统有它独立于大数据资源的生命周期。即使大数据的所有数据资源突然消失(即所有的数据中包含的所有数据对象被删除),标识系统还可以持续运转下去,记录和整理现有的和未来的数据对象。

相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
23天前
|
存储 分布式计算 大数据
基于Python大数据的的电商用户行为分析系统
本系统基于Django、Scrapy与Hadoop技术,构建电商用户行为分析平台。通过爬取与处理海量用户数据,实现行为追踪、偏好分析与个性化推荐,助力企业提升营销精准度与用户体验,推动电商智能化发展。
|
2月前
|
存储 SQL 分布式计算
终于!大数据分析不用再“又要快又要省钱”二选一了!Dataphin新功能太香了!
Dataphin推出查询加速新功能,支持用StarRocks等引擎直连MaxCompute或Hadoop查原始数据,无需同步、秒级响应。数据只存一份,省成本、提效率,权限统一管理,打破“又要快又要省”的不可能三角,助力企业实现分析自由。
203 49
|
22天前
|
机器学习/深度学习 大数据 关系型数据库
基于python大数据的台风灾害分析及预测系统
针对台风灾害预警滞后、精度不足等问题,本研究基于Python与大数据技术,构建多源数据融合的台风预测系统。利用机器学习提升路径与强度预测准确率,结合Django框架实现动态可视化与实时预警,为防灾决策提供科学支持,显著提高应急响应效率,具有重要社会经济价值。
|
22天前
|
机器学习/深度学习 大数据 关系型数据库
基于python大数据的青少年网络使用情况分析及预测系统
本研究基于Python大数据技术,构建青少年网络行为分析系统,旨在破解现有防沉迷模式下用户画像模糊、预警滞后等难题。通过整合多平台亿级数据,运用机器学习实现精准行为预测与实时干预,推动数字治理向“数据驱动”转型,为家庭、学校及政府提供科学决策支持,助力青少年健康上网。
|
2月前
|
存储 SQL 分布式计算
MaxCompute 聚簇优化推荐原理
基于历史查询智能推荐Clustered表,显著降低计算成本,提升数仓性能。
239 4
MaxCompute 聚簇优化推荐原理
|
1月前
|
传感器 人工智能 监控
拔俗多模态跨尺度大数据AI分析平台:让复杂数据“开口说话”的智能引擎
在数字化时代,多模态跨尺度大数据AI分析平台应运而生,打破数据孤岛,融合图像、文本、视频等多源信息,贯通微观与宏观尺度,实现智能诊断、预测与决策,广泛应用于医疗、制造、金融等领域,推动AI从“看懂”到“会思考”的跃迁。
|
2月前
|
数据采集 数据可视化 关系型数据库
基于python大数据的电影数据可视化分析系统
电影分析与可视化平台顺应电影产业数字化趋势,整合大数据处理、人工智能与Web技术,实现电影数据的采集、分析与可视化展示。平台支持票房、评分、观众行为等多维度分析,助力行业洞察与决策,同时提供互动界面,增强观众对电影文化的理解。技术上依托Python、MySQL、Flask、HTML等构建,融合数据采集与AI分析,提升电影行业的数据应用能力。