《大数据原理:复杂信息的准备、共享和分析》一一2.2 标识符系统的特征

本文涉及的产品
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
简介: 本节书摘来自华章出版社《大数据原理:复杂信息的准备、共享和分析》一 书中的第2章,第2.2节,作者:[美] 朱尔斯 J. 伯曼(Jules J. Berman)著 ,更多章节内容可以访问云栖社区“华章计算机”公众号查看。

2.2 标识符系统的特征
对象标识符是与对象相关联的字母数字字符串。对于很多大数据资源,人是最受关注的数据管理对象。一个原因是,许多大数据资源被用来存储和检索个人有关信息。另一个原因是数据管理的当务之急是以绝对的确定性建立涉及人类重要信息的标识符(例如,银行交易、输血记录等)。我们会看到,在有关不变性的讨论中(见第6章),有充足的理由存储大数据资源中数据对象包含的全部信息,以及提供每个数据对象的标识符(见术语表,Immutability,Mutability)。因此,数据管理的重要任务之一就是建立一个可靠的标识系统23。
一个好的标识符系统具备如下特征:
1.完整性。每个数据对象必须指定一个标识符。
2.唯一性。每个标识符都是唯一的序列。
3.排他性。每个标识符只分配给一个唯一的对象,而不是没有其他对象。
4.真实性。接受标识的对象必须验证为就是计划被标识的对象。例如,如果一个年轻人走进一家银行,并声称自己是Richie Rich,那么银行必须确保他是,事实上,他说他是谁不管用。
5.聚合性。大数据资源必须有一个机制来聚合所有与标识符相关的数据(即捆绑所有属于唯一标识对象的数据)。在银行,这可能意味着收集所有与账户相关联的交易。在医院,这可能意味着收集所有与病人的标识符相关联的数据:就诊报告、用药情况、外科手术和化验结果。如果标识符系统执行适当,聚合方法将始终收集所有与某个对象相关联的数据,并且绝不会收集与不同对象相关联的任何数据。
6.永久性。标识符和相关联的数据必须是永久保存的。在医院系统中,当消失30年的患者返回医院,该记录系统必须能够访问他的标识符和相关数据。如果患者死亡,患者的标识符也不能消失。
7.协调性。应当有一种多个大数据资源的同一个数据对象的合并机制。这个过程被称为调谐,需要实施比较、验证和合并。医疗记录的可移植性需要调谐,当病人到医院就诊,可能需要从其他医院调用她的电子医疗记录(见术语表,Ectronic medical record)。两家医院需要确认病人的身份,并合并医疗记录。
8.不变性。标识符除了具有永久性之外(即从来没有被破坏或丢失),还必须永远不会改变(见第6章)24。倘若两大数据资源合并,或将遗留数据合并到一个大数据资源,或对两个不同的大数据资源的个别数据对象合并,每个数据对象会有两个数据资源分配的标识符。在这种情况下,两个标识符必须毫无修改地都被保留下来。合并后的数据对象必须有注释性信息,提供每个标识符的确切起源(即说明该标识符是来自哪个大数据资源)。
9.安全性。标识系统很容易受到恶意攻击。如果标识符被篡改,大数据资源会出现不可逆的损坏。在关于人的标识系统中,被盗标识符可用于多种针对个人的恶意活动。
10.文档和质量保证。应当有发现和改正病人识别系统的错误的系统。必须编写用于建立标识系统、分配标识符、保护系统和监视系统的协议。遇到的每个问题和采取的每个纠正措施都必须记录在案并通过检验。检验程序应当确定纠正措施是否有效,并保证标识系统性能的持续监控。所有检验程序、采取的行动以及所有系统修改情况都应当有详细的记录,这是一个大工程。
11.向心性。判断信息系统是属于一家储蓄银行、一家航空公司、监狱系统或一家医院,标识符发挥核心作用。你可以将信息系统看作标识符与数据连接的桥梁。例如,在医院信息系统里,病人的标识符是连接病人每次医疗记录的密钥。
12.自主权。标识系统有它独立于大数据资源的生命周期。即使大数据的所有数据资源突然消失(即所有的数据中包含的所有数据对象被删除),标识系统还可以持续运转下去,记录和整理现有的和未来的数据对象。

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
3天前
|
存储 监控 数据挖掘
【Clikhouse 探秘】ClickHouse 物化视图:加速大数据分析的新利器
ClickHouse 的物化视图是一种特殊表,通过预先计算并存储查询结果,显著提高查询性能,减少资源消耗,适用于实时报表、日志分析、用户行为分析、金融数据分析和物联网数据分析等场景。物化视图的创建、数据插入、更新和一致性保证通过事务机制实现。
26 14
|
8天前
|
消息中间件 分布式计算 大数据
数据为王:大数据处理与分析技术在企业决策中的力量
【10月更文挑战第29天】在信息爆炸的时代,大数据处理与分析技术为企业提供了前所未有的洞察力和决策支持。本文探讨了大数据技术在企业决策中的重要性和实际应用,包括数据的力量、实时分析、数据驱动的决策以及数据安全与隐私保护。通过这些技术,企业能够从海量数据中提取有价值的信息,预测市场趋势,优化业务流程,从而在竞争中占据优势。
36 2
|
9天前
|
数据采集 机器学习/深度学习 搜索推荐
大数据与社交媒体:用户行为分析
【10月更文挑战第31天】在数字化时代,社交媒体成为人们生活的重要部分,大数据技术的发展使其用户行为分析成为企业理解用户需求、优化产品设计和提升用户体验的关键手段。本文探讨了大数据在社交媒体用户行为分析中的应用,包括用户画像构建、情感分析、行为路径分析和社交网络分析,以及面临的挑战与机遇。
|
9天前
|
机器学习/深度学习 搜索推荐 大数据
大数据与教育:学生表现分析的工具
【10月更文挑战第31天】在数字化时代,大数据成为改善教育质量的重要工具。本文探讨了大数据在学生表现分析中的应用,介绍学习管理系统、智能评估系统、情感分析技术和学习路径优化等工具,帮助教育者更好地理解学生需求,制定个性化教学策略,提升教学效果。尽管面临数据隐私等挑战,大数据仍为教育创新带来巨大机遇。
|
12天前
|
人工智能 供应链 搜索推荐
大数据分析:解锁商业智能的秘密武器
【10月更文挑战第31天】在信息爆炸时代,大数据分析成为企业解锁商业智能的关键工具。本文探讨了大数据分析在客户洞察、风险管理、供应链优化、产品开发和决策支持等方面的应用,强调了明确分析目标、选择合适工具、培养专业人才和持续优化的重要性,并展望了未来的发展趋势。
|
16天前
|
存储 机器学习/深度学习 大数据
量子计算与大数据:处理海量信息的新方法
【10月更文挑战第31天】量子计算凭借其独特的量子比特和量子门技术,为大数据处理带来了革命性的变革。相比传统计算机,量子计算在计算效率、存储容量及并行处理能力上具有显著优势,能有效应对信息爆炸带来的挑战。本文探讨了量子计算如何通过量子叠加和纠缠等原理,加速数据处理过程,提升计算效率,特别是在金融、医疗和物流等领域中的具体应用案例,同时也指出了量子计算目前面临的挑战及其未来的发展方向。
|
28天前
|
存储 SQL 分布式计算
湖仓一体架构深度解析:构建企业级数据管理与分析的新基石
【10月更文挑战第7天】湖仓一体架构深度解析:构建企业级数据管理与分析的新基石
44 1
|
1月前
|
存储 分布式计算 druid
大数据-155 Apache Druid 架构与原理详解 数据存储 索引服务 压缩机制
大数据-155 Apache Druid 架构与原理详解 数据存储 索引服务 压缩机制
49 3
|
1月前
|
消息中间件 分布式计算 druid
大数据-154 Apache Druid 架构与原理详解 基础架构、架构演进
大数据-154 Apache Druid 架构与原理详解 基础架构、架构演进
27 2
|
1月前
|
消息中间件 分布式计算 druid
大数据-153 Apache Druid 案例 从 Kafka 中加载数据并分析(一)
大数据-153 Apache Druid 案例 从 Kafka 中加载数据并分析(一)
49 1
下一篇
无影云桌面