OushuDB 小课堂丨零拷贝集成:小数据实践将如何取代大数据

简介: OushuDB 小课堂丨零拷贝集成:小数据实践将如何取代大数据

数据的未来很小。

随着组织努力应对不断增加的数据量,大数据运动的局限性变得越来越明显。在过去的二十年里, 大数据 以尖端软件的形式提供了好处,使数据的生成、收集和合并对组织广泛可用。这些积极影响既广泛又明显,从航空的最佳路线规划到金融部门的欺诈检测和风险管理,甚至在联邦层面追踪传染病。

但今天, 数据存储、清洁和准备以及结构化已经开始超出我们从所有这些信息中收集我们想要的东西的能力。大数据有时可能太大,以至于我们无法按照实时业务的步伐进行实际分析和利用。


将大数据转化为小数据


也许解决这个问题的方法是小数据。小数据是对用户更友好、更易于访问并提供可衡量收益的信息。小数据的目标是在正确的时间为分析师提供他们需要的数据,以便他们做出最明智和最及时的决策。

在寻求将大数据转换为小数据时,公司可以采取几种不同的途径。最直接的方法是创立一家以数据为中心的理念的公司,建立在数据与公司任何其他资产同等重要的基本理解之上。

这实际上意味着为所需的每个类别创建一组数据,并制定政策强制员工从数据中提取他们需要的内容,并将可操作的准确信息返回给各自的部门。

这可能需要组织小组重新组织他们从中央“黄金记录”数据中获取的数据。但是,只有少数负责维护数据集完整性的专家有权更改组织的主要数据集。

与此同时,世界其他地方通过复制数据集、更改这些数据集而不维护“黄金记录”数据集的完整性,无意中使他们的情况复杂化。

尽管复制和更改所有这些数据集最初可以帮助组织在短期内实现摆在他们面前的任何目标,但今天的后果包括孤立的数据集,使机器无法与这些数据库进行通信并从中提取相关信息。

以数据为中心的架构是围绕有目的地围绕数据的操作构建的。这也意味着安全和治理协议可以插入数据本身,因此它能够保护自己。

然而,当今私营和公共部门的不幸事实是,绝大多数公司和组织无法突然转变为以数据为中心。那些确实转向这一战略的公司受益于从头开始发展和扩大规模的能力。


零拷贝集成解决方案


理想情况下,由重复数据集引起的问题将通过零拷贝集成解决——无需复制或以其他方式物理移动数据的按需集成数据。

此过程将数据拉到一起,而不是将其粘贴到数据存储单元(如池、湖和仓库)中。这允许跨多个数据集进行联合查询,分析师可以在其中利用黄金记录(事实来源),而不必将它们复制到另一个数据孤岛中。

零拷贝集成还允许“数据洁净室”,可以在不泄露实际数据的情况下比较和分析来自不同来源的敏感数据。这可以使用不共享数据但仍然能够分析数据并识别相关位以进行多方计算的密码学来完成。

例如,行业监管者可能想要了解许多公司有多少共同客户。客户拥有数据并能够遵守隐私和合规惯例。但是使用密码技术,普通人可以在不共享信息的情况下得到答案。

近年来,各行各业的公司花费了数千万美元和人力小时试图以更高效、更不易出错并提供真正洞察力的方式重新定位他们的数据管理系统。但这个过程不可避免地缓慢且昂贵。

零拷贝集成功能很快将成为公司用来扩大规模和保持竞争力的主要燃料类型之一。那些采用这种方法的人突然吹嘘自己的市场差异化优势。那些忽视这个问题的人将被抛在后面,很可能会停止运作。

但买进必须发生在执行团队层面。首席信息官了解零拷贝集成是未来。但他们需要他们的最高管理层同事分享这一愿景。

如果组织的最高领导者没有认识到这种转变的必要性并提供资源来实现变革,那么就不可能顺利过渡到新的和改进的系统。


将未来带入现在


转换为零拷贝集成数据管理系统的财务成本可能仍会阻止许多公司迈出这一步。组织意识到零拷贝集成提供的竞争优势,但如果成本超出预算,变革的步伐就会缓慢。

类似于互联网早期采用者的创新者将成为使零拷贝集成成为现实的推动者。这些人具有极强的动机来共享数据和协作以实现巨大的创新飞跃。

同样,学术研究人员——包括那些从事癌症数据和其他改变生活项目的研究人员——将与大数据运动的领导者一起属于这一群体。

但与最初对互联网的犹豫不决随后得到更广泛的接受类似,时间将证明零拷贝集成和以数据为中心的架构将如何成为公司计划的关键部分,因为它们希望保持竞争优势。

金融科技公司已经在使用语义图技术来实施零拷贝集成,国际供应链公司已经认识到通过以数据为中心来优化运营的动机。

一旦这种策略的早期采用者获得的好处变得明显,零拷贝集成将改变业务的开展方式——就像短短几年前的大数据一样。

更多信息请关注 OushuDB 小课堂

相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
目录
相关文章
|
4月前
|
机器学习/深度学习 传感器 分布式计算
数据才是真救命的:聊聊如何用大数据提升灾难预警的精准度
数据才是真救命的:聊聊如何用大数据提升灾难预警的精准度
359 14
|
4月前
|
人工智能 自然语言处理 安全
代码静态扫描工具集成与实践
代码静态扫描工具(Static Application Security Testing, SAST)是在不运行代码的情况下,通过分析源代码或二进制代码来发现潜在安全漏洞、代码缺陷和质量问题的工具
606 4
|
3月前
|
人工智能 Cloud Native 算法
拔俗云原生 AI 临床大数据平台:赋能医学科研的开发者实践
AI临床大数据科研平台依托阿里云、腾讯云,打通医疗数据孤岛,提供从数据治理到模型落地的全链路支持。通过联邦学习、弹性算力与安全合规技术,实现跨机构协作与高效训练,助力开发者提升科研效率,推动医学AI创新落地。(238字)
280 7
|
4月前
|
传感器 人工智能 监控
数据下田,庄稼不“瞎种”——聊聊大数据如何帮农业提效
数据下田,庄稼不“瞎种”——聊聊大数据如何帮农业提效
176 14
|
4月前
|
Java 测试技术 API
自动化测试工具集成及实践
自动化测试用例的覆盖度及关键点最佳实践、自动化测试工具、集成方法、自动化脚本编写等(兼容多语言(Java、Python、Go、C++、C#等)、多框架(Spring、React、Vue等))
262 6
|
3月前
|
传感器 人工智能 监控
拔俗多模态跨尺度大数据AI分析平台:让复杂数据“开口说话”的智能引擎
在数字化时代,多模态跨尺度大数据AI分析平台应运而生,打破数据孤岛,融合图像、文本、视频等多源信息,贯通微观与宏观尺度,实现智能诊断、预测与决策,广泛应用于医疗、制造、金融等领域,推动AI从“看懂”到“会思考”的跃迁。
353 0
|
4月前
|
安全 JavaScript 前端开发
安全漏洞检测集成及实践:SAST/DAST工具集成指南
通过合理集成和配置SAST/DAST工具,可以显著提升应用程序的安全性,并在开发早期发现和修复漏洞,降低安全风险和维护成本
482 4
|
4月前
|
机器学习/深度学习 传感器 监控
吃得安心靠数据?聊聊用大数据盯紧咱们的餐桌安全
吃得安心靠数据?聊聊用大数据盯紧咱们的餐桌安全
179 1
|
4月前
|
数据采集 自动驾驶 机器人
数据喂得好,机器人才能学得快:大数据对智能机器人训练的真正影响
数据喂得好,机器人才能学得快:大数据对智能机器人训练的真正影响
323 1
|
5月前
|
机器学习/深度学习 监控 大数据
数据当“安全带”:金融市场如何用大数据玩转风险控制?
数据当“安全带”:金融市场如何用大数据玩转风险控制?
197 10