警惕大数据的“黑暗”面

简介:
  今天数据正在以前所未有的速度产生,每一个新的技术都将进一步推动这种趋势。物联网(IoT)、机器学习和医疗保健数字化,产生数据的速度很快就达到每秒数百万千兆字节。根据IMB的一项研究,自动驾驶汽车也将很快加入——到2020年每秒将生成350MB的数据。

数据存储

数据的产生与收集已经在企业中根深蒂固,时刻上演着大量数居的记录与分析。但是,这些数据的存储库并不总是结构化和一致的。事实上,未知的和未使用的数据催生了一个新的术语——“黑暗数据”。

如果我们不改变存储、管理、结构和分析数据的方式,大部分数据都将变得毫无价值。IMB同一研究表明,今天收集的所有数据中有80%是“黑暗的”,也就是说,这些数据是无效和不连贯的。未来数据量越大,“黑暗数据”引发的黑洞也就越大,导致的问题与挑战就越严重。

存储和安全

最大的挑战是,“黑暗数据”不仅难以分析,而且也容易导致存储问题。大量的非结构化数据——MS Office文件、即时消息、电子邮件、社交媒体帖子等形式获得的数据就属于此范畴。

目前存储大数据的方式包括混合云、闪存存储、智能软件设计存储(I-SDS)和冷库归档。虽然存储本身相对便宜,但是大型数据中心的维护和能源消耗产生的成本可能是一个天文数字。

安全性是与数据相关的另一个问题——无论是存储在云上还是本地基础设施上。由于数据源繁多,以及分布式计算在数据分析中的普及,均为数据泄露提供了众多机会。

质量与数量

对于大数据来说,组织迫切需要关注质量数量。一般来说,数据集越大,其质量越低。这样清理数据将比分析数据涉及更多的工作。但是,通过仅收集有意义的数据可以减少这种精力消耗。组织应努力收集来自内部和外部来源的高质量数据。但是,这种尝试减少“暗数据”的收集并不总是可行的,在这种情况下,数据探索成为重要的一步。

数据探索是确定数据集质量的过程,即使我们不知道我们正在寻找什么,也能有效地从数据中提取知识。在大数据分析中,最小的错误可能会引发随后的错误计算,从而使整个分析无法使用。使用数据探索,分析人员可以识别在进行清洁和策划的昂贵且耗时的步骤之前可能存在的任何错误。

大数据分析肯定会在未来几年甚至几个月内发生变化。认知计算已经准备好利用人工智能挖掘出几乎零错误的短距离数据集。然而,尽管如此,减少和简化收集的大数据的需求仍然比以往任何时候都重要。

 
  作者:杨旭
来源:51CTO
相关实践学习
简单用户画像分析
本场景主要介绍基于海量日志数据进行简单用户画像分析为背景,如何通过使用DataWorks完成数据采集 、加工数据、配置数据质量监控和数据可视化展现等任务。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
2月前
|
分布式计算 DataWorks IDE
MaxCompute数据问题之忽略脏数据如何解决
MaxCompute数据包含存储在MaxCompute服务中的表、分区以及其他数据结构;本合集将提供MaxCompute数据的管理和优化指南,以及数据操作中的常见问题和解决策略。
48 0
|
2月前
|
SQL 存储 分布式计算
MaxCompute问题之下载数据如何解决
MaxCompute数据包含存储在MaxCompute服务中的表、分区以及其他数据结构;本合集将提供MaxCompute数据的管理和优化指南,以及数据操作中的常见问题和解决策略。
40 0
|
2月前
|
分布式计算 关系型数据库 MySQL
MaxCompute问题之数据归属分区如何解决
MaxCompute数据包含存储在MaxCompute服务中的表、分区以及其他数据结构;本合集将提供MaxCompute数据的管理和优化指南,以及数据操作中的常见问题和解决策略。
38 0

热门文章

最新文章