你不能不知道的14个大数据专业词汇

本文涉及的产品
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
简介:

随着大数据技术的不断提高,大数据应用的不断普及,大数据与各行各业的关系越来越紧密。大数据行业充斥着大量的专业词汇,准确掌握和了解这些词汇的含义,有助于更好的理解大数据,更好地利用大数据技术。以下整理了以数据处理为中心的14个大数据专业词汇, 一起来看看吧~~~

大数据

本地数据库(LDB/Local Data Base)

本地数据库是指驻留于运行客户应用程序的机器的数据库。本地数据库位于本地磁盘或局域网。典型的本地数据库有Paradox、dBASE、FoxPro和ACCCSS。

数据采集(Data Acquisition,DAQ)

数据采集又称数据获取,将被测试对象的各种参量通过各种传感器做适当转换后,再经过信号调理、采样、量化、编码、传输等步骤传递到控制器的过程。

数据采集的一般步骤:①用传感器感受各种物理量,并把它们转换成电信号;②通过A/D转换,模拟量的数据转变成数字量的数据;③数据的记录,打印输出或存入磁盘文件。④生产厂商为该采集系统编制的专用程序,常用于大型专用系统;⑤固化的采集程序,常用于小型专用系统;⑥利用生产厂商提供的软件工具,用户自行编制的采集程序,主要用于组合式系统。

数据模型(data model)

数据模型是现实世界数据特征的抽象,用于描述一组数据的概念和定义。数据模型是数据库中数据的存储方式,是数据库系统的基础。在数据库中,数据的物理结构又称数据的存储结构,就是数据元素在计算机存储器中的表示及其配置;数据的逻辑结构则是指数据元素之间的逻辑关系,它是数据在用户或程序员面前的表现形式,数据的存储结构不一定与逻辑结构一致。

数据整理(Data Cleansing)

数据整理是对调查、观察、实验等研究活动中所搜集到的资料进行检验、归类编码和数字编码的过程,是数据统计分析的基础。

数据处理(Data Handling)

数据处理是指对数据(包括数值的和非数值的)进行分析和加工的技术过程。也就是对数据的采集、存储、检索、加工、变换和传输,将数据转换为信息的过程。

数据压缩(Data Compression)

数据压缩是指在不丢失有用信息的前提下,缩减数据量以减少数据的存储空间,提高其传输、存储和处理效率,或按照一定的算法对数据进行重新组织,减少数据的冗余和存储的空间的一种技术方法。

数据恢复(Data Recovery)

数据恢复是指通过技术手段,将保存在台式机硬盘、笔记本硬盘、服务器硬盘、移动硬盘、U盘等等设备上由于各种原因导致损伤或丢失的数据进行抢救和恢复的技术。

数据集成(Data Integration)

数据集成是把不同来源、格式、特点性质的数据在逻辑上或物理上有机地集中,从而为企业提供全面的数据共享。数据集成维护了数据源整体上的数据一致性、提高信息共享利用的效率。

数据迁移(Data Migration)

数据迁移又称分级存储管理,是一种将离线存储与在线存储融合的技术。将高速、高容量的非在线存储设备作为磁盘设备的下一级设备,将磁盘中常用的数据按指定策略自动迁移到磁带库等二级容量存储设备上。当需要使用这些数据时,分级存储系统会自动将这些数据从下一级存储设备调回到上一级磁盘上。

数据冗余(Data Redundancy)

数据冗余是指同一个数据在系统中多次重复出现。消除数据冗余的目的是为了避免更新时可能出现的问题,以便保持数据的一致性。

数据抽取

数据抽取是指从源数据源系统抽取目的数据源系统需要的数据的过程。

网络数据抽取 (Web data mining)

网络数据抽取(Web data mining),是指从网络中取得大量的又利用价值的数字化信息。主要包括结构化数据抽取(Structured Data Extraction)、信息集成(Informationintegreation)和观点挖掘(Opinion mining)等。

结构化数据抽取的目标是从Web页面中抽取结构化数据。这些结构化数据往往存储在后台数据库中,由网页按一定格式承载着展示给用户。例如论坛列表页面、Blog页面、搜索引擎结果页面等。信息集成是针对结构化数据而言,其目标是将从不同网站中抽取出的数据统一化后集成入库。其关键问题是如何从不同网站的数据表中识别出意义相同的数据并统一存储。

数据标准化(data standardization)

数据标准化是指研究、制定和推广应用统一的数据分类分级、记录格式及转换、编码等技术标准的过程。

数据备份(Data Backup)

数据备份是容灾的基础,为防着系统出现操作失误或系统故障导致数据丢失,而将全部或部分数据集合从原来存储的地方复制到其他地方的活动,将数据遭受破坏的程度减到最小。传统的数据备份主要采用内置或外置的磁带机进行冷备份。这种方式只能防止操作失误等人为故障,其恢复时间也很长。现代企业采用网络备份,通过专业的数据存储管理软件结合相应硬件和存储设备来实现备份。

1.完全备份(Full Backup)。优点是当发生数据丢失的灾难时,可以迅速恢复丢失的数据。不足之处是每天都对整个系统进行完全备份,造成备份的数据大量重复。

2.增量备份(Incremental Backup)。先实施一次完全备份,后续时间里只要对当天的或修改过的数据进行备份。优点:节省了磁盘空间,缩短了备份时间;缺点是数据恢复比较麻烦,备份的可靠性很差。

3.差分备份(Differential Backup)。先实施一次完全备份,再将当天所有与备份不同的数据(新的或修改过的)备份到磁盘上。该策略避免了以上两种策略缺陷的同时,具备其所有优点。首先,它无须每天都对系统做完全备份,所需的备份时间短,节省磁盘空间。其次,数据恢复方便。一旦发生问题,用户只需使用完全备份和发生问题前一天的备份就可以将系统恢复。

本文转自d1net(转载)

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
8月前
|
大数据
数据治理专业认证CDMP学习笔记(思维导图与知识点)- 第14章大数据与数据科学篇
数据治理专业认证CDMP学习笔记(思维导图与知识点)- 第14章大数据与数据科学篇
|
SQL 分布式计算 大数据
阿里云大数据ACP专业认证实验之05-MaxCompute内置函数(上)(二)
阿里云大数据ACP专业认证实验之05-MaxCompute内置函数(上)(二)
260 0
阿里云大数据ACP专业认证实验之05-MaxCompute内置函数(上)(二)
|
SQL 分布式计算 DataWorks
阿里云大数据ACP专业认证实验之05-MaxCompute内置函数(上)(一)
阿里云大数据ACP专业认证实验之05-MaxCompute内置函数(上)(一)
242 0
阿里云大数据ACP专业认证实验之05-MaxCompute内置函数(上)(一)
|
SQL 分布式计算 算法
阿里云大数据ACP专业认证实验之06-MaxCompute内置函数(下)
阿里云大数据ACP专业认证实验之06-MaxCompute内置函数(下)
173 0
阿里云大数据ACP专业认证实验之06-MaxCompute内置函数(下)
|
SQL 分布式计算 算法
二本材料专业转型大数据两年,从月薪17K到年薪55W
二本材料专业转型大数据两年,从月薪17K到年薪55W
二本材料专业转型大数据两年,从月薪17K到年薪55W
|
存储 分布式计算 算法
二本材料专业,干过销售,当过兵,28岁零基础转型大数据开发进百度,很强势!
二本材料专业,干过销售,当过兵,28岁零基础转型大数据开发进百度,很强势!
二本材料专业,干过销售,当过兵,28岁零基础转型大数据开发进百度,很强势!
|
存储 运维 大数据
阿里云大数据专业认证考试是什么
现在随着企业的发展以及互联网时代的到来,资源的增加都需要服务器扩容,而且在现在大数据盛行的现在,网络更是无处不在。关于大数据以容量大、类型多,好多人现在学习,以下我们就来了解关于阿里云大数据专业认证考试的内容。
282 0
阿里云大数据专业认证考试是什么
|
存储 运维 大数据
阿里云acp大数据专业认证考试是什么?大数据是什么?
现在随着企业的发展以及互联网时代的到来,资源的增加都需要服务器扩容,而且在现在大数据盛行的现在,网络更是无处不在。关于大数据以容量大、类型多,好多人现在学习,以下我们就来了解关于阿里云大数据专业认证考试的内容。
312 0
阿里云acp大数据专业认证考试是什么?大数据是什么?
|
存储 运维 大数据
阿里云大数据专业认证考试是什么?大数据是什么?
现在随着企业的发展以及互联网时代的到来,资源的增加都需要服务器扩容,而且在现在大数据盛行的现在,网络更是无处不在。关于大数据以容量大、类型多,好多人现在学习,以下我们就来了解关于阿里云大数据专业认证考试的内容。
253 0
阿里云大数据专业认证考试是什么?大数据是什么?
|
大数据 数据挖掘 数据处理
阿里云大数据专业认证的好处?
这是一个信息化的时代,信息化的直接表现就是数据,那这些数据从什么地方来的?是来自人们每天操作手机进行互联网各种行为,产生海量的数据,也称为“大数据”。那么这多的大数据怎么产生商业价值呢?答案就是需要人对数据进行处理,从中找到有价值的信息,然而每个人对数据处理专业水平有高低,那么问题来了,怎么判断一个人数据处理水平呢?
301 0
阿里云大数据专业认证的好处?