EXCEL数据缺失、混乱、重复怎么办?我用ETL带你走出困境

简介: 在我们的日常工作中,数据清洗通常是一个非常复杂和繁琐的过程,特别在EXCEL里进行数据清洗会显得格外痛苦,例如对数据进行简单的合并、去重、分列都需要花费不少的时间和功夫。虽然微软推出了power query这个厉害的清洗组件,但是M语言的门槛相对较高,一般人不易掌握。因此选择一个简洁的ETL工具去对数据进行清洗是一个非常好的选择。除了可以节省大量的时间,还能以可视化的界面进行操作,无需任何代码便可以快速对数据进行清洗。下面利用智分析的ETL工具,对EXCEL常见的几种清洗方法进行讲解。
   在我们的日常工作中,数据清洗通常是一个非常复杂和繁琐的过程,特别在EXCEL里进行数据清洗会显得格外痛苦,例如对数据进行简单的合并、去重、分列都需要花费不少的时间和功夫。虽然微软推出了power query这个厉害的清洗组件,但是M语言的门槛相对较高,一般人不易掌握。因此选择一个简洁的ETL工具去对数据进行清洗是一个非常好的选择。除了可以节省大量的时间,还能以可视化的界面进行操作,无需任何代码便可以快速对数据进行清洗。下面利用智分析的ETL工具,对EXCEL常见的几种清洗方法进行讲解。

1、 合并表格
我们平时工作中总会遇到需要对两个EXCEL表格进行合并的情况,例如对多个门店或者分公司的数据进行整合,如果列数都一样的时候,用复制粘贴的方式就可以对两个表格进行合并,但是如果表格的列数存在不一样的情况时,我们合并表格的难度会增加,例如以下两个表格,订单明细表B比订单明细表A多了一列,如果要合并这两个表格,则需要在A表里插入一列或者把B表里多出的这一列删除了,非常麻烦。但是用ETL工具处理就会非常迅速,以下为我用智分析的自助ETL功能对表格进行合并的方法。
image.png

▲订单明细表A
image.png

▲订单明细表B
第一步要做的就是先把两份数据导进智分析系统里,在数据连接的界面里选择EXCEL导入,分别把订单明细表A和订单明细表B导进来,并选择保存的路径。
image.png

接下来点击数据准备里的自动ETL,进入到ETL的界面后把关系数据源拖拽到中间的展示区里,并在右边的参数里找到两份表格,然后鼠标右键点击关系数据源里的“执行到此处”。

image.png

由于订单明细表B有多余的字段,我们先对这个数据源进行列选择,把数据源预处理里的‘“列选择”拖拽过去,并与订单明细表B进行相连,在输出列的界面里,把多余的字段剔除掉,这样便可以得到与A表字段相同的数据源。
image.png
image.png

最后把“合并行”这个组件拖拽到展示区里,并把订单明细表A和加工过的订单明细表B进行相连,在参数选择里选择所有字段,合并方式选择并集,这样便可以把两个表格合并在一起了。

image.png

我们看一下输出的结果,两份数据源完美地结合在一起了。如果对字段更多、更复杂的数据源进行合并,这个工具可以发挥出给力的效果。
image.png

2、 删除重复项
数据源有重复项也是经常会遇到的问题,在EXCEL里通常可以用删除重复项的功能去对数据进行去重处理,但是利用ETL一样也可以对数据进行去重。还是用上面的数据源,我们把“去除重复值”这个组件拖拽到展示区里,并与上面合并好的数据源进行相连。
image.png

连接好之后,在右边的参数选择项里选择要去重的字段,然后点击执行,我们来看一下输出的效果,两个表格里的重复值便剔除掉了,剩下的表格都是唯一值了。
image.png
image.png

3、 分列
在用EXCEL处理数据时,经常要对一些数据字段进行分列,例如上图的数据源中,我们发现了数据源中销售人员这一列有多余的信息,多了销售代表这几个字,我们应该怎样把后面名字给提取出来呢?在EXCEL中可以用LEFT、RIGHT函数或者分列的方式对文本字段进行提取,但是在ETL里一样也可以实现。首先把“分列”这个组件拉拽到展示区里,并与上面的数据源进行相连。
image.png

在右边的参数设置区里,我们先把需要分列的数据字段选择好,然后在分隔符选项里选择分列字段里所携带的分隔符,这里我们选择“-”。
image.png

我们执行看一下执行的效果,销售人员这个字段被分成了两列,并生成了新的两个字段,完美地实现了分列的效果。

image.png

4、 派生字段
如果要在ETL里增加新的数据字段也是没问题的,例如上图数据源里的订单日期包含了日期、时分秒这些信息,但是如果要把里面的年份提取出来,应该怎么做呢?这时我们把“派生字段”拉拽到展示区里,并与上面的数据进行相连。
image.png

在参数的设置界面里,点击年份提取的函数,并选择订单日期这个字段,点击确定。
image.png

我们看一下输出的效果,数据源最后的一列生成了新的一列,仅有年份的信息。如果要生成其他的字段也是可以实现的,只需编写表达式即可。
image.png

5、 元数据编辑
ETL还可以对数据的类型进行更改,例如把字段调整为浮点型、字符串、整型或者是其他的类型。同样的方法,我们把“元数据编辑”拉拽到展示区里,并与上面的数据源进行相连。
image.png

在元数据编辑的参数设置里,可以对数据字段的别名或者数据类型进行设置,这个对于数据库来说非常有用。

image.png

 以上为用ETL工具对EXCEL进行数据清洗的5个常用方法,后面还会对其他清洗方法进行讲解,敬请留意。
相关文章
|
9月前
|
Python
如何根据Excel某列数据为依据分成一个新的工作表
在处理Excel数据时,我们常需要根据列值将数据分到不同的工作表或文件中。本文通过Python和VBA两种方法实现该操作:使用Python的`pandas`库按年级拆分为多个文件,再通过VBA宏按班级生成新的工作表,帮助高效整理复杂数据。
|
9月前
|
数据采集 数据可视化 数据挖掘
用 Excel+Power Query 做电商数据分析:从 “每天加班整理数据” 到 “一键生成报表” 的配置教程
在电商运营中,数据是增长的关键驱动力。然而,传统的手工数据处理方式效率低下,耗费大量时间且易出错。本文介绍如何利用 Excel 中的 Power Query 工具,自动化完成电商数据的采集、清洗与分析,大幅提升数据处理效率。通过某美妆电商的实战案例,详细拆解从多平台数据整合到可视化报表生成的全流程,帮助电商从业者摆脱繁琐操作,聚焦业务增长,实现数据驱动的高效运营。
|
11月前
|
存储 安全 大数据
网安工程师必看!AiPy解决fscan扫描数据整理难题—多种信息快速分拣+Excel结构化存储方案
作为一名安全测试工程师,分析fscan扫描结果曾是繁琐的手动活:从海量日志中提取开放端口、漏洞信息和主机数据,耗时又易错。但现在,借助AiPy开发的GUI解析工具,只需喝杯奶茶的时间,即可将[PORT]、[SERVICE]、[VULN]、[HOST]等关键信息智能分类,并生成三份清晰的Excel报表。告别手动整理,大幅提升效率!在安全行业,工具党正碾压手动党。掌握AiPy,把时间留给真正的攻防实战!官网链接:https://www.aipyaipy.com,解锁更多用法!
|
数据采集 数据可视化 数据挖掘
利用Python自动化处理Excel数据:从基础到进阶####
本文旨在为读者提供一个全面的指南,通过Python编程语言实现Excel数据的自动化处理。无论你是初学者还是有经验的开发者,本文都将帮助你掌握Pandas和openpyxl这两个强大的库,从而提升数据处理的效率和准确性。我们将从环境设置开始,逐步深入到数据读取、清洗、分析和可视化等各个环节,最终实现一个实际的自动化项目案例。 ####
2465 10
|
数据采集 存储 JavaScript
自动化数据处理:使用Selenium与Excel打造的数据爬取管道
本文介绍了一种使用Selenium和Excel结合代理IP技术从WIPO品牌数据库(branddb.wipo.int)自动化爬取专利信息的方法。通过Selenium模拟用户操作,处理JavaScript动态加载页面,利用代理IP避免IP封禁,确保数据爬取稳定性和隐私性。爬取的数据将存储在Excel中,便于后续分析。此外,文章还详细介绍了Selenium的基本设置、代理IP配置及使用技巧,并探讨了未来可能采用的更多防反爬策略,以提升爬虫效率和稳定性。
873 4
|
9月前
|
Python
将Excel特定某列数据删除
将Excel特定某列数据删除
|
关系型数据库 MySQL Shell
不通过navicat工具怎么把查询数据导出到excel表中
不通过navicat工具怎么把查询数据导出到excel表中
224 0
|
分布式计算 Hadoop 大数据
从Excel到Hadoop:数据规模的进化之路
从Excel到Hadoop:数据规模的进化之路
316 10
|
存储 Java easyexcel
招行面试:100万级别数据的Excel,如何秒级导入到数据库?
本文由40岁老架构师尼恩撰写,分享了应对招商银行Java后端面试绝命12题的经验。文章详细介绍了如何通过系统化准备,在面试中展示强大的技术实力。针对百万级数据的Excel导入难题,尼恩推荐使用阿里巴巴开源的EasyExcel框架,并结合高性能分片读取、Disruptor队列缓冲和高并发批量写入的架构方案,实现高效的数据处理。此外,文章还提供了完整的代码示例和配置说明,帮助读者快速掌握相关技能。建议读者参考《尼恩Java面试宝典PDF》进行系统化刷题,提升面试竞争力。关注公众号【技术自由圈】可获取更多技术资源和指导。
|
数据处理 Python
Python实用记录(十):获取excel数据并通过列表的形式保存为txt文档、xlsx文档、csv文档
这篇文章介绍了如何使用Python读取Excel文件中的数据,处理后将其保存为txt、xlsx和csv格式的文件。
748 3
Python实用记录(十):获取excel数据并通过列表的形式保存为txt文档、xlsx文档、csv文档