kettle开发篇-读取CSV文件

简介: 笔记

60.png

前言:

现在很多系统没有存储到数据库中,比如实验室的检测设备、近红外、粒度分析仪等,但是这些数据对企业产品质量的评估有不可或缺的影响。通常这些数据只能通过导出为CSV格式的文件存储起来,由于CSV文件本身的行数限制和性能达不到数据分析的要求,因此需要我们将CSV文件的数据存储至数据库里面。本文介绍通过kettle来存储CSV的文件的数据,并在入库前将异常数据进行清洗。


一、什么是CSV文件


CSV (逗号分隔值文件格式)

逗号分隔值(Comma-Separated Values,CSV,有时也称为字符分隔值,因为分隔字符也可以不是逗号),其文件以纯文本形式存储表格数据(数字和文本)。纯文本意味着该文件是一个字符序列,不含必须像二进制数字那样被解读的数据。CSV文件由任意数目的记录组成,记录间以某种换行符分隔;每条记录由字段组成,字段间的分隔符是其它字符或字符串,最常见的是逗号或制表符。通常,所有记录都有完全相同的字段序列。通常都是纯文本文件。建议使用WORDPAD或是记事本来开启,再则先另存新档后用EXCEL开启,也是方法之一。

CSV文件格式的通用标准并不存在,但是在RFC 4180中有基础性的描述。使用的字符编码同样没有被指定,但是bitASCII是最基本的通用编码。

CSV是一种通用的、相对简单的文件格式,被用户、商业和科学广泛应用。最广泛的应用是在程序之间转移表格数据,而这些程序本身是在不兼容的格式上进行操作的(往往是私有的和/或无规范的格式)。因为大量程序都支持某种CSV变体,至少是作为一种可选择的输入/输出格式。

从CSV文件的定义来看,我们关键要了解CSV文件的分隔符,常见的分隔符是逗号和制表符。但是通常也存在用空格来分隔的,这种就非常不建议,特别容易导致数据读取错误或者失败,因为如果连续存在两个或者多个不确定的空格时,容易导致数据读取失败。


二、kettle读取CSV文件


最终转换的效果图长这样,里面的CSV文件输入、字符串替换、增加常量、过滤记录、插入/更新5个步骤,下面我详细说说各个步骤的作用机制。

61.png

1、CSV文件输入

这个步骤用来读取CSV文件的数据,这里面最重要的是输入分隔符,默认我们输入为逗号,如果我们不清楚我们的CSV文件是通过什么分隔的,我们可以采用记事本打开CSV文件就可以轻松查看到对应的分隔符了。默认第一行的名称作为我们的列名,当然也可以指定哪一行作为列名。


62.pngimage.png

2、字符串替换

这一步的主要目的是替换掉我们不需要的数据,比如"""3-2的平均值""",实际我们存储至数据库的时候只需要3-2的平均值,因此需要将不需要的字符串替换掉。

image.png

3、增加常量

这一步的目的是增加,CSV里面没有的数据,比如车间、基地、公司等,一起存入数据库便于按不同维度来区分。

image.png

4、过滤记录

如上图CSV文件所示,CSV文件里面存在很多重复的标题行和空行及类似的错误数据,这些都需要我们进行清洗后入库。如图所示过滤了标题行和为空的数据行。


image.png

5、插入更新

将我们读取的数据按插入更新的方式保存至数据库中。1.png


相关文章
|
2月前
|
easyexcel Java UED
SpringBoot中大量数据导出方案:使用EasyExcel并行导出多个excel文件并压缩zip后下载
在SpringBoot环境中,为了优化大量数据的Excel导出体验,可采用异步方式处理。具体做法是将数据拆分后利用`CompletableFuture`与`ThreadPoolTaskExecutor`并行导出,并使用EasyExcel生成多个Excel文件,最终将其压缩成ZIP文件供下载。此方案提升了导出效率,改善了用户体验。代码示例展示了如何实现这一过程,包括多线程处理、模板导出及资源清理等关键步骤。
|
5月前
|
关系型数据库 MySQL 数据库
使用Python读取xlsx表格数据并导入到MySQL数据库中时遇到的问题24
【7月更文挑战第24天】使用Python读取xlsx表格数据并导入到MySQL数据库中
67 7
|
4月前
|
存储 Python
使用CSV模块读取CSV文件--含代码
使用CSV模块读取CSV文件--含代码
48 0
|
存储 数据处理 索引
将物模型数据导出到本地并保存为Excel文件
将物模型数据导出到本地并保存为Excel文件
319 3
|
测试技术 数据安全/隐私保护
|
测试技术
自动化测试教程(12)读取csv文件
2.读取步骤:(1)导入CSV代码库;(2)以只读形式打开文件;(3)由于打开文件的数据不能直接查看,所以要进行格式转换;(4)使用for循环打印除第一行标题
自动化测试教程(12)读取csv文件
|
存储 数据采集 文件存储
|
存储 数据处理 开发者
Csv 文件的读写 | 学习笔记
快速学习 Csv 文件的读写
Csv 文件的读写 | 学习笔记
es数据导出csv文件
es数据导出csv文件
|
关系型数据库 MySQL 中间件
Hyperf结合PhpOffice/PhpSpreadsheet实现Excel&CSV文件导出导入
Hyperf结合PhpOffice/PhpSpreadsheet实现Excel&CSV文件导出导入。PhpSpreadsheet是一个用纯PHP编写的库,它提供了一组类,允许您读取和写入各种电子表格文
1011 0
Hyperf结合PhpOffice/PhpSpreadsheet实现Excel&CSV文件导出导入