kettle开发篇-读取CSV文件

简介: 笔记

60.png

前言:

现在很多系统没有存储到数据库中,比如实验室的检测设备、近红外、粒度分析仪等,但是这些数据对企业产品质量的评估有不可或缺的影响。通常这些数据只能通过导出为CSV格式的文件存储起来,由于CSV文件本身的行数限制和性能达不到数据分析的要求,因此需要我们将CSV文件的数据存储至数据库里面。本文介绍通过kettle来存储CSV的文件的数据,并在入库前将异常数据进行清洗。


一、什么是CSV文件


CSV (逗号分隔值文件格式)

逗号分隔值(Comma-Separated Values,CSV,有时也称为字符分隔值,因为分隔字符也可以不是逗号),其文件以纯文本形式存储表格数据(数字和文本)。纯文本意味着该文件是一个字符序列,不含必须像二进制数字那样被解读的数据。CSV文件由任意数目的记录组成,记录间以某种换行符分隔;每条记录由字段组成,字段间的分隔符是其它字符或字符串,最常见的是逗号或制表符。通常,所有记录都有完全相同的字段序列。通常都是纯文本文件。建议使用WORDPAD或是记事本来开启,再则先另存新档后用EXCEL开启,也是方法之一。

CSV文件格式的通用标准并不存在,但是在RFC 4180中有基础性的描述。使用的字符编码同样没有被指定,但是bitASCII是最基本的通用编码。

CSV是一种通用的、相对简单的文件格式,被用户、商业和科学广泛应用。最广泛的应用是在程序之间转移表格数据,而这些程序本身是在不兼容的格式上进行操作的(往往是私有的和/或无规范的格式)。因为大量程序都支持某种CSV变体,至少是作为一种可选择的输入/输出格式。

从CSV文件的定义来看,我们关键要了解CSV文件的分隔符,常见的分隔符是逗号和制表符。但是通常也存在用空格来分隔的,这种就非常不建议,特别容易导致数据读取错误或者失败,因为如果连续存在两个或者多个不确定的空格时,容易导致数据读取失败。


二、kettle读取CSV文件


最终转换的效果图长这样,里面的CSV文件输入、字符串替换、增加常量、过滤记录、插入/更新5个步骤,下面我详细说说各个步骤的作用机制。

61.png

1、CSV文件输入

这个步骤用来读取CSV文件的数据,这里面最重要的是输入分隔符,默认我们输入为逗号,如果我们不清楚我们的CSV文件是通过什么分隔的,我们可以采用记事本打开CSV文件就可以轻松查看到对应的分隔符了。默认第一行的名称作为我们的列名,当然也可以指定哪一行作为列名。


62.pngimage.png

2、字符串替换

这一步的主要目的是替换掉我们不需要的数据,比如"""3-2的平均值""",实际我们存储至数据库的时候只需要3-2的平均值,因此需要将不需要的字符串替换掉。

image.png

3、增加常量

这一步的目的是增加,CSV里面没有的数据,比如车间、基地、公司等,一起存入数据库便于按不同维度来区分。

image.png

4、过滤记录

如上图CSV文件所示,CSV文件里面存在很多重复的标题行和空行及类似的错误数据,这些都需要我们进行清洗后入库。如图所示过滤了标题行和为空的数据行。


image.png

5、插入更新

将我们读取的数据按插入更新的方式保存至数据库中。1.png


相关文章
|
2月前
|
数据采集 机器学习/深度学习 数据可视化
【办公自动化】使用Python批量处理Excel文件并转为csv文件
【办公自动化】使用Python批量处理Excel文件并转为csv文件
46 0
|
7月前
|
存储 编译器 Python
python文件处理-CSV文件的读取、处理、写入
python文件处理-CSV文件的读取、处理、写入
180 0
python文件处理-CSV文件的读取、处理、写入
|
3月前
|
分布式计算 DataWorks MaxCompute
这个错误可能是由于读取CSV文件到ODPS的过程中出现了一些问题
这个错误可能是由于读取CSV文件到ODPS的过程中出现了一些问题【1月更文挑战第10天】【1月更文挑战第50篇】
26 3
|
5月前
|
存储 数据处理 Python
批量读取docx文件中的excel表格格式数据
批量读取docx文件中的excel表格格式数据
68 6
|
9月前
|
存储 数据处理 索引
将物模型数据导出到本地并保存为Excel文件
将物模型数据导出到本地并保存为Excel文件
195 3
|
11月前
|
数据处理 Python
多线程操作CSV文件并且将CSV文件转成XLSX文件
多线程操作CSV文件并且将CSV文件转成XLSX文件
156 0
|
存储 数据采集 文件存储
|
关系型数据库 MySQL
SparkDSL修改版之从csv文件读取数据并写入Mysql
SparkDSL修改版之从csv文件读取数据并写入Mysql
159 1
|
测试技术
自动化测试教程(12)读取csv文件
2.读取步骤:(1)导入CSV代码库;(2)以只读形式打开文件;(3)由于打开文件的数据不能直接查看,所以要进行格式转换;(4)使用for循环打印除第一行标题
自动化测试教程(12)读取csv文件
|
存储 数据处理 开发者
Csv 文件的读写 | 学习笔记
快速学习 Csv 文件的读写
632 0
Csv 文件的读写 | 学习笔记