kettle开发篇-读取CSV文件

简介: 笔记

60.png

前言:

现在很多系统没有存储到数据库中,比如实验室的检测设备、近红外、粒度分析仪等,但是这些数据对企业产品质量的评估有不可或缺的影响。通常这些数据只能通过导出为CSV格式的文件存储起来,由于CSV文件本身的行数限制和性能达不到数据分析的要求,因此需要我们将CSV文件的数据存储至数据库里面。本文介绍通过kettle来存储CSV的文件的数据,并在入库前将异常数据进行清洗。


一、什么是CSV文件


CSV (逗号分隔值文件格式)

逗号分隔值(Comma-Separated Values,CSV,有时也称为字符分隔值,因为分隔字符也可以不是逗号),其文件以纯文本形式存储表格数据(数字和文本)。纯文本意味着该文件是一个字符序列,不含必须像二进制数字那样被解读的数据。CSV文件由任意数目的记录组成,记录间以某种换行符分隔;每条记录由字段组成,字段间的分隔符是其它字符或字符串,最常见的是逗号或制表符。通常,所有记录都有完全相同的字段序列。通常都是纯文本文件。建议使用WORDPAD或是记事本来开启,再则先另存新档后用EXCEL开启,也是方法之一。

CSV文件格式的通用标准并不存在,但是在RFC 4180中有基础性的描述。使用的字符编码同样没有被指定,但是bitASCII是最基本的通用编码。

CSV是一种通用的、相对简单的文件格式,被用户、商业和科学广泛应用。最广泛的应用是在程序之间转移表格数据,而这些程序本身是在不兼容的格式上进行操作的(往往是私有的和/或无规范的格式)。因为大量程序都支持某种CSV变体,至少是作为一种可选择的输入/输出格式。

从CSV文件的定义来看,我们关键要了解CSV文件的分隔符,常见的分隔符是逗号和制表符。但是通常也存在用空格来分隔的,这种就非常不建议,特别容易导致数据读取错误或者失败,因为如果连续存在两个或者多个不确定的空格时,容易导致数据读取失败。


二、kettle读取CSV文件


最终转换的效果图长这样,里面的CSV文件输入、字符串替换、增加常量、过滤记录、插入/更新5个步骤,下面我详细说说各个步骤的作用机制。

61.png

1、CSV文件输入

这个步骤用来读取CSV文件的数据,这里面最重要的是输入分隔符,默认我们输入为逗号,如果我们不清楚我们的CSV文件是通过什么分隔的,我们可以采用记事本打开CSV文件就可以轻松查看到对应的分隔符了。默认第一行的名称作为我们的列名,当然也可以指定哪一行作为列名。


62.pngimage.png

2、字符串替换

这一步的主要目的是替换掉我们不需要的数据,比如"""3-2的平均值""",实际我们存储至数据库的时候只需要3-2的平均值,因此需要将不需要的字符串替换掉。

image.png

3、增加常量

这一步的目的是增加,CSV里面没有的数据,比如车间、基地、公司等,一起存入数据库便于按不同维度来区分。

image.png

4、过滤记录

如上图CSV文件所示,CSV文件里面存在很多重复的标题行和空行及类似的错误数据,这些都需要我们进行清洗后入库。如图所示过滤了标题行和为空的数据行。


image.png

5、插入更新

将我们读取的数据按插入更新的方式保存至数据库中。1.png


相关文章
|
6月前
|
Python
python_读写excel、csv记录
python_读写excel、csv记录
56 0
|
4月前
|
关系型数据库 MySQL 数据库
使用Python读取xlsx表格数据并导入到MySQL数据库中时遇到的问题24
【7月更文挑战第24天】使用Python读取xlsx表格数据并导入到MySQL数据库中
62 7
|
3月前
|
存储 Python
使用CSV模块读取CSV文件--含代码
使用CSV模块读取CSV文件--含代码
30 0
|
3月前
Navicat——数据以CSV格式文件导出后乱码
Navicat——数据以CSV格式文件导出后乱码
57 0
|
6月前
|
数据采集 存储 人工智能
Python采集数据保存CSV文件内容乱码解决
Python采集数据保存CSV文件内容乱码解决
86 1
|
SQL 数据库
SPSS读取数据文件
SPSS读取数据文件
173 0
|
6月前
|
分布式计算 DataWorks MaxCompute
这个错误可能是由于读取CSV文件到ODPS的过程中出现了一些问题
这个错误可能是由于读取CSV文件到ODPS的过程中出现了一些问题【1月更文挑战第10天】【1月更文挑战第50篇】
70 3
|
存储 数据处理 Python
批量读取docx文件中的excel表格格式数据
批量读取docx文件中的excel表格格式数据
100 6
|
API C++ Python
Fiona简介及Shapefile数据读取
用GDAL的Python绑定API书写程序有没有一种仍然在写C/C++的感觉,Fiona基于GDAL提供了更加Pythonic的读取空间矢量数据的API,参见:http://toblerity.org/fiona/index.html
114 0
|
测试技术 数据安全/隐私保护