excel导入功能中去掉重复数据—解决思路

简介: excel导入功能中去掉重复数据—解决思路 今天客户提出一个问题,能否在产品中2个子系统中的实现所有的excel导入功能过滤掉已有的数据。 我思考了一番,想到了3种大概的解决思路: 1、在插入每条数据的时候,查到对应的表找出是否存在对应的数据,如存在就跳过。

excel导入功能中去掉重复数据—解决思路

今天客户提出一个问题,能否在产品中2个子系统中的实现所有的excel导入功能过滤掉已有的数据。

我思考了一番,想到了3种大概的解决思路:

1、在插入每条数据的时候,查到对应的表找出是否存在对应的数据,如存在就跳过。

        2、把整个excel文件的里的内容存入到一张临时表中,然后查询去重并插入到目的表中。select distinct into 或insert into select,这只是去掉的当前excel表中重复的数据,不过可以和目的表联合查询出目的表中不存在的新数据,然后插入目的表中。

        3、给oracle数据库相应字段(可能多个)增加唯一约束或者对其创建创建唯一的索引,然后程序做对应的异常处理。

何为“重复数据”呢,可能有多个字段或者单个字段影响,和excel文件本身里数据重复或者数据库里的数据重复,这些就需要根据具体业务而定了。

第一种方法也是很容易想到的,不过一定要考虑性能问题,如果导入的数据很多,势必会影响性能,再者即使写这样的方法,尽可能不要改动源代码很大为前提,如写成一个公共方法,直接传入表名和约束的字段名,尽可能的遵循OOP原则,或者直接先处理好当前excel文件,把处理好准备要插入数据库中的数据存入一个List或者其他适合的集合中,最后进行批量的插入,用JDBC或者hibernate或者其他中的批量插入方法,不过这些都不是绝对的,只是一个解决思路,选哪种都要根据情形而定。

第二种方法看起来稍微有点复杂,适合excel表中的重复数据多,导入数据比较多这种情况。

第三种方法实现起来比较容易,但有些细节要注意,如果2个非主键字段判断是否是“重复数据”,是采用创建索引的形式create unique index还是constraint name_unique unique(字段1,字段2)),都要考虑字段是否为空,都为空的情形,尽管约束是可以为空的,如果都为空约束是不起作用,再者就是代码出捕获SQLException或者自己创建的异常,调用方法或者不用调用就能保证业务上这个异常就是只能由于这个原因抛出此异常,如果捕获的异常不是自己那个“违反唯一约束”的异常,要将这个异常throw让外层的try catch处理。而且如果这个导入功能的业务中有“添加”功能,得注意可能添加了重复数据报错,得想到处理这个客户体验问题。再就是添加约束时可能已有数据有所谓“重复”的,可以

select n.*
from RS_ZK_WRITTENINFO n
where (n.PROJECTID, n.IDCARD) in
(select m.PROJECTID, m.IDCARD
from RS_ZK_WRITTENINFO m
group by m.PROJECTID, m.IDCARD
having count(*) > 1)

类似的SQL语句查看重复的数据,然后把重复出来的数据删除掉,类似这样的语句:

delete from RS_ZK_WRITTENINFO n
where (n.PROJECTID, n.IDCARD) in
(select m.PROJECTID, m.IDCARD
from RS_ZK_WRITTENINFO m group by m.PROJECTID, m.IDCARD
having count(*) > 1)
and rowid not in (select min(rowid)
from RS_ZK_WRITTENINFO z
group by z.Projectid, z.IDCARD
having count(*) > 1)

然后再加约束就没问题了。本人根据情况是采用的第三种方法解决这个问题的。

       最后,认真看过的网友们,大神们,如有感觉我这个程序猿有哪个地方说的不对或者不妥或者你有很好的

议或者建议或点子方法,还望您大恩大德施舍n秒的时间留下你的宝贵文字(留言),以便你,我,还有广大的程序猿们更快地成长与进步.......

原文地址http://www.bieryun.com/2209.html

相关文章
|
1月前
|
数据采集 存储 JavaScript
自动化数据处理:使用Selenium与Excel打造的数据爬取管道
本文介绍了一种使用Selenium和Excel结合代理IP技术从WIPO品牌数据库(branddb.wipo.int)自动化爬取专利信息的方法。通过Selenium模拟用户操作,处理JavaScript动态加载页面,利用代理IP避免IP封禁,确保数据爬取稳定性和隐私性。爬取的数据将存储在Excel中,便于后续分析。此外,文章还详细介绍了Selenium的基本设置、代理IP配置及使用技巧,并探讨了未来可能采用的更多防反爬策略,以提升爬虫效率和稳定性。
|
3月前
|
关系型数据库 MySQL Shell
不通过navicat工具怎么把查询数据导出到excel表中
不通过navicat工具怎么把查询数据导出到excel表中
44 0
|
14天前
|
前端开发 Java easyexcel
SpringBoot操作Excel实现单文件上传、多文件上传、下载、读取内容等功能
SpringBoot操作Excel实现单文件上传、多文件上传、下载、读取内容等功能
55 8
|
1月前
|
数据处理 Python
Python实用记录(十):获取excel数据并通过列表的形式保存为txt文档、xlsx文档、csv文档
这篇文章介绍了如何使用Python读取Excel文件中的数据,处理后将其保存为txt、xlsx和csv格式的文件。
46 3
Python实用记录(十):获取excel数据并通过列表的形式保存为txt文档、xlsx文档、csv文档
|
2月前
|
SQL C# 数据库
EPPlus库的安装和使用 C# 中 Excel的导入和导出
本文介绍了如何使用EPPlus库在C#中实现Excel的导入和导出功能。首先,通过NuGet包管理器安装EPPlus库,然后提供了将DataGridView数据导出到Excel的步骤和代码示例,包括将DataGridView转换为DataTable和使用EPPlus将DataTable导出为Excel文件。接着,介绍了如何将Excel数据导入到数据库中,包括读取Excel文件、解析数据、执行SQL插入操作。
EPPlus库的安装和使用 C# 中 Excel的导入和导出
|
1月前
|
easyexcel Java UED
SpringBoot中大量数据导出方案:使用EasyExcel并行导出多个excel文件并压缩zip后下载
在SpringBoot环境中,为了优化大量数据的Excel导出体验,可采用异步方式处理。具体做法是将数据拆分后利用`CompletableFuture`与`ThreadPoolTaskExecutor`并行导出,并使用EasyExcel生成多个Excel文件,最终将其压缩成ZIP文件供下载。此方案提升了导出效率,改善了用户体验。代码示例展示了如何实现这一过程,包括多线程处理、模板导出及资源清理等关键步骤。
|
2月前
|
前端开发 Java easyexcel
SpringBoot操作Excel实现单文件上传、多文件上传、下载、读取内容等功能
SpringBoot操作Excel实现单文件上传、多文件上传、下载、读取内容等功能
42 6
|
2月前
|
数据采集 存储 数据挖掘
使用Python读取Excel数据
本文介绍了如何使用Python的`pandas`库读取和操作Excel文件。首先,需要安装`pandas`和`openpyxl`库。接着,通过`read_excel`函数读取Excel数据,并展示了读取特定工作表、查看数据以及计算平均值等操作。此外,还介绍了选择特定列、筛选数据和数据清洗等常用操作。`pandas`是一个强大且易用的工具,适用于日常数据处理工作。
|
3月前
|
SQL JSON 关系型数据库
n种方式教你用python读写excel等数据文件
n种方式教你用python读写excel等数据文件
|
3月前
|
存储 Java Apache

热门文章

最新文章