java中处理字符编码(网页与数据库)(转)-阿里云开发者社区

开发者社区> developerguy> 正文

java中处理字符编码(网页与数据库)(转)

简介: 首先声明一下,此文章时从网上转载的。如下的某些方法是确实管用,但是从中发现了有一点不足,就是原文笔者没考虑使用不同Web Server时出现的情况,比如文章里我用红色字体画出来的部分代码在Tomcat跑的时候得用他说的方法,不过到了WebSphere的时候必须得用原先的 String name = request.getParameter("name"); 所以采取本文方法的时候不要太死板,多试试。
+关注继续查看

首先声明一下,此文章时从网上转载的。如下的某些方法是确实管用,但是从中发现了有一点不足,就是原文笔者没考虑使用不同Web Server时出现的情况,比如文章里我用红色字体画出来的部分代码在Tomcat跑的时候得用他说的方法,不过到了WebSphere的时候必须得用原先的 
String name = request.getParameter("name"); 
所以采取本文方法的时候不要太死板,多试试。 

在Java编程中,中文字体编码难倒了不少程序员,如果抓住了影响Java中文显示的几个关键因素,问题将迎刃而解。 
Java是目前最流行的面向对象的编程语言之一,Java支持UTF-8、ISO-8859-1、GBK等各种字体编码,可是发现Java中字体编码的问题仍难倒了不少程序员,网上虽然也有不少关于在Java中如何正确显示中文的文章,但都不够全面,特意总结如下。 

影响Java中字体编码正确显示的有几个因素: 
1)数据库的连接方式; 
2)网页中使用的字体编码; 
3)数据库里存放数据的字体编码; 
4)Java的缺省字体编码。 
如果在编程中遇到不能正确显示中文时,要先弄清楚以上几项所使用的字体编码,再分析找出原因,即可解决问题。 
众所周知,JSP是Java的一种,和网页有关,而网页也有自己的中文编码系统,所以JSP处理中文要比纯Java的类文件更为麻烦。本文的测试数据库是MySQL3.2,数据库连接驱动是用org.gjt.mm.mysql.Driver,这里主要讨论UTF-8和GBK的显示( GB2312是GBK的一个子集,Java中可以使用GBK来代替GB系列)。我们先来研究JSP中字体编码问题, 下面第一到第六点是针对JSP的(因为从数据库里读出中文数据与写入中文数据有所区别,咱们分别说明,前三点是从读取数据库到显示在网页,后三点是从网页输入数据到存入数据库),第七到第九点针对纯Java的类文件。 以下rs表示ResultSet的一个实例,是执行Select语句之后产生的数据集。 

一、数据库连接方式使用UTF-8 

在连接数据库的驱动后面加上这句参数 
useUnicode=true&characterEncoding=UTF-8 
例如: 
jdbc:mysql://localhost/DBVF?autoReconnect=true&useUnicode=true&characterEncoding=UTF-8 

从数据库里读出中文显示在使用GBK的JSP的网页里,如果数据库里存放的字体编码是UTF-8,在JSP中使用 
str=new String(rs.getBytes(1),"UTF-8"); 
或者 
str=rs.getString(1); 
可以正确显示中文。 

如果数据库里存放的是GBK数据,那么JSP中也要使用 
str=new String(rs.getBytes(1),"GBK"); 
来显示正确的中文。 
值得注意的是如果页面使用UTF-8,数据库里存放的是UTF-8,也可以用 
str=new String(rs.getBytes(1),"GBK"); 
正确显示中文。 

如果网页是UTF-8,而数据库里存放的是GBK,无法直接显示中文,需要2步转换, 
str=new String(rs.getBytes(1),"GBK"); 
再 
str=new String(str.getBytes("UTF-8"),"GBK"); 
才可以正确显示中文。 


二、数据库连接方式使用GBK 

在连接数据库的驱动后面加上这句参数 
useUnicode=true&characterEncoding=GBK 
例如: 
jdbc:mysql://localhost/DBVF?autoReconnect=true&UseUnicode=true&characterEncoding=GBK 
从数据库里读出中文,显示在使用GBK的JSP的网页里. 

如果数据库里存放的字体编码是UTF-8,在JSP中一定要使用 
str=new String(rs.getBytes(1),"UTF-8"); 
才正确显示中文。 

如果数据库里存放的是GBK数据,那么JSP中也要使用 
str=new String(rs.getBytes(1),"GBK"); 
或者直接使用 
str=rs.getString(1); 
即可显示正确的中文。 

如果网页是UTF-8,而数据库里存放的是GBK,只能用 
str=new String(rs.getString(1).getBytes("UTF-8"),"GBK"); 
的方法来显示中文. 

如果网页是UTF-8,而数据库里存放的是UTF-8,可用 
str=new String(rs.getBytes(1),"GBK"); 
或者 
rs.getString(1)方法来显示中文。 


三、使用缺省数据库连接方式 

连接数据库的驱动后面没有这句参数 
useUnicode=&characterEncoding= 
例如: 
jdbc:mysql://localhost/DBName?autoReconnect=true 
没有参数 
useUnicode=true&characterEncoding,表示使用默认的ISO-8895-1编码。 

1. 从数据库里读出中文,显示在GBK的网页里。 
如果数据库里存放的字体编码是UTF-8,在JSP网页中一定要使用语句 
str=new String(rs.getBytes(1),"UTF-8"); 
或者 
str= new String(rs.getString(1).getBytes("ISO-8859-1"),"UTF-8"); 
才可正确显示中文。 

如果数据库里存放的是GBK数据,那么JSP中也要使用 
str=new String(rs.getBytes(1),"GBK"); 
或 
str=new String(rs.getString(1).getBytes("ISO-8859-1"),"GBK"); 
显示正确的中文。 

2. 如果网页是UTF-8,不能直接正确显示GBK,需要2步转换 
str=new String(rs.getBytes(1),"GBK"); 
再 
str=new String(str.getBytes("UTF-8"),"GBK"); 
才可以正确显示中文。 

如果数据库里存的是UTF-8,直接用 
str=new String(rs.getBytes(1),"GBK"); 
或者 
str=new String(rs.getString(1).getBytes("ISO-8859-1"),"GBK"); 
就可以显示中文了。 

以上是读取数据库里中文正确显示在网页上,下面三点是如何正确存入数据库。 


四、数据库连接方式使用UTF-8编码 

JSP中要把网页输入的中文存入数据库,通常有一个提交(Submit)的过程,是用 
str = request.getParameter("username"); 
然后执行update或者insert语句来存入数据库。如何赋值给str很重要,而且这里中文输入与网页所使用的字体编码有关。 

1、 网页使用UTF-8,使用 
str = new String(request.getParameter("username").getBytes("ISO-8859-1"),"UTF-8"); 
或者 
str = new String(request.getParameter("username").getBytes(),"UTF-8"); 
都可以使得存到数据库里的数据是UTF-8编码。 

2. 网页使用GBK,使用 
str = new String(request.getParameter("username").getBytes(),"GBK"); 
那么存入数据库的是UTF-8编码。 

3. 值得注意的是使用UTF-8的数据库连接方式不能存得GBK。 


五、数据库连接方式使用GBK编码 

1. 输入使用GBK网页,存到数据库里是GBK的方法: 
str= new String(request.getParameter("username").getBytes("ISO-8859-1"),"GBK"); 
或者 
str= new String(request.getParameter("username").getBytes(),"GBK"); 

2. 网页使用GBK,想存入UTF-8到数据库里,要分2步: 
str=new String(request.getParameter("username").getBytes(),"GBK"); 
再 
str=new String(str.getBytes("UTF-8"),"GBK"); 

3. 网页使用UTF-8,而且使用 
str= new String(request.getParameter("username").getBytes("ISO-8859-1"),"GBK"); 
或者 
str= new String(request.getParameter("username").getBytes(),"UTF-8"); 
那么存到数据库里的数据是UTF-8编码。 

4. 网页使用UTF-8,而且使用 
str= new String(request.getParameter("username").getBytes("ISO-8859-1"),"UTF-8"); 
那么存到数据库里的数据是GBK编码。 


六、数据库连接方式使用缺省,即不使用参数useUnicode和characterEncoding 

1. 网页使用GBK,如果使用 
str= request.getParameter("username"); 
或者 
str= new String(request.getParameter("username").getBytes()); 
那么在数据库里的数据是GBK码。网页使用UTF-8和使用 
str= request.getParameter("username"); 
则存入数据库是UTF-8编码。 

2. 如果使用 
str= new String(request.getParameter("username").getBytes("ISO-8859-1")); 
那么根据网页提供的字体编码而存到数据库里,比如是UTF-8的网页,那么存到数据库中就是UTF-8编码,如果使用GBK网页,那么存到数据库里的字就是GBK编码。 

3. 如果使用 
str= new String(request.getParameter("username").getBytes("UTF-8"),"UTF-8"); 
这一种组合能存到正确的数据外,其他存到数据库里的数据则都是乱码或者错误码。在这个UTF-8组合的特例中,网页使用的是GBK,则存放到数据库里就是GBK,网页使用UTF-8,那么存到数据库里的就是UTF-8。 

4. 网页是GBK的要存得UTF-8,一定需要2步: 
company=new String(request.getParameter("company").getBytes(),"GBK"); 
和 
company=new String(company.getBytes("UTF-8"))。 

5. 网页是UTF-8的,不能存得GBK在数据库里,一句话,改变数据库连接方式不能存得GBK码。 

以上所有的都是基于JSP网页和数据库交换数据,下面讨论一下纯JAVA编程下的字体编码转换。 


七、数据库连接方式使用UTF-8编码 

1. 数据库里的中文是UTF-8,可以转换为GBK,但不能把GBK存入数据库。 

2. 数据库是GBK,如果转换为UTF-8,使用 
content=new String(rs.getBytes(2),"GBK"); 
直接将content存入数据库就可为UTF-8。 


八、数据库连接方式使用GBK编码 

1. 数据库里的中文是UTF-8,如果转换为GBK,使用 
content= new String(rs.getString(2).getBytes(),"UTF-8"); 
再直接使用update或者insert语句插入到数据库,即存得GBK。 

如果使用 
content= new String(rs.getString(2).getBytes(),"GBK"); 
或者 
content= new String(rs.getString(2).getBytes()); 
再存入数据库即存得还是UTF-8编码。 

2. 数据库里的中文是GBK,如果转换为UTF-8,使用 
content= new String(rs.getString(2).getBytes("UTF-8")); 
或者 
content= new String(rs.getString(2).getBytes("UTF-8"),"GBK"); 
再直接使用update或者insert语句插入到数据库,即存得UTF-8。 

3. 如果某个String是GBK,要转换为UTF-8,也是使用 
content= new String(GBKstr.getBytes("UTF-8")); 
或者 
content= new String(GBKstr.getBytes("UTF-8"),"GBK"); 

如果某个String是UTF-8,要转换为GBK,应该使用new String(UTFstr.getBytes("GBK"),"UTF-8")。 


九、数据库连接方式使用缺省,即不跟参数 

1. str2=new String(GBKstr.getBytes("UTF-8"),"ISO-8859-1"); 
可以将数据库里的GBK编码转换为UTF-8。 

2. 读取UTF-8然后存入UTF-8,则用 
str1=new String(UTFstr.getBytes(),"ISO-8859-1"); 
或者 
str1=new String(UTFstr.getBytes("GBK"),"ISO-8859-1"); 

3. 不能实现数据库里的UTF-8转换为GBK。 
如果采用UTF-8的数据库连接方式或者缺省数据连接方式,那么无法将UTF-8转为GBK;而GBK的数据库连接方式可以实现UTF-8和GBK的相互转换。建议大家采用GBK的数据连接方式。

http://lasombra.iteye.com/blog/993069

 

版权声明:本文内容由阿里云实名注册用户自发贡献,版权归原作者所有,阿里云开发者社区不拥有其著作权,亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容,填写侵权投诉表单进行举报,一经查实,本社区将立刻删除涉嫌侵权内容。

相关文章
云服务器ECS首次使用体验
自我简介,在阿里云官网参与飞天加速计划,在校大学生免费领取为期两周的服务器,阿里云ECS的使用攻略,实现了文章图片上传功能,云服务器ECS使用期间的收获和总结,以及自己对未来的展望。
24 0
根据出生日期判断星座【java实战】
巩固一下java的流程控制语句的编写和锻炼理解能力。
10 0
项目中用了 Disruptor 之后,性能提升了2.5倍
存储设备往往是速度越快价格越昂贵,速度越快价格越低廉。在计算机中,CPU 的速度远高于主存的速度,而主存的速度又远高于磁盘的速度。为了解决不同存储部件的速度不对等问题,让高速设备充分发挥性能,引入了多级缓存机制。
8 0
盘点 2021 | 云原生拥抱之路
回顾这一年,还是从盘点技术说起,聊一聊我的云原生拥抱之路,在云原生之路上我都从哪些方面入手,学到了什么。
20 0
编码 5 分钟,命名 2 小时?Java 开发都需要参考的一份命名规范!
简洁清爽的代码风格应该是大多数工程师所期待的。在工作中笔者常常因为起名字而纠结,命名已经成为我工作中的拦路虎,夸张点可以说是编程5分钟,命名两小时!
11 0
搭建服务器初体验
服务器安装mysql、tomcat
17 0
最好用的 7 款 Vue admin 后台管理系统测评
Vue admin 后台管理系统作为每个项目必备的管理后台,对大家来说十分重要。选不好,配不好,不仅现在用着抓狂,未来迭代升级也困难重重,步步是坑。所以在技术选型阶段,就要对市面上主流的 Vue admin 做到全面了解,知道他们的优缺点,再根据自己项目的需求,有针对性的选择。我试用了市面上所有主流 Vue admin 都 npm 到本地测了一遍,筛掉长期不更新,bug 明显,社区活跃度低,功能单一的 admin 后台,把最好、最有特点的 7 款 Vue admin 挑出来,分享给大家。这些后台各有各的特点,有些功能多样,但整体很重;有些虽然稳定,但上线年头久远,含有大量陈旧功能;有些功能
15 0
ClassNotFoundException与NoClassDefFoundError的区别
ClassNotFoundException与NoClassDefFoundError的区别
16 0
从零实现一个日志框架(带源码)
Java里的各种日志框架,相信大家都不陌生。Log4j/Log4j2/Logback/jboss logging等等,其实这些日志框架核心结构没什么区别,只是细节实现上和其性能上有所不同。本文带你从零开始,一步一步的设计一个日志框架
12 0
Spring 中经典的 9 种设计模式,打死也要记住啊!
实现方式: BeanFactory。Spring中的BeanFactory就是简单工厂模式的体现,根据传入一个唯一的标识来获得Bean对象,但是否是在传入参数后创建还是传入参数前创建这个要根据具体情况来定。
17 0
+关注
developerguy
A code cleanliness code farmers, A programmer concentrate on elegant design, A want to do with the product architect
1663
文章
0
问答
文章排行榜
最热
最新
相关电子书
更多
《2021云上架构与运维峰会演讲合集》
立即下载
《零基础CSS入门教程》
立即下载
《零基础HTML入门教程》
立即下载