最近在看Java web中中文编码问题,特此记录下。

  本文将会介绍常见编码方式和Java web中遇到中文乱码问题的常见解决方法:

一、常见编码方式:

    1、ASCII 码

       众所周知,这是最简单的编码。它总共可以表示128个字符,0~31是控制字符如换行、回车、删

    除等,32~126是打印字符,可以通过键盘输入并且能够显示出来的。

    2、ISO-8859-1

      它是基于ASCII码基础上扩展的,它总共能表示256个字符,涵盖了大多数西欧语言字符。详见

    ISO-8859-1 编码    该编码不支持中文,举个中文编码栗子:

    字符串“I am 君山”用 ISO-8859-1 编码,下面是编码结果:

    

    由于ISO-8859-1 是单字节编码且不支持中文,直接将中文字符转成‘3f’, 3f也就是常见的"?"字符

    3、GB2312

      它是双字节编码,共包含6763个汉字。

    4、GBK

      汉字内码扩展规范,是基于GB2312上拓展的,加入了更多的汉字,能表示21003个汉字。它的编码

    是和GB2312兼容的。也就是说用GB2312编码的汉字可以用GBK来解码,并且不会乱码。倒过来就不完

    全可以了,因为GB2312描述的汉字比GBK少。

    5、UTF-16

      UTF-16是基于Unicode上定义的, 用两个字节来表示Unicode的转换格式,它采用定长的表示方法,

    即不能什么字符都可以用两个字节表示。两个字节是16个bit,所以就做UTF-16。(Unicode 囊括了世界

    上所有语言,所有语言均可通过Unicode来相互翻译,详解Unicode 编码

    6、UTF-8

      由于UTF-16统一采用两个字节来表示一个字符, 有很多字符用一个字节表示即可。所以存储空间放

    大了一倍,还会增加网络传输的流量,所以推出了UTF-8。 UTF-8采用了一种变长技术,每个编码区域有

    不同的字码长度。

    通过上面介绍和对比,对于中文字符的处理我想UTF-8是最理想的中文编码。

二、常见乱码问题分析

    1、中文变成看不懂的字符

      如果一串中文字符变成了一串看不懂的字符如:"Ì Ô £ ¡Î Ò Ï²»¶ £ ¡",这种情况通常是编码

    字符集与解码时所用的字符集不一致所造成的。比如使用GBK编码,如果使用ISO-8859-1解码

    的话结果就是这样。

    2、一个汉字变成了一个问号

      如果编码和解码的字符集都是一致的,那么可以确定该字符编码不支持中文,例如:ISO-8859-1

    3、一个汉字变成了两个问号

      中文经过多次编码且其中有一次编码或者解码使用了不支持中文的字符集 

三、常见案例分析(tomct+google)

    1、参数传输乱码

      背景:从jsp中传参数(包括中文)请求后台数据,在后台获取到的请求参数乱码。

      1.1 前端编码设置,先讲解下jsp中编码的配置:

        a、其中contentType中charset用来设置服务器发送给客户端时的内容编码;pageEncoding 用

      来设置JSP源文件本身和响应正文中的字符编码。通俗的说pageEncoding是jsp文件本身的编码,如果

      pageEncoding设置为ISO-8859-1,则jsp页面中不能保存中文字符,会自动提示你是否要设置为UTF-8.

        b、jsp文件编码字符集默认为ISO-8859-1, JSP源文件字符集时,优先级为pageEncoding>

      contentType。如果都没有设置,默认ISO-8859-1。

        c、设置响应输出的字符集时,优先级为contentType>pageEncoding。如果都没有设置,默认

      ISO-8859-1。

           <%@ page language="java" contentType="text/html; charset=UTF-8" pageEncoding="UTF-8"%>

      综上所述,解决该问题乱码的第一步要设置jsp中的编码,最好统一为UTF-8。

      exmaple(乱码示例):

      

      页面效果如下:

       

      1.2 后端编码设置

        a、首先要设置tomcat编码,其中要了解两个参数(conf/server.xml):URIEncoding 和

        useBodyEncodingForURI,可以查看官方文档说明:

        http://tomcat.apache.org/tomcat-7.0-doc/config/http.html, 以下是我理解:

          1)URIEncoding是对所有GET方式的请求的数据进行统一的重新编码,默认编码为

         ISO-8859-1(针对URI上的请求参数)

          2)useBodyEncodingForURI:此设置仅适用于请求的查询字符串(针对请求体中内容)。

         与URIEncoding不同,它不影响请求URI的路径部分。如果不知道请求字符编码(浏览器不提供,

        并且SetCharacterEncodingFilter不设置或使用Request.setCharacterEncoding方法的类

        似过滤器),默认编码始终为“ISO-8859-1”。URIEncoding设置对此默认值没有影响。

        该参数为false。通俗的说:

        true表示get和post的编码保持一致,post方式的编码是什么,get方式的编码就是什么。

        false表示get和post的字符编码各自设置,互相没有关系。

        example1(只设置URIEncoding):  

        server.xml

      <Connector connectionTimeout="20000" port="9080" protocol="HTTP/1.1"  
        redirectPort="443" URIEncoding="UTF-8" />

        controller:

        @RequestMapping(value = "/testURI", method=RequestMethod.POST)
    @ResponseBody
    public String testURI(HttpServletRequest request){
    String username = request.getParameter("username");
    String nickname = request.getParameter("nickname");
    System.out.println("姓名:" + username + ", 昵称:" + nickname);
     return "姓名:" + username + ", 性别:" + nickname;
    }

        jsp:

      <form action="${pageContext.request.contextPath }/testURI.html?username=张三" method="post">
  <input type="text" name="nickname" value="老张三"/>
  <input type="submit" value="提交"/>
  </form>

        输出结果:     姓名:张三, 昵称:è€å¼ ä¸

        从结果中可以看出, URIEncoding只对URI中的参数进行编码。  

      example2:只修改controller中代码,就都会显示正常

      @RequestMapping(value = "/testURI", method=RequestMethod.POST)
  @ResponseBody
  public String testURI(HttpServletRequest request) throws UnsupportedEncodingException{
  request.setCharacterEncoding("UTF-8");
  String username = request.getParameter("username");
   String nickname = request.getParameter("nickname");
  System.out.println("姓名:" + username + ", 昵称:" + nickname);
  return "姓名:" + username + ", 性别:" + nickname;
  }

    其实第二种做法并不是很方便,一般通过设置URIEncoding+encodingFilter即可解决。

    example3(通常做法):

    web.xml代码如下,其余跟example1一样即可。

  <filter>
<filter-name>encodingFilter</filter-name>
<filter-class>org.springframework.web.filter.CharacterEncodingFilter</filter-class>
<init-param>
<param-name>encoding</param-name>
<param-value>UTF-8</param-value>
</init-param>
<init-param>
<param-name>forceEncoding</param-name>
<param-value>true</param-value>
</init-param>
</filter>
<filter-mapping>
<filter-name>encodingFilter</filter-name>
<url-pattern>/*</url-pattern>
</filter-mapping>

    example4:

      @RequestMapping(value = "/testURI", method=RequestMethod.POST)
  @ResponseBody
  public String testURI(HttpServletRequest request) throws UnsupportedEncodingException{
  request.setCharacterEncoding("UTF-8");
  String username = request.getParameter("username");
   String nickname = request.getParameter("nickname");
  System.out.println("姓名:" + username + ", 昵称:" + nickname);
  return "姓名:" + username + ", 性别:" + nickname;
  }

    如果只设置URIEncoding=ISO-8859-1,request.setCharacterEncoding("UTF-8");只会

    对请求体中的参数进行编码,所以username是乱码的。

    

    example5: 在example4的基础上设置useBodyEncodingForURI="true"

    设置useBodyEncodingForURI=true时,就会将请求参数和请求体中的参数根据

    request.setCharacterEncoding或者contentType中的字符集编码。

    

本文先记录至此,参考文献有《深入分析Java web解析》《tomcat docs》

      

        

Java web中常见编码乱码问题(一)的更多相关文章

  1. Java web中常见编码乱码问题(二)

    根据上篇记录Java web中常见编码乱码问题(一), 接着记录乱码案例: 案例分析:   2.输出流写入内容或者输入流读取内容时乱码(内容中有中文) 原因分析: a. 如果是按字节写入或读取时乱码, ...

  2. JAVA WEB 中的编码分析

    JAVA WEB 中的编码分析 */--> pre.src {background-color: #292b2e; color: #b2b2b2;} pre.src {background-co ...

  3. 深入分析Java Web中的编码问题

    编码问题一直困扰着我,每次遇到乱码或者编码问题,网上一查,问题解决了,但是实际的原理并没有搞懂,每次遇到,都是什么头疼. 决定彻彻底底的一次性解决编码问题. 1.为什么要编码 计算机的基本单元是字节, ...

  4. Java Web中的编码解析

    在springmvc工程web.xml中配置中文编码 <!-- 配置请求过滤器,编码格式设为UTF-8,避免中文乱码--> <filter> <filter-name&g ...

  5. 【中文乱码】深入分析 Java Web 中的中文编码问题

    深入分析 Java Web 中的中文编码问题 1.几种常见的编码格式 1.1 为什么要编码 在计算机中存储信息的最小单元是 1 个字节,即 8 个 bit, 所以能表示的字符范围是 0 ~ 255 个 ...

  6. Java Web中解决乱码的方式

    Java Web中解决乱码的方式 方式一:添加编码过滤器 package com.itmacy.dev.filter; import javax.servlet.*; import javax.ser ...

  7. 解决java web中safari浏览器下载后文件中文乱码问题

    解决java web中safari浏览器下载后文件中文乱码问题 String fileName = "测试文件.doc"; String userAgent = request.g ...

  8. 深入分析Java Web中的中文编码问题

    要对Java Web项目进行编码原因: 1.在计算机中存储信息的最小单位是1个字节,即8个bit,所以能表示的字符范围是0~255个. 2.电脑需要表示的符号太多.无法用1个字节完全表示. 要解决这个 ...

  9. 第三章 深入分析Java Web中的中文编码问题

    3.1 几种常见的编码格式 3.1.1 为什么要编码 一个字节 byte只能表示0~255个符号,要表示更多的字符,需要编码. 3.1.2 如何翻译 ASCII码:有128个,用一个字节的低7位表示. ...

随机推荐

  1. Centos7:利用crontab定时执行任务

    cron服务是Linux的内置服务,但它不会开机自动启动.可以用以下命令启动和停止服务: /sbin/service crond start /sbin/service crond stop /sbi ...

  2. 凭证(Credential)

    在SQL Server中,凭证(Credential)用于把Windows用户的身份验证信息(在Windows环境下,是Windows 用户名和密码)存储在SQL Server实例中,并把该身份验证信 ...

  3. 【转】JDBC学习笔记(6)——获取自动生成的主键值&处理Blob&数据库事务处理

    转自:http://www.cnblogs.com/ysw-go/ 获取数据库自动生成的主键 我们这里只是为了了解具体的实现步骤:我们在插入数据的时候,经常会需要获取我们插入的这一行数据对应的主键值. ...

  4. 为什么大多数培训机构还停留在只教ssh框架?

    最近听一些朋友说,招聘面试的很多人简历都差不多,大部分人的简历上面都写了熟悉ssh框架,我朋友就在吐槽,为什么这些人简历都差不多,并且都熟悉ssh框架? 后面他说, 可能这些人都是培训机构出来的, 然 ...

  5. bootstrap快速入门笔记(九)-响应式工具

    一,可用的类   超小屏幕手机 (<768px) 小屏幕平板 (≥768px) 中等屏幕桌面 (≥992px) 大屏幕桌面 (≥1200px) .visible-xs-* 可见 隐藏 隐藏 隐藏 ...

  6. Unix系统操作指令汇总

    一.目录及文件操作命令 1.1 ls 语法: ls [-RadCxmlnogrtucpFbqisf1] [目录或文件--] 说明: ls 命令列出指定目录下的文件,缺省目录为当前目录 ./,缺省输出顺 ...

  7. 针对Mac的DuckHunter攻击演示

    0x00 HID 攻击 HID是Human Interface Device的缩写,也就是人机交互设备,说通俗一点,HID设备一般指的是键盘.鼠标等等这一类用于为计算机提供数据输入的设备. DuckH ...

  8. JMS学习篇《一》ActiveMQ消息中间件的简单介绍与用法-概念篇

    原创说明:本篇博文为本人原创作品,转载请注明出处 1.何为消息中间件 消息中间件是一种在分布式应用中互相交换信息的一种技术,常见的成熟消息中间件有:RabbitMQ.SonicMQ,activeMQ. ...

  9. 基于jqUI的日期选择(‘yy-mm-dd’)

    今天看某公司的网页,其中有个筛选条件是选择一个时间区间,从而选择出符合条件的项.什么也不说了,先看图左边的输入框,点击具体的日期,这里我选择的是2017-3-9,然后右边的输入框就只能选择这个日期以后 ...

  10. poj2100还是尺取

    King George has recently decided that he would like to have a new design for the royal graveyard. Th ...