来源:https://blog.csdn.net/osanwenyu/article/details/48439461

版权声明:本文为博主原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接和本声明。

                    本文链接:https://blog.csdn.net/oSanWenYu/article/details/48439461                

一、前言

汉字编码是让人比较头疼的一块,最近下定决定把他搞懂。网上翻了个遍,讲得详细透彻的让人头疼看不下去,讲得通俗的不够详细,只言片语。更有甚者开篇即讲Unicode是啥,多少个字符,GB2312巴拉巴拉,多少个汉字,全然不讲应用场景,不理知识接受的先后,遂结合翻看过的几篇写一写心得。

二、字符编码的发展

ASCII

--> 拓展字符集

-->GB2312(中国大陆)

-->GBK

--> unicode

1.ASCII

最早的时候计算机只在美国使用,人民解决英文与二进制的映射关系,发明了ASCII编码,将所有大小写英文字母以及常用的英文标定符号编进去。还有一些并不代表文字意义但又经常要表达的操作也加了进去,这就是控制字符,如换行、回车、制表符等等。这时发现所有的字符都编进去了,才占用了127个,每个字符占用一个字节,这是一套完美的编码方式。

2.拓展字符集

后来科技发展,计算机在世界各国普及开来,英语地区还好,直接能显示英文,非英语地区就没那么好运了。为此程序员们为自己的母语开发了自己文字与二进制的映射关系(主要是拉丁系文字的国家),从128一直占用到字节的最后一个255,这拓展的128个加上原有的128个,一共256个九叫做ASCII拓展字符集,又称IBM拓展字符集。

3.本地化(GB2312、BIG5、Shift JIS...)

再后来非拉丁系国家一看不行啊,我也要搞自己的字符集,于是百花齐放的时代来了,由于一个字节的已经被占满了,各国都采用2个字节代表自己的一个文字,如中国将第一个字节的AI~F7,第二个字节的00~FF合起来表示一个汉字,来代表7000多个汉字,直接抛弃不兼容拓展字符集,并将此字符集称为GB2312。后来又加入一些少数民族的文字、繁体字,演化出GBK。

4.Unicode一统天下

各国的字符编码都有自己的一套编码方法,彼此之间并不兼容,这显然不是最好的解决方案。为此ISO国际标准化组织提出unicode方案,以2个字节表示一个字符:

0000-007F:原基本ASCII字符集中的字符
0080-00FF:原拓展字符集中的字符
......
0600-06FF:阿拉伯文

......

4E00-9FBF:CJK 统一表意符号(包含中文字符)

......

将ASCII编码中的前128个字符保持不变,即第一个字节保持不变,后一个字节用0填充,如"A"的unicode为 0X0041,其他文字依次排在后面的空余位置,兼容世界上所有的字符!

至此字符编码演化到了最终形态。unicode与各种本地化编码共存,至于为什么共存,有太多原因,如ASCII,本来只需要1个字节表示1个"A",现在要用2个字节,容量足足翻了一番。至于GB2312,就如同国际上有了W-CDMA中国还要搞TD-CDMA一样。

唉?等等,你说UTF8?

三、unicode 与 UTF8

unicode在计算机内部(或者说单机)使用时,使用unicode是没问题的,如一个记事本,以unicode方式保存,操作系统会在记事本的开头标记一下FFEF或FEFF,以此说明是采用双字节的unicode编码,因内存读写极少出错,所以基本不会发生丢字节的情况。此时的编码即UTF-16。

那传输(联网)时呢?

考虑一个现实问题:假设你是一台计算机(小端),需要将另一台计算机(小端)传过来的unicode数据(你0x4f60   好0x597d   吗0x5417)转为字符并显示在屏幕上。

第一次,你遇到一个0x4F60,好办!显示器!给我显示”你“!

第二次,0x7d丢失,你遇到一个0x5917,也好办,”夗“!

第三次,你遇到一个0x5400,“吀”

显示结果:你夗吀  (什么鬼!)

可见,unicode在传输方面还是有缺陷的,因为每个字符看着都像是独立的,跟前后没有什么依赖关系,也没有相关标识,一旦少了一个字节,后面的所有内容都乱码了。

解决方法也显而易见,就是每个字节都标识一下,UTF-8应运而生。

四、unicode与UTF8的转换

UTF8的第一个字节的前4位用以标识本次传输的字符占用多少个字节,如1110 xxxx 标识占用3个字节。

剩余的字节都采用开头为10的方式,如10xx xxxx。

比如“ 直 ”, unicode编码: 76f4 ,   相应二进制   0111 0110 1111 0100

因为汉字的unicode固定是2个字节,而转成utf8则是固定3个字节。

1110 ____,  10__ ____, 10__ ____

将“ 直” 0111 0110 1111 0100 连续填入:

二进制 : 1110 0111,  1001 1011, 1011 0100, ,十六进制 : e79b94,此为UTF-8

五、被滥用的UTF-8

UTF-8一开始只用于网络传输,并不作为本地存储形式,后来程序员们因为懒、麻烦,不会引起其他问题等种种不啦不啦原因,直接将UTF-8用于存储。

如何知道文件用的是什么方式编码的呢?

二进制打开文件,开头字节能区分。

开头字节

Charset/encoding

EF BB BF

UTF-8

FE FF

UTF-16/UCS-2, little endian

FF FE

UTF-16/UCS-2, big endian

FF FE 00 00

UTF-32/UCS-4, little endian.

00 00 FE FF

UTF-32/UCS-4, big-endian.

开头字节 Charset/encoding
\ ANSI(中文是GB2312)
   
   

六、要点

unicode能表示所有的字符,任何其他的编码方式都是针对特定字符的。

unicode在本地的形式是UTF-8,UTF-16,UTF-32,网络传输形式只能是UTF-8

开头字节能区分编码方式

Unicode、UTF8、GB2312、ANSI的更多相关文章

  1. 字符编码简介:ASCII,Unicode,UTF-8,GB2312

    字符编码简介:ASCII,Unicode,UTF-8,GB2312 1. ASCII码 我们知道,在计算机内部,所有的信息最终都表示为一个二进制的字符串.每一个二进制位(bit)有0和 1两种状态,因 ...

  2. JAVA js的escape函数、解析用js encodeURI编码的字符串、utf8转gb2312的函数

    在使用webView时,如果url中参数有中文的话,拦截到的字符串就会类似这样的:http://api.letstar.cn/zq/news.html?id=20&cupName=%E6%B5 ...

  3. [Python] 中文编码问题:raw_input输入、文件读取、变量比较等str、unicode、utf-8转换问题

    最近研究搜索引擎.知识图谱和Python爬虫比较多,中文乱码问题再次浮现于眼前.虽然市面上讲述中文编码问题的文章数不胜数,同时以前我也讲述过PHP处理数据库服务器中文乱码问题,但是此处还是准备简单做下 ...

  4. 编码方式ASCII、GBK、Unicode、UTF-8比较

    文章内容深度较浅,详细了解可到下链接:https://blog.csdn.net/QuinnNorris/article/details/78705723; 总结了以下几种编码方式: ASCII.GB ...

  5. ASCII、ANSI、GB2312、Unicode、UTF-8之间的关系

    1.ASCII码: ASCII(American Standard Code for Information Interchange,美国信息互换标准代码)是基于拉丁字母的一套电脑编码系统.它主要用于 ...

  6. 编码格式简介:ASCII码、ANSI、GBK、GB2312、GB18030和Unicode、UTF-8,BOM头

    编码格式简介:ASCII码.ANSI.GBK.GB2312.GB18030和Unicode.UTF-8,BOM头 二进制: 只有0和1. 十进制.十六进制.八进制: 计算机其实挺笨的,它只认识0101 ...

  7. ANSI、GBK、GB2312、UTF-8、GB18030和 UNICODE

    http://www.chinaz.com/web/2012/1119/282540.shtml 编码一直是让新手头疼的问题,特别是 GBK.GB2312.UTF-8 这三个比较常见的网页编码的区别, ...

  8. [转]各种编码ANSI、GB2312、GBK、GB18030、UNICODE以及UTF-8傻傻分不清!

    计算机编程中的编码一直是让新手非常头疼的问题,特别是 GBK.GB2312.UTF-8 这三个比较常见的网页编码的区别,更是让许多新手晕头转向,怎么解释也解释不清楚,看一遍貌似懂了,但实际使用的时候又 ...

  9. Ansi、GB2312、GBK、Unicode(utf8、16、32)

    关于ansi,一般默认为本地编码方式,中文应该是gb编码 他们之间的关系在这边文章里描写的很清楚:http://blog.csdn.net/ldanduo/article/details/820353 ...

  10. 各种编码UNICODE、UTF-8、ANSI、ASCII、GB2312、GBK详解

    来自:http://blog.csdn.net/lvxiangan/article/details/8151670 ------------------------------------------ ...

随机推荐

  1. 记一些Python(Pymysql)建表、增删改查等基础操作(小白适用)

    1.读取sql文件创建数据表 有一个形如下图的sql文件,使用python读取文件并在数据库中创建所有的表. 很多人学习python,不知道从何学起.很多人学习python,掌握了基本语法过后,不知道 ...

  2. .NET5.0 单文件发布打包操作深度剖析

    .NET5.0 单文件发布打包操作深度剖析 前言 随着 .NET5.0 Preview 8 的发布,许多新功能正在被社区成员一一探索:这其中就包含了"单文件发布"这个炫酷的功能,实 ...

  3. 分布式事务和分布式hash

    分布式事务是什么? 分布式事务就是保证各个微服务之间数据一致,本质上就是保证不同数据库的数据一致性.一致性状态包含 强一致性,任何时刻,所有节点中数据都是一样的 弱一致性,数据更新后,只能访问到部分节 ...

  4. 想要使用GPU进行加速?那你必须事先了解CUDA和cuDNN

    这一期我们来介绍如何在Windows上安装CUDA,使得对图像数据处理的速度大大加快,在正式的下载与安装之前,首先一起学习一下预导知识,让大家知道为什么使用GPU可以加速对图像的处理和计算,以及自己的 ...

  5. 原生JDK网络编程BIO

    服务端提供IP和监听端口,客户端通过连接操作想服务端监听的地址发起连接请求,通过三次握手连接,如果连接成功建立,双方就可以通过套接字进行通信. 传统的同步阻塞模型开发中,ServerSocket负责绑 ...

  6. Oracle 根据不同成绩,对应不同等级信息

    --查询每一颗成绩的:优秀.良好.不良的数量 --校园需要一张各科成绩状态统计表,格式如下: --科目名称 优秀人数 良好人数 不良人数 --高等数学 5 12 2 --英语 8 18 1 先创建一个 ...

  7. Odoo10中calendar视图点击事件

    有个需求,需要根据该条记录的状态字段来控制点击calendar时是否需要打开form视图,解决方案如下:重写了web_calendar的get_fc_init_options()方法中的eventCl ...

  8. Java-Collection和Map

    创建博客的目的主要帮助自己记忆和复习日常学到和用到的知识:或有纰漏请大家斧正,非常感谢! 之前面试,被问过一个问题:List和Set的区别. 主要区别很明显了,两者都是数组形式存在的,继承了Colle ...

  9. SpringMVC-09-Ajax技术

    9. Ajax技术 简介 AJAX=Asynchronous JavaScript and XML (异步的JavaScript和XML) AJAX是一种在无需重新加载整个网页的情况下,能够更新部分网 ...

  10. python3 while循环

    python不支持n++这样格式,因为python中变量不像c那样事先定义好变量类型,在内存中开辟指定的空间,然后赋值. python中以字符串为例,事先在内存划分空间来存放字符串,然后用变量名来指向 ...