ASCII码

使用一个字节(8位),对128个字符进行编码;

最高位始终为0;

码数范围为0000_0000(0x00)0111_1111(0x7F)

Unicode

开始的编码设计

使用两个字节(16位),对65536个字符进行编码;

范围为0000_0000_0000_0000(0x0000)1111_1111_1111_1111(0xFFFF)

0x0000 - 0x007F对应的字符,与ASCII码保持一致;

最终的编码设计

由于世界上的字符,超过了65536个,所以开始只用两个字节的设计已经不足够了,需要扩展;

最终扩展如下:

  • 基本多语言平面(BMP, Basic Multilingual Plane)

    和开始的设计一致,用两个字节来编码,码数范围0x0000 - 0xFFFF

    但是,在这个范围里,有预留0xD800 - 0xDFFF的码数,他们不代表任何字符,仅用于作为增补平面的代理对而存在;

  • 增补平面(SP, Supplementary Plane)

    超出BMP所能表示的字符,改用如下范围:0x10000 - 0x10FFFF来编码;

    Unicode编者认为这个范围已经足够全世界的字符编码了,因为这足够表示一百万多个字符了;

代理对(surrogate pair)

预留的0xD800 - 0xDFFF,分为两部分:

  • 高位0xD800 - 0xDBFF
  • 低位0xDC00 - 0xDFFF

这样做的目的,是为了UTF-16编码方式;

一个高位加一个低位,共四个字节,定义了SP中的字符的UTF-16编码;

码点(code point)

Unicode编码中,一个字符所对应的码数,称为该字符的码点;

通常在计算机的字符和字符串中,使用\u码点的形式来转义码点,来表示一个Unicode编码的码点所对应的字符;

UTF-16

请注意,Unicode编码的码点,是人为约定的对字符的编码方式;

但是计算机只认二进制,所以如何将Unicode定义的字符的码点,编码为计算机实际存储的二进制串,以及如何从一串二进制串,解码成Unicode定义的字符的码点,就是UTF-16要做的事情;

UTF-16的16代表最小的编码单位是16位二进制串;

编码

分为两种情况:

  • BMP中的字符

    直接用Unicode定义的码点作为UTF-16编码即可;

  • SP中的字符

    使用两个16位二进制串进行编码,即采用四个字节来编码;

    现在假设有一个字符,其Unicode定义的码点为0xAAAAA,对其进行如下操作:

    • u = 0xAAAAA - 0x10000;
    • 将u写成二进制串:yyyy_yyyy_yyxx_xxxx_xxxx
    • 则该字符的UTF-16编码为:1101_10yy_yyyy_yyyy 1101_11xx_xxxx_xxxx

    SP的UTF-16编码的两个16位二进制串:

    第一个16位串的前六位固定是1101_10,结合yy的范围(00 - 11),即1101_1000 - 1101_1011,此范围即是代理对的高位的前两位0xD8 - 0xDB

    第二个16位串的前六位固定是1101_11,结合xx的范围00 - 11,即1101_1100 - 1101_1111,此范围即是代理对的低位的前两位的范围0xDC - 0xDF

    再结合各自后面八位二进制串的范围0000_0000 - 1111_1111,就可以得到各自完整的代理对;

    也就是说,SP的UTF-16的编码结果,即为高位+低位的四个字节的代理对;

解码

只要看一个16位二进制串的头八位,是否在代理对的范围即可;

  • 不在代理对的范围

    说明是BMP中的字符,直接对应Unicode码点找到对应的字符即可;

  • 在代理对的范围

    说明是SP中的字符,再根据头六位确定好代理对的高低位,

    去除各自的前六位,组成20位二进制串,再加上0x10000即为Unicode定义的码点,即可找到对应的字符;

UTF-8

UTF-8是不同于UTF-16的另一种对Unicode的编解码方式;

不同之处就在于,UTF-8的8代表最小的编码单位是8位二进制串;

编码

UTF-8对码点的编码方式如下:

  • 码点范围0x0000 - 0x007F

    UTF-8编码为二进制串0xxx_xxxx,与ASCII码保持一致,长度为1个字节;

  • 码点范围0x0080 - 0x07FF

    UTF-8编码为二进制串110x_xxxx 10xx_xxxx,长度为2个字节;

  • 码点范围0x0800 - 0xFFFF

    UTF-8编码为二进制串1110_xxxx 10xx_xxxx 10xx_xxxx,长度为3个字节;

  • 码点范围0x10000 - 0x10FFFF

    UTF-8编码为二进制串1111_0xxx 10xx_xxxx 10xx_xxxx 10xx_xxxx,长度为4个字节;

假设现在有一个字符,码点在范围0x0800 - 0xFFFF中:

  • 将其码点写成二进制串:xxxx_yyyy yyzz_zzzz
  • 则UTF-8编码的第一个字节为1110_xxxx;
  • 第二个字节为10yy_yyyy
  • 第三个字节为10zz_zzzz

解码

只要看第一个字节的首位即可:

  • 首位为0

    说明在码点范围0x0000 - 0x007F,直接对应Unicode码点找到对应的字符即可;

  • 首位为1,再看从首位开始,遇到第一个0结束,一共有几个1

    • 两个1,说明UTF-8编码长度为2个字节
    • 三个1,说明UTF-8编码长度为3个字节
    • 四个1,说明UTF-8编码长度为4个字节
    • 去除对应字节的固定位,组合为一个二进制串,找到对应Unicode码点的字符即可;

代码单元(code unit)

不同的UTF编码,所对应的编码单位的长度不同;

UTF-16的编码单位的长度为16位二进制;

UTF-8的编码单位的长度为8位二进制;

这个编码单位称为代码单元;

比如对于UTF-16的编码:

BMP中,一个字符所对应的UTF-16的16位二进制串,称为该字符的代码单元;

而在SP中,一个字符所对应的UTF-16的两个16位二进制串,称为该字符的一对代码单元;

而对于UTF-8的编码:

在码点范围0x0000 - 0x007F中,一个字符所对应的UTF-8的4个字节,称为该字符的4个代码单元;

在码点范围0x0080 - 0x07FF中,一个字符所对应的UTF-8的4个字节,称为该字符的4个代码单元;

在码点范围0x0800 - 0xFFFF中,一个字符所对应的UTF-8的4个字节,称为该字符的4个代码单元;

在码点范围0x10000 - 0x10FFFF中,一个字符所对应的UTF-8的4个字节,称为该字符的4个代码单元;

也就是说,随着UTF编码形式的不同,同一个字符的码点,会有不同个数的代码单元;

字符编码:Unicode & UTF-16 & UTF-8的更多相关文章

  1. 字符编码-UNICODE,GBK,UTF-8区别【转转】

    字符编码介绍及不同编码区别 今天看到这篇关于字符编码的文章,抑制不住喜悦(总结的好详细)所以转到这里来.转自:祥龙之子http://www.cnblogs.com/cy163/archive/2007 ...

  2. 彻底搞懂字符编码(unicode,mbcs,utf-8,utf-16,utf-32,big endian,little endian...)[转]

    最近有一些朋友常问我一些乱码的问题,和他们交流过程中,发现这个编码的相关知识还真是杂乱不堪,不少人对一些知识理解似乎也有些偏差,网上百度, google的内容,也有不少以讹传讹,根本就是错误的(例如说 ...

  3. java字符编码-Unicode编码问题刨根究底

    博客搬家: java字符编码问题 前段时间在读<java核心技术卷一>,遇到一些名词:码点.代码单元等,其实字面意思不难理解,解释如下 码点(code point):Unicode编码表中 ...

  4. 字符编码unicode,utf-8和ascii

    Ascii编码 由于计算机是美国人发明的,因此,最早只有127个字符被编码到计算机里,也就是大小写英文字母.数字和一些符号,这个编码表被称为ASCII编码,比如大写字母A的编码是65,小写字母z的编码 ...

  5. 字符串和字符编码unicode

    python基础第三天 字符串 str 作用: 用来记录文本(文字)信息,给人类识别用的,为人们提供注释解释说明 表示方式: 在非注释中,凡是用引号括起来的部分都是字符串 ' 单引号 " 双 ...

  6. 一句话理解字符编码(Unicode ,UTF8,UTF16)

    Unicode和ASCII码属于同一级别的,都是字符集,字符集规定从1到这个字符集的最大范围每个序号都各表示什么意思.比如ASCII字符集中序号65表示"A". 那接下来的UTF8 ...

  7. 字符编码-Unicode、Utf-8 笔记

    Unicode 将世界上所有的符号都纳入其中.每一个符号都给予一个独一无二的编码,那么乱码问题就会消失.这就是 Unicode,就像它的名字都表示的,这是一种所有符号的编码 UTF-8 UTF-8 就 ...

  8. Java 字符编码(一)Unicode 字符编码

    Java 字符编码(一)Unicode 字符编码 Unicode(http://www.unicode.org/versions/#TUS_Latest_Version) 是一个编码方案,说白了希望给 ...

  9. 001. Java内存中的字符编码

    Java内存中的字符编码 Unicode字符集及utf-8 .utf-16.utf-32 等字符编码方式 字符集:字符表示的数字集合,元素称为码点或码位: 字符编码:字符实际的储存表示: 码点:一个码 ...

  10. Python编程笔记(第二篇)二进制、字符编码、数据类型

    一.二进制 bin() 在python中可以用bin()内置函数获取一个十进制的数的二进制 计算机容量单位 8bit = 1 bytes 字节,最小的存储单位,1bytes缩写为1B 1KB = 10 ...

随机推荐

  1. 洛谷P2602 [ZJOI2010] 数字计数 (数位DP)

    白嫖的一道省选题...... 1 #include<cstdio> 2 #include<cstring> 3 #include<algorithm> 4 usin ...

  2. 洛谷P2886 [USACO07NOV]Cow Relays G (矩阵乘法与路径问题)

    本题就是求两点间只经过n条边的最短路径,定义广义的矩阵乘法,就是把普通的矩阵乘法从求和改成了取最小值,把内部相乘改成了相加. 代码包含三个内容:广义矩阵乘法,矩阵快速幂,离散化: 1 #include ...

  3. 空 Maven项目转成 Web项目 & SpringMVC调用其他 Module中的方法可能会遇到的小问题

    SpringMVC调用其他 模块内的方法的 坑 下次别在阴沟里翻船啦.. 一共花费 4个小时,解决项目中的这个问题 OMG 1. 首先是 Maven新建工程 一般使用 Maven都是先创建 空工程 当 ...

  4. mysql 过程和函数语法学习笔记

    CREATE DEFINER=`root`@`%` PROCEDURE `test`(`num` int) BEGIN /*定义变量*/ DECLARE sex TINYINT(2) DEFAULT ...

  5. 成功解决Initialization failed for ‘https://start.spring.io‘ Please check URL, network and proxy settings

    文章目录 1.问题描述 2.问题的解决方式 2.1 查看网络连接问题 2.2 设置代理 2.3 直接连接阿里云下载模板 1.问题描述 建立springboot项目的时候发现不能初始化成功,我真的栓Q ...

  6. 2022年最新最详细IDEA关联数据库方式、在IDEA中进行数据库的可视化操作(包含图解过程)

    文章目录 1.使用IDEA关联Mysql数据库的详细操作步骤 1.1 打开侧边栏的Database 2.2. 选择要连接的数据库(Mysql) 2.3 .输入要连接的数据库.用户名.密码 2.4 .点 ...

  7. 齐博x1客服系统显示客户在哪个页面

    如下图所示,要想实现下面的效果,即显示客户给你发消息时,当时处于哪个商品页面.这样方便跟客户针对此商品进行交流. 你的模板如果使用了碎片的话,就可以添加下面的代码index_style/default ...

  8. 漫谈Entity-Component-System

    原文链接 简介 对于很多人来说,ECS只是一个可以提升性能的架构,但是我觉得ECS更强大的地方在于可以降低代码复杂度. 在游戏项目开发的过程中,一般会使用OOP的设计方式让GameObject处理自身 ...

  9. 10 | Kubernetes一键部署利器:kubeadm

    你好,我是张磊.今天我和你分享的主题是:Kubernetes一键部署利器之kubeadm. 通过前面几篇文章的内容,我其实阐述了这样一个思想:要真正发挥容器技术的实力,你就不能仅仅局限于对Linux容 ...

  10. [ PHP 内核与扩展开发系列] 内存管理 —— 引用计数

    对于 PHP 这种需要同时处理多个请求的程序来说,申请和释放内存的时候应该慎之又慎,一不小心便会酿成大错.另一方面,除了要安全申请和释放内存外,还应该做到内存的最小化使用,因为它可能要处理每秒钟数以千 ...