Java 语言中一个字符占几个字节？

Java中理论说是一个字符（汉字字母）占用两个字节。

但是在UTF-8的时候 new String("字").getBytes().length 返回的是3 表示3个字节

作者：RednaxelaFX
链接：https://www.zhihu.com/question/27562173/answer/37188642
来源：知乎
著作权归作者所有。商业转载请联系作者获得授权，非商业转载请注明出处。

题主要区分清楚内码（internal encoding）和外码（external encoding）就好了。内码是程序内部使用的字符编码，特别是某种语言实现其char或String类型在内存里用的内部编码；外码是程序与外部交互时外部使用的字符编码。“外部”相对“内部”而言；不是char或String在内存里用的内部编码的地方都可以认为是“外部”。例如，外部可以是序列化之后的char或String，或者外部的文件、命令行参数之类的。Java语言规范规定，Java的char类型是UTF-16的code unit，也就是一定是16位（2字节）；char, whose values are 16-bit unsigned integers representing UTF-16 code units (§3.1).然后字符串是UTF-16 code unit的序列：The Java programming language represents text in sequences of 16-bit code units, using the UTF-16 encoding.这样，Java规定了字符的内码要用UTF-16编码。或者至少要让用户无法感知到String内部采用了非UTF-16的编码。“感知”可以是多方面的，例如随机访问某个下标的code unit（String.charAt()）应该是O(1)操作，这只有使用UTF-16或者别的“定长”编码才可以做到。注意我这里说的“定长”特指code unit定长，而不是说code point定长。String.getBytes()是一个用于将String的内码转换为指定的外码的方法。无参数版使用平台的默认编码作为外码，有参数版使用参数指定的编码作为外码；将String的内容用外码编码好，结果放在一个新byte[]返回。题主的例子里，显然外码是UTF-8，那么调用了String.getBytes()之后得到的byte[]只能表明该外码的性质，而无法碰触到String内码的任何特质。另举一例：Java标准库实现的对char与String的序列化规定使用UTF-8作为外码。Java的Class文件中的字符串常量与符号名字也都规定用UTF-8编码。这大概是当时设计者为了平衡运行时的时间效率（采用定长编码的UTF-16）与外部存储的空间效率（采用变长的UTF-8编码）而做的取舍。题外话1：可惜UTF-16在Java设计之初还是真的定长编码，后来Unicode涵盖的字符变多了之后UTF-16变成了坑爹的变长编码（一个完整的“字符”是一个code point；一个code point可以对应1到2个code unit；一个code unit是16位），Java也只好跟进。为了实现UTF-16的变长编码语义，Java规定char仍然只能是一个16位的code point，也就是说Java的char类型不一定能表示一个UTF-16的“字符”——只有只需1个code unit的code point才可以完整的存在char里。但String作为char的序列，可以包含由两个code unit组成的“surrogate pair”来表示需要2个code unit表示的UTF-16 code point。为此Java的标准库新加了一套用于访问code point的API，而这套API就表现出了UTF-16的变长特性。题外话2：前面我说Java的内码时说得比较松，留下了“不总是使用UTF-16作为内码，但是用户无法感知区别”的余地。在Sun JDK6中有一个“压缩字符串”（-XX:+UseCompressedString）的功能。启用后，String内部存储字符串内容可能用byte[]，也可能用char[]；当整个字符串所有字符都在ASCII编码范围内时，就使用byte[]（ASCII序列）来存储，此时字符串就处于“压缩”状态；反之，只要有任何一个字符超出了ASCII的编码范围，就退回到用char[]（UTF-16序列）来存储。ASCII编码也是一种定长编码，而且其涵盖的字符是UTF-16的真子集；用户在对一个“压缩”的字符串访问其内容时（例如String.charAt()），只需对ASCII字符做无符号扩展就可以得到对应的UTF-16 code unit。这样用户也就无法感知到Java String的内码不是UTF-16的情况。Sun JDK6对“压缩字符串”的实现不够理想，实现太复杂而效果未如预期的好，所以没有包含在OpenJDK6、Oracle JDK7/OpenJDK7里。现在Oracle在重新审视“压缩字符串”功能，有可能在JDK9重新实现出来。题外话3：同样规定使用UTF-16作为内码的JavaScript语言，其实现广泛应用了“压缩字符串”的思想。现在主流的JavaScript引擎都会尽可能用ASCII内码的字符串，不过用户能接触的API只能看到UTF-16 code unit。

Java 语言中一个字符占几个字节？的更多相关文章

utf-8的中文，一个字符占几个字节
https://blog.csdn.net/kindsuper_liu/article/details/80202150 英文字母和中文汉字在不同字符集编码下的字节数英文字母:·字节数 : 1;编码: ...
utf-8的中文是一个字符占几个字节
utf-8的中文是一个字符占几个字节英文字母和中文汉字在不同字符集编码下的字节数英文字母:·字节数 : 1;编码:GB2312 字节数 : 1;编码:GBK 字节数 : 1;编码:GB18030 字 ...
ORACLE中一个字符占多少字节？
问题描述或许你会说一个中文字符占2个字节,这是一定的?如何计算一个字符串的字节数? 解决方案在oracle中一个字符特别是中文占几个字节是不同的. 比如我创立一个表create table tes ...
C语言中一个字符对应一个ascii码；占一个1个字节8个二进制位；存到内存中也是用ascii的十进制的二进制表示
/** 只读变量和常量 const 只读 const int a; int const a;//同上面的代码行是等价的,都表示一个常整形数. int *const a;//const具有"左 ...
C语言中一个字符数组里面的所有元素变成一个字符串
#include <string.h> int main() // 这里为了方便直接用main函数 { char array[] = { 'h', 'e', 'l', 'l', ' ...
php中一个字符占用几个字节？
先看看字符与字节有什么区别: (一)“字节”的定义字节(Byte)是一种计量单位,表示数据量多少,它是计算机信息技术用于计量存储容量的一种计量单位. (二)“字符”的定义字符是指计算机中使用的文字 ...
Java语言中的正则表达式
正则表达式是什么? 正则表达式是一种强大而灵活的文本处理工具.初学正则表达式时,其语法是一个难点,但它确实是一种简洁.动态的语言.正则表达式提供了一种完全通用的方式,能够解决各种字符串处理相关的问题: ...
JAVA语言中的修饰符
JAVA语言中的修饰符 -----------------------------------------------01--------------------------------------- ...
Java语言中的面向对象特性总结
Java语言中的面向对象特性 (总结得不错) [课前思考] 1．什么是对象?什么是类?什么是包?什么是接口?什么是内部类? 2．面向对象编程的特性有哪三个?它们各自又有哪些特性? 3．你知 ...

随机推荐

Java应用架构设计模块化模式与OSGI摘录
在Java中,最适合模块化的单元就是Jar文件. 代码层面我们关注的太多了,熟练的开发人员现在很少争论使用模式的好处,也不再识别哪个模式适合当前需要,因为都能够本能地使用各种设计原则和模式,从GoF的 ...
内存泄漏分析工具tMemMonitor (TMM)使用简介
C/C++由于灵活.高效的优点一直以来都是主流的程序设计语言之一,但是其内存的分配与释放均由程序员自己管理,当由于疏忽或错误造成程序未能释放不再使用的内存时就会造成内存泄漏.在大型.复杂的应用程序中, ...
LearnToRank
1 概述 RankNet.LambdaRank和LambdaMART是三个关系非常紧密的机器学习排序算法.简而言之,RankNet是最基础,基于神经网络的排序算法:而LambdaRank在RankNe ...
深度技术Win7系统利用diskpart命令实现硬盘分区的技巧
转自:http://www.xitongcheng.com/jiaocheng/win7_article_2491.html 1. 深度技术Win7系统利用diskpart命令实现硬盘分区的技巧分享给 ...
3.2-3.3 Hive中常见的数据压缩
一.数据压缩 1. 数据压缩数据量小 *本地磁盘,IO *减少网络IO Hadoop作业通常是IO绑定的; 压缩减少了跨网络传输的数据的大小; 通过简单地启用压缩,可以提高总体作业性能; 要压缩的数 ...
不能支持C++11的特性~，升级到4.8.2
一.简易安装操作环境 CentOS6.5 64bit,原版本4.4.7,不能支持C++11的特性~,希望升级到4.8.2 不能通过yum的方法升级,需要自己手动下载安装包并编译 1.1 获取安装包并 ...
MFC中CArray类原理及其应用
1.CArray类应用函数简介CArray::GetSize int GetSize( ) const;取得当前数组元素个数. CArray::GetUpperBound int GetUpperB ...
HDU4973 【几何。】
题意: 给你一个以原点为圆心的两个圆,一个大圆,一个小圆,然后给你一个硬币和他的速度,问你经过大圆的时间: 思路: 直接杠.. 然后wa的怀疑人生,后面wa在了速度的方向,如果我说一个点在两个圆的左上 ...
P4363 [九省联考2018]一双木棋chess（对抗搜索+记忆化搜索）
传送门这对抗搜索是个啥玩意儿…… 首先可以发现每一行的棋子数都不小于下一行,且局面可由每一行的棋子数唯一表示,那么用一个m+1进制数来表示当前局面,用longlong存,开map记忆化搜索然后时间 ...
boot接入elasticsearch
boot接入elasticsearch 参考博客:https://blog.csdn.net/li521wang/article/details/83792552 项目源码demo:https://g ...

Java 语言中一个字符占几个字节？

Java中理论说是一个字符（汉字 字母）占用两个字节。

Java 语言中一个字符占几个字节？的更多相关文章

随机推荐

热门专题

Java中理论说是一个字符（汉字字母）占用两个字节。