MySQL 5.7 版本的 UTF8 字符集调研
一、故事背景
记一次 sql_mode 非严格模式下的业务事故排查。当时数据库没有开启 sql_mode 为严格模式,并且数据表的编码是 utf8,表现为业务侧的 Insert SQL 语句执行成功,但是,
查询表记录的时候,发现字段的数据值缺失。示例:写入一条有特殊字符 的记录,记录里面字段值在 之后的字符都丢失了。
下面是,开启了严格模式:

问题原因定位到后,解决方案是,在不对数据库做任何配置调整的前提下,业务逻辑中增加对特殊字符的检测,过滤掉数据库不支持的特殊字符,从而杜绝写入数据表后出现数据缺失的事故。
那么,哪些字符是 MySQL 不支持的嘞?由此引出本文的探讨主题。
二、认识 MySQL UTF8 字符集
我们带着两个问题,去调研 MySQL 5.7 版本 UTF8 字符集。
2.1. MySQL 不支持的特殊字符有哪些?

PS: 这里贴的 MySQL 官方文档也是 5.7。
从文档提取下关键信息:
- 在 MySQL 中 utf8 是 utf8mb3 的别名
- utf8mb3 编码的每个字符最多三个字节
示例:特殊字符 特殊字符:

可以观察到这个字符,需要使用四个字节编码,因此这个字符不能被数据库 utf8mb3 编码支持。
说点题外话,在 Java 中 String 是 UTF-16 格式的,当我们用鼠标复制 字符到一个双引号中时,idea 编辑器,会自动转换为这样的格式:

那么,MySQL 的 utf8mb3 不支持哪些字符 ?
继续看 MySQL官方文档

可以看到,文档中已经给出了比较明确的描述:
- 仅支持 BMP 字符
- 一个字符的编码最多三个字节。
到这里,你可能又会问是什么 BMP 字符嘞,Wiki 百科看不懂啊!
在介绍这个问题之前,首先要了解一点基础知识 Code point

大家应该都认识这张表,ASCLL 包含 128 个 Code point 表示 128 个字符(也就是 0 ~ 127)。
在标准的 Unicode 中容纳了 1,114,112 code points,其中前 65,536 个 Code point (也就是 0 ~ 65535)称为 Basic Multilingual Plane(缩写:BMP)
- 查看一个字符的
Code point可以使用 charbase.com,示例,查看大写字母 A :

- 判断一个字符是否是 BMP
首先计算出字符的Code point,然后检查其范围,如果在 0 ~ 65535 内,就是 BMP 字符。
2.2. MySQL UTF8 和 标准 UTF-8 编码是一个概念吗?
通过上一个问题,我们了解到,MySQL 5.7 版本中 UTF8 是 utf8mb3 的别名,utf8mb3 是使用 1 ~ 3 个字节对 Unicode 字符进行编码,仅支持 BMP 字符。
在 Wiki 百科里面对 UTF-8 的定义是:

简言之:使用 1 ~ 4 个字节对标准 Unicode 1,112,064 个有效的字符 Code point 进行编码。
因此,这两个 utf8 在不同的上下文背景下不是一个概念,很多开发人员包括我,经常在没有对事物做详细调研之前,凭借主观经验对事物妄下结论。
三、编程语言最佳实践
通过上面分析,我们知道问题的背景和原因。下面的给出最佳编程实践,选取前/后端使用的两门语言:
3.1. 在 Java 语言中检测字符串中的非 BMP 字符
public class Main {
public static void main(String[] args) {
String str = "方程";
boolean contain = isContainsNonBmpUnicodeCharacter(str);
if (contain) {
System.out.println("The string contains non-BMP Unicode character.");
}
}
private static boolean isContainsNonBmpUnicodeCharacter(String str) {
return str.length() != str.codePointCount(0, str.length());
}
}
3.2.在 Javascript 中检测字符串中非 BMP 字符
function main() {
let str = "方程";
let contains = isContainsNonBmpUnicodeCharacter(str);
if (contains) {
console.log("The string contains non-BMP Unicode character.");
}
}
function isContainsNonBmpUnicodeCharacter(str) {
return str.split(/[\uD800-\uDBFF][\uDC00-\uDFFF]/g).length != 1;
}
参考文献
How to convert a byte array to a hex string in Java? - stackoverflow.com
Check if a String contains characters which aren't UTF-8 encoded in Java - stackoverflow.com
How do I convert unicode codepoints to their character representation?
MySQL 5.7 版本的 UTF8 字符集调研的更多相关文章
- MySQL字符集 GBK、GB2312、UTF8区别 解决 MYSQL中文乱码问题 收藏 MySQL中涉及的几个字符集
MySQL中涉及的几个字符集 character-set-server/default-character-set:服务器字符集,默认情况下所采用的.character-set-database:数据 ...
- mysql 8 windows 版本zip方式安装步骤
mysql 8 windows 版本zip方式安装步骤(下载地址:https://dev.mysql.com/downloads/mysql/)1,解压ZIP文件到指定目录下:如D:\mysql-8. ...
- MySQL数据库各个版本的区别
MySQL数据库各个版本的区别 MySQL数据库 MySQL是一种开放源代码的关系型数据库管理系统(RDBMS),MySQL数据库系统使用最常用的数据库管理语言--结构化查询语言(SQL)进行数据库管 ...
- utf8字符集下的比较规则
前言: 在MySQL中,比较常用的字符集是utf8和utf8mb4.这两个字符集是类似的,utf8是utf8mb3的别名,所以之后在MySQL中提到utf8就意味着使用1~3个字节来表示一个字符,如果 ...
- ubuntu14.04中mysql的安裝及utf8编码集配置
mysql的安裝使用sudo apt-get install mysql-server即可安裝,我安裝的是5.6版.安装过程中会要求输入root账户的密码,按提示输入即可. Mysql Workben ...
- Mysql修改已有数据的字符集
Mysql修改已有数据的字符集 问题 在生产环境中跑了很久,发现MysqlClient连接的字符集是默认的latin1,我们一直以为都是utf8,造成这样的误解,是因为在内网环境中,我们是源码编译的M ...
- MySQL 8.0版本连接报错:Could not create connection to database server.
准备搭建一个Spring Boot 组合mybatis的项目,数据库采用的是MySQL 8.0.11按照以往的配置,使用插件mybatis-generator-maven-plugin生成代码时,一直 ...
- Linux下修改MySQL数据库字符编码为UTF-8解决中文乱码
由于MySQL编码原因会导致数据库出现乱码. 解决办法: 修改MySQL数据库字符编码为UTF-8,UTF-8包含全世界所有国家需要用到的字符,是国际编码. 具体操作: 1.进入MySQL控制台 &g ...
- centos 安装 mysql(指定安装版本)
第一步: 下载 mysql 包 第二步: rpm -Uvh mysql文件名.rpm ,这里是 rpm 其实不是安装mysql ,而是安装了一个mysql 的 yum 源 仓库 /etc/yum. ...
随机推荐
- .net core使用EF core连接mssqlserver数据库
一,打开控制台二,输入以下代码1.Install-Package Microsoft.EntityFrameworkCore 2.Install-Package Microsoft.EntityFra ...
- 批处理文件(.bat)并行Arcpy脚本提高效率的思路
Arcpy提供数据处理的方便接口,但一个Arcpy脚本通常只运行于一个核上.现在电脑通常是多核乃至多处理器,如果能将任务分解为可同时进行的若干任务,便可通过并行充分利用电脑性能. 折腾了python并 ...
- js文件需要jsp页面中的div时,此js文件必须在div之后才能获得值,否则获取不到
js文件需要jsp页面中的div时,此js文件必须在div之后才能获得值,否则获取不到 2.图2的内容为directionkey.js的内容
- Spring学习(五)Spring和Mybatis的整合
1.前言 在整合之前.要搞清楚是谁整合谁.后续会学到很多整合的例子.在这里.是Spring整合Mybatis.Spring中集成了很多关于Mybatis中一些关键类的jar包.通过这些.可以更加方便的 ...
- JAVA结合 JSON Web Token(JWT) 工具类
引入java-jwt-3.3.0.jar . jjwt-0.9.0.jar .jackson-all-1.7.6.jar 或者maven <!-- https://mvnrepository. ...
- JAVA比较指定的两个日期
判断指定日期是否在某个日期内 public static SimpleDateFormat format = new SimpleDateFormat("yyyyMMdd"); p ...
- 自动化中不能犯的4个RPA错误-RPA学习天地
自动化在客户支持中的使用预计在未来几年会加速. 根据Dimension Research的数据,2022年72%的客户互动将通过机器人流程自动化(RPA)等新兴技术进行.电话互动将从41%下降到12% ...
- C++基础之自增和自减运算符的重载
1. 格式 1.1 分为前置和后置格式: int x = 0; int y = 0; // 后置自增运算符 x++; // 前置自增运算符 ++x; // 后置自减运算符 y--; // 前置自减运算 ...
- [LeetCode] 729. My Calendar I 731. My Calendar II 732. My Calendar III 题解
题目描述 MyCalendar主要实现一个功能就是插入指定起始结束时间的事件,对于重合的次数有要求. MyCalendar I要求任意两个事件不能有重叠的部分,如果插入这个事件会导致重合,则插入失败, ...
- 【LeetCode】706. Design HashMap 解题报告(Python)
作者: 负雪明烛 id: fuxuemingzhu 个人博客: http://fuxuemingzhu.cn/ 目录 题目描述 题目大意 解题方法 日期 题目地址:https://leetcode.c ...