[LeetCode] 393. UTF-8 Validation 编码验证

A character in UTF8 can be from 1 to 4 bytes long, subjected to the following rules:

For 1-byte character, the first bit is a 0, followed by its unicode code.
For n-bytes character, the first n-bits are all one's, the n+1 bit is 0, followed by n-1 bytes with most significant 2 bits being 10.

This is how the UTF-8 encoding would work:

   Char. number range  |        UTF-8 octet sequence

      (hexadecimal)    |              (binary)

   --------------------+---------------------------------------------

   0000 0000-0000 007F | 0xxxxxxx

   0000 0080-0000 07FF | 110xxxxx 10xxxxxx

   0000 0800-0000 FFFF | 1110xxxx 10xxxxxx 10xxxxxx

   0001 0000-0010 FFFF | 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx

Given an array of integers representing the data, return whether it is a valid utf-8 encoding.

Note:
The input is an array of integers. Only the least significant 8 bits of each integer is used to store the data. This means each integer represents only 1 byte of data.

Example 1:

data = [197, 130, 1], which represents the octet sequence: 11000101 10000010 00000001.

Return true.

It is a valid utf-8 encoding for a 2-bytes character followed by a 1-byte character.

Example 2:

data = [235, 140, 4], which represented the octet sequence: 11101011 10001100 00000100.+

Return false.

The first 3 bits are all one's and the 4th bit is 0 means it is a 3-bytes character.

The next byte is a continuation byte which starts with 10 and that's correct.

But the second continuation byte does not start with 10, so it is invalid.

这道题考察我们 UTF-8 编码，这种互联网所采用的通用的编码格式的产生是为了解决ASCII只能表示英文字符的局限性，和统一 Unicode 的实现方式。下面这段摘自维基百科 UTF-8 编码：

对于 UTF-8 编码中的任意字节B，如果B的第一位为0，则B独立的表示一个字符(ASCII 码)；
如果B的第一位为1，第二位为0，则B为一个多字节字符中的一个字节(非 ASCII 字符)；
如果B的前两位为1，第三位为0，则B为两个字节表示的字符中的第一个字节；
如果B的前三位为1，第四位为0，则B为三个字节表示的字符中的第一个字节；
如果B的前四位为1，第五位为0，则B为四个字节表示的字符中的第一个字节；
因此，对 UTF-8 编码中的任意字节，根据第一位，可判断是否为 ASCII 字符；根据前二位，可判断该字节是否为一个字符编码的第一个字节；根据前四位（如果前两位均为1），可确定该字节为字符编码的第一个字节，并且可判断对应的字符由几个字节表示；根据前五位（如果前四位为1），可判断编码是否有错误或数据传输过程中是否有错误。

那么根据上面的描述，我们可以先来判断第一位，如果是0的话，则说明是 ASCII 码，我们直接跳过，判断方法是只要比二进制数 10000000 小的数第一位肯定是0，然后我们来处理第一位是1的情况，由于第一位的1只是个标识符，后面连续跟的1的个数才是表示后面的字节的个数，我们可以统一从第一位开始连续1的个数，然后减去1就是后面的字节的个数，我想的办法是如果该数字大于等于 128，则表示第一位是1，然后减去 128，如果得到的数大于等于 64，则表示第二位是1，依次类推就可以得到连续的个数 cnt，我们要注意 10000000 这个数是不合法的，所以当 cnt 为1的时候直接返回 false，还有就是连续1的个数不能超过4个，当 cnt 大于4时也是不合法的。即便是当 cnt 为 [2, 4] 之间的数，若后面没有跟正确个数的字节，还是非法的，所以当 cnt > n-i 时还是 false。我们得到了合法的 cnt 的个数，只要验证后面的字节是否是以 10 开头的数即可，验证方法也很简单，只要这个数在 10000000 ~ 10111111 范围之间，则一定是 10 开头的，参见代码如下：

解法一：

class Solution {

public:

    bool validUtf8(vector<int>& data) {

        int n = data.size();

        for (int i = ; i < n; ++i) {

            if (data[i] < 0b10000000) {

                continue;

            } else {

                int cnt = , val = data[i];

                for (int j = ; j >= ; --j) {

                    if (val >= pow(, j)) ++cnt;

                    else break;

                    val -= pow(, j);

                }

                if (cnt ==  || cnt >  || cnt > n - i) return false;

                for (int j = i + ; j < i + cnt; ++j) {

                    if (data[j] > 0b10111111 || data[j] < 0b10000000) return false;

                }

                i += cnt - ;

            }

        }

        return true;

    }

};

在论坛里看到了一种非常简洁的方法，大神就是大神啊，这种方法也是要记连续1的个数，如果是标识字节，先将其向右平移五位，如果得到 110，则说明后面跟了一个字节，否则向右平移四位，如果得到 1110，则说明后面跟了两个字节，否则向右平移三位，如果得到 11110，则说明后面跟了三个字节，否则向右平移七位，如果为1的话，说明是 10000000 这种情况，不能当标识字节，直接返回 false。在非标识字节中，向右平移六位，如果得到的不是 10，则说明不是以 10 开头的，直接返回 false，否则 cnt 自减1，成功完成遍历返回 true，参见代码如下：

解法二：

class Solution {

public:

    bool validUtf8(vector<int>& data) {

        int cnt = ;

        for (int d : data) {

            if (cnt == ) {

                if ((d >> ) == 0b110) cnt = ;

                else if ((d >> ) == 0b1110) cnt = ;

                else if ((d >> ) == 0b11110) cnt = ;

                else if (d >> ) return false;

            } else {

                if ((d >> ) != 0b10) return false;

                --cnt;

            }

        }

        return cnt == ;

    }

};

Github 同步地址：

https://github.com/grandyang/leetcode/issues/393

参考资料：

https://leetcode.com/problems/utf-8-validation/

https://leetcode.com/problems/utf-8-validation/discuss/87464/Bit-Manipulation-Java-6ms

https://leetcode.com/problems/utf-8-validation/discuss/87462/Concise-C%2B%2B-implementation

LeetCode All in One 题目讲解汇总(持续更新中...)

[LeetCode] 393. UTF-8 Validation 编码验证的更多相关文章

[LeetCode] UTF-8 Validation 编码验证
A character in UTF8 can be from 1 to 4 bytes long, subjected to the following rules: For 1-byte char ...
Silverlight实例教程 - 自定义扩展Validation类,验证框架的总结和建议（转载）
Silverlight 4 Validation验证实例系列 Silverlight实例教程 - Validation数据验证开篇 Silverlight实例教程 - Validation数据验证基础 ...
广告系统中weak-and算法原理及编码验证
wand(weak and)算法基本思路一般搜索的query比较短,但如果query比较长,如是一段文本,需要搜索相似的文本,这时候一般就需要wand算法,该算法在广告系统中有比较成熟的应该,主要 ...
Model Validation(模型验证)
Model Validation(模型验证) 前言阅读本文之前,您也可以到Asp.Net Web API 2 系列导航进行查看 http://www.cnblogs.com/aehyok/p/344 ...
java bean validation 参数验证
一.前言二.几种解决方案三.使用bean validation 自带的注解验证四.自定义bean validation 注解验证一.前言在后台开发过程中,对参数的校验成为开发环境不可缺少的一 ...
Silverlight实例教程 - Validation数据验证DataAnnotation机制和调试技巧（转载）
Silverlight 4 Validation验证实例系列 Silverlight实例教程 - Validation数据验证开篇 Silverlight实例教程 - Validation数据验证基础 ...
Silverlight实例教程 - Validation数据验证基础属性和事件（转载）
Silverlight 4 Validation验证实例系列 Silverlight实例教程 - Validation数据验证开篇 Silverlight实例教程 - Validation数据验证基础 ...
Silverlight实例教程 - Validation数据验证开篇
Silverlight 4 Validation验证实例系列 Silverlight实例教程 - Validation数据验证开篇 Silverlight实例教程 - Validation数据验证基础 ...
LeetCode初级算法--树02：验证二叉搜索树
LeetCode初级算法--树02:验证二叉搜索树搜索微信公众号:'AI-ming3526'或者'计算机视觉这件小事' 获取更多算法.机器学习干货 csdn:https://blog.csdn.ne ...

随机推荐

iview 组件的额外传参问题记录
在使用iview组件的时候,经常遇到额外传参的问题,一般情况下可以使用以下2种方法都可以解决: 1.直接在方法后面输入参数,有的时候借用$event获取当前dom信息,在某些特定情况下可以将参数绑定在 ...
python3爬虫筛选所需要数据
第一次使用博客园,也是第一篇文章,让我们一起开启学习之旅吧!! 昨天在为某授权系统做安全性测试的时候,可以未授权访问系统的用户登陆统计记录.由此想整理出部分用户名,作为暴力破解的用户名,检查是否存在用 ...
dubbo入门教程-从零搭建dubbo服务
[原创转载请注明出处] 本文是学习了dubbo之后自己手动写的,比较通俗,很多都是自己学习之后的理解,写的过程中没有参考任何文章. 另外dubbo也有官方文档,但是比较官方,也可以多看看dubbo的 ...
sql server中的临时表、表变量和公用表表达式
在编写T-SQL语句的时候,SQL Server提供了三种方法临时存储某些结果集,分别是临时表.表变量和公用表表达式. 临时表临时表需要在临时数据库TempDB中通过I/O操作来创建表结构,一旦用户 ...
Entity Framework 6 中如何获取 EntityTypeConfiguration 的 Edm 信息？（一）
1. 案例1 - 类型和表之间的EF代码优先映射从EF6.1开始,有一种更简单的方法可以做到这一点.有关详细信息,请参阅我的新EF6.1类型和表格之间的映射. 直接贴代码了从EF6.1开始,有一 ...
【mybatis】mybatis传参的几种方式
参考地址: https://my.oschina.net/liuzelin/blog/2966633
HTML教程详解
HTML学习笔记目录一.html简介 1.html是什么? 2.html能做什么(html的作用)? 3.html书写规范二.html基本标签 1.标签的语法 2.标签的分类 3.常用标签: 1 ...
c# System.Net.Sockets =》TcpListener用法
private TcpListener _listener;#region 初始化 listener public override void Init() { try { DevInfo.Read ...
C#: 解决Fody is only supported on MSBuild 16 and above
背景信息: 使用Costura.Fody插件将自己写的程序打包成一个可以独立运行的EXE文件我们在开发程序的时候会引用很多DLL文件,在程序完成编写后,如果不把这些引用的DLL打包,在拷贝给到别人使用 ...
OSI七层模型简述
一.OSI七层参考模型开放式系统互联通信参考模型(英语:Open System Interconnection Reference Model,缩写为 OSI),简称为OSI模型(OSI model ...

[LeetCode] 393. UTF-8 Validation 编码验证

[LeetCode] 393. UTF-8 Validation 编码验证的更多相关文章

随机推荐

热门专题