最近由于某些原因,又回顾了一次KMP算法。上一次回顾KMP算法还是在刷题的时候遇到的:

http://blog.csdn.net/dacc123/article/details/50994611

在我的记忆力,每次回顾KMP算法都会有新的理解,以为自己理解的很透彻了,等过一段时间再去回顾,又要花一些时间去弄门清。这次也一样。

刚接触Next数组的时候我很反感字符串前缀和后缀的最长公共子串的长度来解释next数组,我认为next数组就是一个字符串的对称程度。在这样的理解之下,计算next数组的理解就是:

在求解next数组的时候,若前面一个next数,为0,那么说明前面没有对称的,新加的字符如果要对称只可能和第一个字符开始比较。如果next数不为0,说明前面一个字符是有和它对称的,那么去找和他对称的字符的下一个字符,如果相等那么next值就++,如果不相等只能等于0了。

从今天看来,这个对称理解显然是错误的,很容把误导到回文串里面的前后对称。KMP算法其实很简单,就从前缀和后缀去理解他,这也是他算法的核心思想。

下面举个例子:

第一次匹配:从第0位开始,匹配到第7位都是相同的,最后一位发现不一样了就是第8位

0   1    2   3   4   5    6   7   8

a   b   c    x   y    a   b   c   x   y   a -------------目标字符串

a   b   c    x   y    a   b   c   1     -----------------模式字符串

接下来:

如果是暴力的话,应该是模式字符串向前移动一位,进行比较,发现第一位有不匹配的继续移动。

0   1    2   3   4   5    6   7   8

a   b   c    x   y    a   b   c   x   y  a -------------目标字符串

     a   b   c    x    y   a   b   c   1     -----------------模式字符串

假设暴力移动了x位,终于有可能匹配了,这里是有可能。那么情况一定是这样:

0   1    2   3   4   5    6   7   8

a   b   c    x   y    a   b   c   x   y   a -------------目标字符串

                         a   b   c   x   y   a   b   c   1     -----------------模式字符串

模式字符串的a , b ,c和目标的5,6,7位是相同的,(我们不看第8位以及后面的只看0~7)。这样才有可能匹配(前面移动的都是从第一位就pass掉了)。

那么回到第一步:

0   1    2   3   4   5    6   7   8

a   b   c    x   y    a   b   c   x   y   a -------------目标字符串

a   b   c    x   y    a   b   c   1     -----------------模式字符串

在发现第8位不匹配的时候,我们之前暴力推算过,向前移动5位,才有可能匹配。(只看0~7位)前7位都是相同的,我们可以找到规律,为什么移动5位才有可能匹配:

a   b   c   x   y   a   b  c

a   b  c   x    y   a   b  c

可以看这就是一个字符串的前缀=后缀的情况,不是吗?也就是说,只有当前缀等于后缀存在的情况下,你往后移才有可能匹配(在0~7之内有匹配的)。在发现第8位不匹配的情况下,我们利用next数组,直接找到前缀=后缀的那部分,直接移动过去,这样省了很多步暴力。如果发现前缀=后缀的情况不存在,那么好办,直接跳过0~7位,因为前缀=后缀不存在,你在0~7位之间怎么移动都不可能匹配。

接下来就是利用前缀与后缀求next数组的方法,很容易理解。

比如 s: a   b    a   b

next[i]  表示的是从第0~i位的字符串,前缀和后缀的最大公共子串的长度。求解next[i] 其实只有两种情况,一种是next[i-1]也就是0~i-1的子串存在前后缀最大公共子串,例如a  b  a  b 现在求解最后一位b也就是next[3],可以看next[2]=1 因为a b a的公共前后缀是a长度是1,s[0]=s[2]="a" 。 那么如果s[1]=s[3]的话,公共前后缀岂不是要加1,于是b就去找s[2]匹配的前缀就是s[1],找他的下一位s[1],果然和自己相等,于是在next[2]的基础上加1.。还要一种就是前面的next[i-1]没有前后缀公共子串,那么看来只有从自己开始开辟了,忽视果断和第一位比较,如果相等,那么从i开始就有了前后缀公共子串,长度为1.

这里还要提一点,next[i] 还表示和s[i]相等的前缀s[j]的下标j,s[j]是前缀的最后一个字符,s[i]是后缀的最后一个字符。s[i]=s[j] ,j的值既是下标(从0开始的要加 1)也是长度。

next[0]   a   只有一个字符串,最大公共子串长度为0

next[1]   a b   由于next[0]=0,说明前面的子串没有前后缀相等的情况,只能从自己开辟,发现s[0]和自己不一样,于是只能next[1]=0

next[2]  a b a   next[1]=0,同样的从自己开辟,发现s[0]和自己一样,终于有戏,于是next[2]=1

next[3]  a b a b    next[2]=1 ,前面有匹配的,于是找到next[2]匹配的那个字符串下表也就是next[2]的值,是1(我这里是下标从0开始)于是找s[0]的下一位s[1]发现和自己一样,很完美,在next[2]的基础上加1。如果不一样呢,那么很认命,自己破坏了前后缀公共子串,只能是0.

至于代码什么的就不贴了,明白了原理,写代码是信手拈来的事情,对吧!

温故KMP算法的更多相关文章

  1. 简单有效的kmp算法

    以前看过kmp算法,当时接触后总感觉好深奥啊,抱着数据结构的数啃了一中午,最终才大致看懂,后来提起kmp也只剩下“奥,它是做模式匹配的”这点干货.最近有空,翻出来算法导论看看,原来就是这么简单(先不说 ...

  2. KMP算法

    KMP算法是字符串模式匹配当中最经典的算法,原来大二学数据结构的有讲,但是当时只是记住了原理,但不知道代码实现,今天终于是完成了KMP的代码实现.原理KMP的原理其实很简单,给定一个字符串和一个模式串 ...

  3. 萌新笔记——用KMP算法与Trie字典树实现屏蔽敏感词(UTF-8编码)

    前几天写好了字典,又刚好重温了KMP算法,恰逢遇到朋友吐槽最近被和谐的词越来越多了,于是突发奇想,想要自己实现一下敏感词屏蔽. 基本敏感词的屏蔽说起来很简单,只要把字符串中的敏感词替换成"* ...

  4. KMP算法实现

    链接:http://blog.csdn.net/joylnwang/article/details/6778316 KMP算法是一种很经典的字符串匹配算法,链接中的讲解已经是很明确得了,自己按照其讲解 ...

  5. 数据结构与算法JavaScript (五) 串(经典KMP算法)

    KMP算法和BM算法 KMP是前缀匹配和BM后缀匹配的经典算法,看得出来前缀匹配和后缀匹配的区别就仅仅在于比较的顺序不同 前缀匹配是指:模式串和母串的比较从左到右,模式串的移动也是从 左到右 后缀匹配 ...

  6. 扩展KMP算法

    一 问题定义 给定母串S和子串T,定义n为母串S的长度,m为子串T的长度,suffix[i]为第i个字符开始的母串S的后缀子串,extend[i]为suffix[i]与字串T的最长公共前缀长度.求出所 ...

  7. 字符串模式匹配之KMP算法图解与 next 数组原理和实现方案

    之前说到,朴素的匹配,每趟比较,都要回溯主串的指针,费事.则 KMP 就是对朴素匹配的一种改进.正好复习一下. KMP 算法其改进思想在于: 每当一趟匹配过程中出现字符比较不相等时,不需要回溯主串的 ...

  8. 算法:KMP算法

    算法:KMP排序 算法分析 KMP算法是一种快速的模式匹配算法.KMP是三位大师:D.E.Knuth.J.H.Morris和V.R.Pratt同时发现的,所以取首字母组成KMP. 少部分图片来自孤~影 ...

  9. BF算法与KMP算法

    BF(Brute Force)算法是普通的模式匹配算法,BF算法的思想就是将目标串S的第一个字符与模式串T的第一个字符进行匹配,若相等,则继续比较S的第二个字符和 T的第二个字符:若不相等,则比较S的 ...

随机推荐

  1. SpringBoot 2.x 整合ElasticSearch的demo

    SpringBoot 2.x 整合ElasticSearch的demo 1.配置文件application.yml信息 # Tomcat server: tomcat: uri-encoding: U ...

  2. Python中文语料批量预处理手记

    手记实用系列文章: 1 结巴分词和自然语言处理HanLP处理手记 2 Python中文语料批量预处理手记 3 自然语言处理手记 4 Python中调用自然语言处理工具HanLP手记 5 Python中 ...

  3. PHP测试Mysql数据库连接

    <?php $link = mysqli_connect('localhost', 'username', 'password'); if (!$link) { die('Could not c ...

  4. asp.net core2->2.1 webapi 进行了重大变更

    传统的在 启动时候 使用Mvc路由的配置不再有效.而是基于Attribute的声明标注进行配置路由.

  5. std::lower_bound 功能

    std::lower_bound default (1) template <class ForwardIterator, class T> ForwardIterator lower_b ...

  6. DropDMG for Mac(dmg 文件打包工具)破解版安装

    1.软件简介    DropDMG 是 macOS 系统上的一款帮助用户快速打包 DMG 文件的 Mac 文件管理软件,DropDMG 不但可以将影像档加密.更可以配合 GZip .BZip2 .Ma ...

  7. CSS3 选择器 基本选择器介绍

    CSS是一种用于屏幕上渲染html,xml等一种语言,CSS主要是在相应的元素中应用样式,来渲染相对应用的元素,那么这样我们选择相应的元素就很重要了,如何选择对应的元素,此时就需要我们所说的选择器.选 ...

  8. c# 创建项目时提示:未能正确加载“microsoft.data.entity.design.bootstrappackage.。。。。

    google了下, 果然找到办法了.看有的说要卸载,再清理注册表,真心不愿意啊,这安装一次就得好长时间.还好找到了这篇博文,无需卸载重安装,很简单的解决的方式,具体见http://blog.sina. ...

  9. Win10 设置窗口背景色

    Win10 的窗口背景色不能像Win7那样通过修改Windows的"窗口"配置来生效,只能是通过修改注册表的信息来修改Win10的窗口色. 1. 通过注册表来修改默认的窗口背景色( ...

  10. TypeScript学习笔记(八):1.5版本之后的模块和命名空间

    我之前有写过TS1.5版本之前的“模块”的笔记:TypeScript学习笔记(七):模块 但是TS这里的模块和在ECMAScript 2015里的模块(即JS原生支持了模块的概念)概率出现了混淆,所以 ...