字符串匹配算法KMP, 核心思想是尽可能利用已经匹配的结果, 跳过尽可能多的不需要匹配的情况

重点和难点都在next数组的建立上

1. KMP算法的next数组求解

以模式串 a b a c a b 为例

||

w

a b a c a b

0

// 初始, 两个指针都在下标0的位置, 从此开始,  current指针不断后移,

// 并和头指针比较, 不同填0,相同则为前一个值加1

 | |

 v v

 a b a c a b

 0 0

 |   |

 v   v

 a b a c a b

 0 0 1

 |     |

 v     v

 a b a c a b

 0 0 1 0

 |       |

 v       v

 a b a c a b

 0 0 1 0 1

 |         |

 v         v

 a b a c a b

 0 0 1 0 1 2

  其中, 当在模式字符串i位置匹配失败的时候, i 跳转到next[i-1]的值

如上所示, 则当第二个字符a匹配失败的时候, 返回第一个字符b位置对应的next值, 为0.看上去没问题

但是, 当最后一个字符b匹配失败的时候, 根据该算法应返回1.意味着, 我们希望可以像下面这样继续:

abaca?

abacab 进行继续匹配。事实上这是有问题的。根据之前的匹配结果, 已知? <> 'b' ,这次匹配注定是失败的,是没有意义的, 应返回0

2. 自己尝试改写的求next方法

我们希望得到这样的结果:

abacab

000100

并在模式串i位置匹配失败时, 返回next[i]的值

根据kmp指导思想, 希望可以利用已经匹配的结果, 也就是重叠已经匹配的结果和模式串中的前缀部分.

这需要模式串中有跟模式串前缀相同的字符串存在, 但是为了避免匹配失败时, 再度尝试与已知匹配结果的字符进行匹配,先分析如下:

例: abacab

首先满足第一个条件, 就是模式串中存在模式串前缀的内容, 首要保证的是, 模式串的第一个字符在模式串中存在多个

例子中有两处

    1   2
| |
a b a c a b

接下来, 两处中能匹配模式串前缀的最长字符串分别为:

1 : a    2 : ab

第二个条件, 减少已知结果的匹配

1. 当1处的a匹配成功时,但c匹配失败时, 因为模式串前缀ab与ac有重叠但不完全相同

可以重叠匹配像这样:

aba?

abacab  ?虽然与'c'匹配失败, 但不一定与'b'匹配失败, 这样的匹配是有必要的

2. 当2处的a匹配成功, 但b匹配失败时, 因为模式串前缀ab与ab完全相同,所以不可以进行重叠匹配,原因:

abaca?                                                                                       abaca?

abacab 此时已知?与'b'不匹配, 这样的匹配是没有必要的  应该这样:              abacab 即直接跳回最开始的位置重新匹配

注意到两者的差别, 1.处时, 虽然在非模式串前缀匹配失败, 可进行重叠匹配, 2处时在模式串前缀匹配失败, 不可重叠匹配

(模式串并不一定指1之前的,如abcacabcab 这里模式串前缀也可以是abcac, 而不一定是abc)

于是有下面的推导:

最开始next数组全部用0初始化
两个指针在0下表
state 表示是否在前缀状态 state = 0
| |
v v
a b a c a b
0 0 0 0 0 0 state = 1// 此时开启前缀模式
| |
v v
a b a c a b
0 0 0 0 0 0 state = 0//state为1时, 头指针跟着向前走, 当state从1变为0时, next记录此时头指针的位置,头指针回到初始状态
| |
v v
a b a c a b
0 0 0 1 0 0 state = 1
| |
v v
a b a c a b
0 0 0 1 0 0 state = 1
| |
v v
a b a c a b
0 0 0 1 0 0

代码实现:

int* getNext(const char *target) {
int *next;
int head, current, len, state;
len = strlen(target);
// 生产next数组
next = (int *)malloc(sizeof(int) * len);
// 出事化工作
head = ;
current = ;
next[] = ;
memset(next, , len * sizeof(int));
state = ; // 非前缀状态
// 遍历target产生next数组
// 原理, 尽可能利用已经匹配的结果进行错位
while(current < len) {
if(target[head] == target[current]) {
// 如果相等, 进入前缀状态, head 指针跟着current指针后移
state = ;
head++;
current++;
}else {
if(state == ) {
// state 从0变为1, 设置next值
next[current] = head;
// 回到初始状态
head = ;
state = ;
}
else {
current++;
}
}
}
return next;
}

算法实现:

/*
这部分代码的实现可能有点乱, 不太优美, 回头再改改~~
*/
int KMP(const char *source, const char *target) {
int *next;
// 获得next数组
next = getNext(target);
int source_index = ;
int source_len = strlen(source);
int target_index = ;
int target_len = strlen(target);
while(source_index < source_len && target_index < target_len) {
if(source[source_index] == target[target_index]) {
source_index++;
target_index++;
}else {
// 跳过
if(target_index == )
source_index++;
else {
printf("Skip %d to %d for %c where %d\n", target_index, next[target_index - ], source[source_index], source_index);
target_index = next[target_index];
}
}
}
if(source_index == source_len)
return -;
return source_index - target_len;
}

算法实现时的问题:

1. 为处理字符串为空字符串的情况

2. 为考虑传入NULL值的情况

在KMP函数最前面加入一下代码后, 可以过lintcode的strStr题目

if(source == NULL || target == NULL)

    return -;

if(source == "" && target == "")

    return ;

KMP(构建next数组)的更多相关文章

  1. 求最长公共前缀和后缀—基于KMP的next数组

    KMP算法最主要的就是计算next[]算法,但是我们知道next[]求的是当前字符串之前的子字符串的最大前后缀数,但是有的时候我们需要比较字符串中前后缀最大数,比如 LeetCode的shortest ...

  2. 剑指offer(51)构建乘积数组

    题目描述 给定一个数组A[0,1,...,n-1],请构建一个数组B[0,1,...,n-1],其中B中的元素B[i]=A[0]*A[1]*...*A[i-1]*A[i+1]*...*A[n-1].不 ...

  3. 剑指Offer 51. 构建乘积数组 (数组)

    题目描述 给定一个数组A[0,1,...,n-1],请构建一个数组B[0,1,...,n-1],其中B中的元素B[i]=A[0]*A[1]*...*A[i-1]*A[i+1]*...*A[n-1].不 ...

  4. 【Java】 剑指offer(66) 构建乘积数组

      本文参考自<剑指offer>一书,代码采用Java语言. 更多:<剑指Offer>Java实现合集   题目 给定一个数组A[0, 1, …, n-1],请构建一个数组B[ ...

  5. 《剑指offer》第六十六题(构建乘积数组)

    // 面试题66:构建乘积数组 // 题目:给定一个数组A[0, 1, …, n-1],请构建一个数组B[0, 1, …, n-1],其 // 中B中的元素B[i] =A[0]×A[1]×… ×A[i ...

  6. 剑指offer五十一之构建乘积数组

    一.题目 给定一个数组A[0,1,...,n-1],请构建一个数组B[0,1,...,n-1],其中B中的元素B[i]=A[0]*A[1]*...*A[i-1]*A[i+1]*...*A[n-1].不 ...

  7. (剑指Offer)面试题52:构建乘积数组

    题目: 给定一个数组A[0,1,...,n-1],请构建一个数组B[0,1,...,n-1],其中B中的元素B[i]=A[0]*A[1]*...*A[i-1]*A[i+1]*...*A[n-1].不能 ...

  8. 剑指Offer——构建乘积数组

    题目描述: 给定一个数组A[0,1,...,n-1],请构建一个数组B[0,1,...,n-1],其中B中的元素B[i]=A[0]*A[1]*...*A[i-1]*A[i+1]*...*A[n-1]. ...

  9. 【剑指offer】不使用除法,构建乘积数组,C++实现

    # 题目 # 思路 设C[i] = A[0] * A[1] * - * A[i-1],D[i] =  A[i+1] * - * A[n-1],则C[i]按照从上到下的顺序计算,即C[i] = C[i- ...

  10. [剑指Offer] 51.构建乘积数组

    题目描述 给定一个数组A[0,1,...,n-1],请构建一个数组B[0,1,...,n-1],其中B中的元素B[i]=A[0]*A[1]*...*A[i-1]*A[i+1]*...*A[n-1].不 ...

随机推荐

  1. VS2010 C++学习(5):基于DirectShow的视频预览录像程序

    VS2010 C++学习(5):基于DirectShow的视频 预览录像程序 学习VC++编制的基于DirectShow视频捕获程序,主要练习基于DirectShow程序的应用. 一.         ...

  2. 浅谈IT企业挑选技术人员招聘几个要点

    在实际人员招聘的一些感想总结,企业需要怎么样的人才,个人总结如下: 1.技术能力不是第一位 企业在招聘一个人的时候往往看你第一点不是技术实力,而是你个人言谈行为和态度,往往一个面试你的人员他不可能在半 ...

  3. 使用Gulp进行代码压缩的步骤以及配置

    一.安装步骤 1.首先确定是否安装了node.js,如果未安装,请先安装node.js: 2.确定是否安装了包管理工具npm,如未安装请安装:npm install npm -g: 3.安装gulp: ...

  4. HTML5结合CSS的三种方法+结合JS的三种方法

    HTML5+CSS: HTML中应用CSS的三种方法 一.内联 内联样式通过style属性直接套进HTML中去. 示例代码 <pstylepstyle="color:red" ...

  5. iBatis基础知识

    iBatis简介: 特点:结构性好,小巧,容易上手 搭建环境: 1.创建java 项目 2.导入(3个)jar包:ibatis-2.3.0.667.jar,mysql驱动包,Junit测试包 3.配置 ...

  6. C#图解教程 第九章 语句

    语句 什么是语句控制流语句if语句if-else语句while循环do循环for循环 for语句中变量的作用域初始化和迭代表达式中的多表达式 switch语句 分支示例switch语句补充分支标签 跳 ...

  7. CentOS 7.x 防火墙开放端口相关用法记录

    前言 防火墙对服务器起到一定的保护作用,所以了解一些相关的操作是很有必要的. 在CentOS 7.x中,有了一种新的防火墙策略,FireWall , 还记得在6.x中用的还是iptables. 这几天 ...

  8. [Luogu2664]树上游戏

    题面戳我 sol 点分.我们面临的最主要一个问题,就是如何在\(O(n)\)的时间内算出所有LCA为根的点对的贡献,还要分别累加到它们自己的答案中去. \(num_i\):每一种颜色的数量.你可以认为 ...

  9. [BZOJ4825][HNOI2017]单旋spaly

    BZOJ Luogu 题目太长了,就不放了. 题解 首先声明一点,无论是splay还是spaly,插入一个新的元素,都要rotate到根!所以说题目也算是给了一个错误示范吧. 我们发现把最值旋转到根并 ...

  10. Python Django的生产部署方式

    本地化部署的Django有很大的局限性,无法用于生产环境,比如无法抗住多并发,无法长时间的运行,容易造成网页无响应的问题.所以如何将Django部署到真正的生产环境中,让其能够真正的像正常的网页一样工 ...