题目链接

题意:给定一个字符串,求重复次数最多的连续重复子串。

分析:(论文上的分析)先穷举长度 L,然后求长度为 L 的子串最多能连续出现几次。首先连续出现 1 次是肯定可以的,所以这里只考虑至少 2 次的情况。假设在原字符串中连续出 现 2 次,记这个子字符串为 S,那么 S 肯定包括了字符 r[0], r[L], r[L*2], r[L*3], ……中的某相邻的两个。所以只须看字符 r[L*i]和 r[L*(i+1)]往前和 往后各能匹配到多远,记这个总长度为 K,那么这里连续出现了 K/L+1 次。最后 看最大值是多少。穷举长度 L 的时间是 n,每次计算的时间是 n/L。所以整个做法的时间复杂 度是 O(n/1+n/2+n/3+……+n/n)=O(nlogn)。

因为枚举长度的同时不能枚举起点的位置,但是可以通过偏移(lcp%L)的距离来得到可能的最优起点。例如"dddcabcabcabcab"从红字与红字为开始点,长度为3的lcp为8("abcabcab"),偏移后从"dddcabcabcabcab"红字与红字开始,长度为3的lcp为9("cabcabcab")。题目要求次数最多,长度不限,字典序最小的,那么保存所有次数同样最大,不同长度的所有长度,在已经排好序的后缀从前往后匹配就行了。代码实现有诸多细节之处,另外数据水,不保证没有bug。

#include <cstdio>
#include <algorithm>
#include <cstring> const int N = 1e5 + 5;
const int D = 20;
char s[N];
int sa[N], rank[N], height[N];
int ws[N], wa[N], wb[N];
int dp[N][D];
int mlen[N]; bool cmp(int *r, int a, int b, int l) {
return (r[a] == r[b] && r[a+l] == r[b+l]);
}
void DA(char *r, int n, int m = 128) {
int i, j, p, *x = wa, *y = wb;
for (i=0; i<m; ++i) ws[i] = 0;
for (i=0; i<n; ++i) ws[x[i]=r[i]]++;
for (i=1; i<m; ++i) ws[i] += ws[i-1];
for (i=n-1; i>=0; --i) sa[--ws[x[i]]] = i;
for (j=1, p=1; p<n; j<<=1, m=p) {
for (p=0, i=n-j; i<n; ++i) y[p++] = i;
for (i=0; i<n; ++i) if (sa[i] >= j) y[p++] = sa[i] - j;
for (i=0; i<m; ++i) ws[i] = 0;
for (i=0; i<n; ++i) ws[x[y[i]]]++;
for (i=1; i<m; ++i) ws[i] += ws[i-1];
for (i=n-1; i>=0; --i) sa[--ws[x[y[i]]]] = y[i];
std::swap (x, y);
p = 1; x[sa[0]] = 0;
for (i=1; i<n; ++i) {
x[sa[i]] = cmp (y, sa[i-1], sa[i], j) ? p - 1 : p++;
}
}
}
void calc_height(char *r, int *sa, int n) {
int i, j, k = 0;
for (i=1; i<=n; ++i) rank[sa[i]] = i;
for (i=0; i<n; ++i) {
if (k) k--;
j = sa[rank[i]-1];
while (r[i+k] == r[j+k]) k++;
//其实并没有计算height[n]
height[rank[i]] = k;
}
} int query_RMQ(int l, int r) {
l = rank[l]; r = rank[r];
if (l > r) {
std::swap (l, r);
}
l++;
int k = 0; while (1<<(k+1) <= r - l + 1) k++;
return std::min (dp[l][k], dp[r-(1<<k)+1][k]);
}
void init_RMQ(int n) {
//height[0]=lcp (suffix (sa[0], sa[0-1]));没有意义
for (int i=1; i<=n; ++i) {
dp[i][0] = height[i];
}
for (int j=1; (1<<j)<=n; j++) {
for (int i=1; i+(1<<j)-1<n; ++i) {
//与之对应,从height[1]开始
dp[i][j] = std::min (dp[i][j-1], dp[i+(1<<(j-1))][j-1]);
}
}
} int main() {
int cas = 0;
while (scanf ("%s", s) == 1) {
if (strcmp (s, "#") == 0) {
break;
}
int n = strlen (s);
DA (s, n + 1);
calc_height (s, sa, n);
init_RMQ (n);
int best = -1, tot = 0;
for (int l=1; l<=n; ++l) {
for (int i=0; i+l<n; i+=l) {
int lcp = query_RMQ (i, i + l);
int m = l - lcp % l;
if (i - m >= 0 && lcp % l) {
lcp = std::max (lcp, query_RMQ (i - m, i - m + l));
}
int t = lcp / l + 1;
if (best < t) {
best = t;
tot = 0;
mlen[tot++] = l;
} else if (best == t && mlen[tot-1] != l) {
mlen[tot++] = l;
}
}
}
//best: 重复次数 mlen: 每段长度
int len = -1, from = 0;
for (int i=1; i<=n && len==-1; ++i) {
for (int j=0; j<tot; ++j) {
int l = mlen[j];
if (sa[i] + l > n) {
continue;
}
int lcp = query_RMQ (sa[i], sa[i] + l);
if (lcp >= (best - 1) * l) {
len = l; from = sa[i];
break;
}
}
}
printf ("Case %d: ", ++cas);
int L = len * best; //当字符串只有一个时,L=-1*-1=1, from=0, 输出s[0]
for (int j=0, i=from; j<L; ++i, ++j) {
printf ("%c", s[i]);
}
puts ("");
}
return 0;
}

  

后缀数组 POJ 3693 Maximum repetition substring的更多相关文章

  1. POJ 3693 Maximum repetition substring(最多重复次数的子串)

    Maximum repetition substring Time Limit: 1000MS   Memory Limit: 65536K Total Submissions: 10461   Ac ...

  2. POJ 3693 Maximum repetition substring(后缀数组)

    Description The repetition number of a string is defined as the maximum number R such that the strin ...

  3. POJ 3693 Maximum repetition substring(后缀数组+ST表)

    [题目链接] poj.org/problem?id=3693 [题目大意] 求一个串重复次数最多的连续重复子串并输出,要求字典序最小. [题解] 考虑错位匹配,设重复部分长度为l,记s[i]和s[i+ ...

  4. POJ 3693 Maximum repetition substring ——后缀数组

    重复次数最多的字串,我们可以枚举循环节的长度. 然后正反两次LCP,然后发现如果长度%L有剩余的情况时,答案是在一个区间内的. 所以需要找到区间内最小的rk值. 两个后缀数组,四个ST表,$\Thet ...

  5. POJ - 3693 Maximum repetition substring(重复次数最多的连续重复子串)

    传送门:POJ - 3693   题意:给你一个字符串,求重复次数最多的连续重复子串,如果有一样的,取字典序小的字符串. 题解: 比较容易理解的部分就是枚举长度为L,然后看长度为L的字符串最多连续出现 ...

  6. poj 3693 Maximum repetition substring

    呵呵呵呵呵呵呵呵呵呵,sb(神犇)题看了一天,还是不懂 题目要求的是最多重复的,那么就来找重复的,可以先枚举一个重复的单元(比如ababab,就枚举ab)的长度, 然后再原串中,会有ch[0],ch[ ...

  7. poj 3693 Maximum repetition substring (后缀数组)

    其实是论文题.. 题意:求一个字符串中,能由单位串repeat得到的子串中,单位串重复次数最多的子串.若有多个重复次数相同的,输出字典序最小的那个. 解题思路:其实跟论文差不多,我看了很久没看懂,后来 ...

  8. POJ 3693 Maximum repetition substring (后缀数组+RMQ)

    题意:给定一个字符串,求其中一个由循环子串构成且循环次数最多的一个子串,有多个就输出最小字典序的. 析:枚举循环串的长度ll,然后如果它出现了两次,那么它一定会覆盖s[0],s[ll],s[ll*2] ...

  9. POJ 3693 Maximum repetition substring(连续重复子串)

    http://poj.org/problem?id=3693 题意:给定一个字符串,求重复次数最多的连续重复子串. 思路: 这道题确实是搞了很久,首先枚举连续子串的长度L,那么子串肯定包含了r[k], ...

随机推荐

  1. ASIHTTPRequest详解 [经典]

    ASIHTTPRequest 对CFNetwork API进行了封装,并且使用起来非常简单,用Objective-C编写,可以很好的应用在Mac OS X系统和iOS平台的应用程序中.ASIHTTPR ...

  2. 已有a,b两个链表,每个链表中的结点包括学号,成绩。要求把两个链表合并。按学号升序排列.

    #include <stdio.h>#define SIZE sizeof(struct student)struct student{       long num;       flo ...

  3. php 复习

    <?php 一.php基础语法1.输出语句:echo print print_r var_dump() 2.php是弱类型语言强制转换类型: (类型)变量 settype(变量,类型) 3.变量 ...

  4. MVC – 6.控制器 Action方法参数与返回值

      6.1 Controller接收浏览器数据   a.获取Get数据 : a1:获取路由url中配置好的制定参数: 如配置好的路由: 浏览器请求路径为: /User/Modify/1 ,MVC框架获 ...

  5. 那些年,我们在Django web开发中踩过的坑(一)——神奇的‘/’与ajax+iframe上传

    一.上传图片并在前端展示 为了避免前端整体刷新,我们采用ajax+iframe(兼容所有浏览器)上传,这样用户上传之后就可以立即看到图片: 上传前: 上传后: 前端部分html: <form s ...

  6. Babelfish(二分查找,字符串的处理略有难度,用sscanf输入)

    Babelfish Time Limit: 3000MS   Memory Limit: 65536K Total Submissions: 28581   Accepted: 12326 题目链接: ...

  7. OCJP(1Z0-851) 模拟题分析(四)over

    Exam : 1Z0-851 Java Standard Edition 6 Programmer Certified Professional Exam 以下分析全都是我自己分析或者参考网上的,定有 ...

  8. <jsp:include>和<%@include file=""%>区别【131031】

    <jsp:include page=""> 父页面和包含进来的页面单独编译,单独翻译成servlet后,在前台拼成一个HTML页面. <%@include fil ...

  9. visual studio2010复制粘贴源代码到Word时乱码问题 分类: C# 2014-11-28 09:25 687人阅读 评论(0) 收藏

    问题描述: visual studio2010 拷贝源代码的时候,在windows自带的写字板和word2010上,粘贴的时候中文字符都会变成乱码. 如: "该用户已经被成功添加" ...

  10. C# 使用Trace记录程序日志

    在程序开发中,我们通常需要记录程序运行的状态,在程序部署后,发生的异常可以记录在日志中,便于发现程序潜在的问题.在.NET平台,有很多优秀的日志类库,例如Log4Net.如果程序很小,我们可以自己通过 ...