Note -「Suffix Automaton」SAM
Part. 1 基本信息
Part. 1-1 SAM 的构成。
SAM 由两个东西构成,一个是一个 DAWG,还有一棵外向树,叫 parent tree。
比如,给你一个字符串 \(S=\sf abbabb\),它的 SAM 长成这样:

SAM 的 DAWG 大概可以理解为把字符串的所有后缀插入一个 Trie。当然如果你暴力插,点数为 \(\mathcal{O}(n^2)\)。
不过显然我们可以把一些重复的结点 rua 在一起,点数差不多就成了 \(\mathcal{O}(n)\),还要带个 \(2\) 的常数。
然后,\(S\) 的子串都可以被 SAM 的 DAWG 上的某条路径表示,很显,对吧。
DAWG 的边就是上图中的黑边,蓝边就是 parent tree 的树边。
Part. 1-2 符号约定
我们称 \(S[l,r]\) 为字符串 \(S\) 的 \([l,r]\) 的子串,相信大家都懂,下标从 \(1\) 开始。
我们称一个集合 \(\text{endpos}(S[l,r])\) 为:对于字符串 \(S\),\(S[l,r]\) 在 \(S\) 中出现的区间为 \([l_{1},r_{1}],\cdots,[l_{k},r_{k}]\),\(\text{endpos}(S[l,r])=\{r_{1},\cdots,r_{k}\}\)。
对于两个子串 \(x,y\),如果 \(\text{endpos}(x)=\text{endpos}(y)\),则称 \(x,y\) 在同一个 \(\text{endpos}\) 等价类中。
显然在 DAWG 上,从根节点到一个结点 \(u\) 能组成的字符串的长度是不同的(不同的路径组成的字符串长度不一定等),我们称从根节点到一个结点 \(u\) 能组成的最长的一个字符串的长度为 \(\text{maxlen}(u)\),最短的称为 \(\text{minlen}(u)\)。
Part. 2 需要知道的
Part. 2-1 \(\text{enspos}\) 的性质
引理 1:对于两个 \(S\) 的非空子串 \(x,y\)(不妨设 \(|x|<|y|\)),若 \(\text{endpos}(x)=\text{endpos}(y)\),则 \(x\) 为 \(y\) 的一个真后缀。
Obviously。
引理 2:对于两个 \(S\) 的非空子串 \(x,y\)(不妨设 \(|x|\le|y|\)),则
\[\begin{cases}
\text{endpos}(x)\subseteq\text{endpos}(y),x\text{ is a suffix of } y, \\
\displaystyle\\
\text{endpos}(x)\cap\text{endpos}(y),\text{otherwise}
\end{cases}
\]
Obviously。
引理 3:在一个 \(\text{endpos}\) 等价类中,将类中的所有子串按长度非递增的顺序排序。每个子串都不会比它前一个子串长,与此同时每个子串也是它前一个子串的后缀。换句话说,对于同一等价类的任一两子串,较短者为较长者的后缀,且该等价类中的子串长度恰好覆盖整个区间 \([x,y]\)。
由引理 1,可知这些子串不会等长(对于两个串,较短串为较长串的真后缀),后面 obviously。
说得简单一点,把一个等价类里面最长的那个字符串拿出来,其他所有串都是该串的 suffix。
Part. 2-2 后缀链接 Link
后缀链接是在原串的 DAWG 上的点连出的边。后缀链接的链接遵循某种规则,且最后构成的是一棵树,我们把后缀链接连出来的树称为 Parent Tree,在后文我们将讲解这种规则。
我们先来看看一个串 \(S=\sf aababa\) 的 Parent Tree 长成副什么样子:

图是从 command_block 那里拿来的,可以沟通删除。(已经修正了原图的勘误)
为了说明方便,我们以一个任意的等价类来说明,我们称这个等价类中长度最大的串为 \(S_{\max}\),同理有 \(S_{\min}\)。
考虑在 \(S_{\max}\) 前面加上一个字符,称为新串为 \(S_{\text{new}}\),显然 \(S_{\text{new}}\) 一定不和 \(S_{\max}\) 在同一等价类里。
我们把上述 加字符 的操作看为分裂出儿子。有了这些,我们可以得出一些性质:
设 Parent Tree 上的父亲为 \(f\),儿子为 \(u\),有 \(\text{minlen}(u)=\text{maxlen}(f)+1\),显然。
点数边数皆为 \(\mathcal{O}(n)\),不考虑证明,背着。
在 Parent Tree 上,一个结点的父亲一定是该结点的后缀,显然。
最后板子自己理解性背住吧,构造方法不想写了。
struct SuffixAutomaton
{
int ID(char c)
{
return c-'a';
}
struct node
{
int len,link,ch[26];
}nodes[3000010];
int n,cntot,las,siz[3000010];
char s[1000010];
vector<int> e[3000010];
void init(int len,char c[])
{
n=len;
for(int i=1;i<=n;++i) s[i]=c[i];
nodes[0].len=las=cntot=0;
nodes[0].link=-1;
}
void extend(char c)
{
int cur=++cntot,one=las,ano=0;
nodes[cur].len=nodes[las].len+1;
while(~one&&!nodes[one].ch[ID(c)])
{
nodes[one].ch[ID(c)]=cur;
one=nodes[one].link;
}
if(one==-1) nodes[cur].link=0;
else
{
ano=nodes[one].ch[ID(c)];
if(nodes[one].len+1==nodes[ano].len) nodes[cur].link=ano;
else
{
int clone=++cntot;
nodes[clone].len=nodes[one].len+1;
nodes[clone].link=nodes[ano].link;
memcpy(nodes[clone].ch,nodes[ano].ch,sizeof(int)*26);
while(~one&&nodes[one].ch[ID(c)]==ano)
{
nodes[one].ch[ID(c)]=clone;
one=nodes[one].link;
}
nodes[ano].link=nodes[cur].link=clone;
}
}
siz[las=cur]=1;
}
void pre()
{
for(int i=1;i<=n;++i) extend(s[i]);
for(int i=1;i<=cntot;++i) e[nodes[i].link].push_back(i);
}
void dfs(int x)
{
for(int i=0;i<e[x].size();++i)
{
int y=e[x][i];
dfs(y);
siz[x]+=siz[y];
}
if(siz[x]^1) ans=max(ans,siz[x]*nodes[x].len);
}
}SAM;
代码中的 siz 是 \(\text{endpos}\) 集合大小。
Note -「Suffix Automaton」SAM的更多相关文章
- Note -「Lagrange 插值」学习笔记
目录 问题引入 思考 Lagrange 插值法 插值过程 代码实现 实际应用 「洛谷 P4781」「模板」拉格朗日插值 「洛谷 P4463」calc 题意简述 数据规模 Solution Step 1 ...
- Note -「动态 DP」学习笔记
目录 「CF 750E」New Year and Old Subsequence 「洛谷 P4719」「模板」"动态 DP" & 动态树分治 「洛谷 P6021」洪水 「S ...
- Note -「单位根反演」学习笔记
\(\mathcal{Preface}\) 单位根反演,顾名思义就是用单位根变换一类式子的形式.有关单位根的基本概念可见我的这篇博客. \(\mathcal{Formula}\) 单位根反演的 ...
- Note -「Mobius 反演」光速入门
目录 Preface 数论函数 积性函数 Dirichlet 卷积 Dirichlet 卷积中的特殊函数 Mobius 函数 & Mobius 反演 Mobius 函数 Mobius 反演 基 ...
- Note -「Min_25 筛」“你就说这素因子你要不要吧?你要不要?”
赛上想写,Track Lost 了属于是. \(\mathscr{Intro}\) Min_25 筛是用于求积性函数前缀和,同时顺带求出一些"有意思"的信息的筛法. 一 ...
- Note -「多项式」基础模板(FFT/NTT/多模 NTT)光速入门
进阶篇戳这里. 目录 何为「多项式」 基本概念 系数表示法 & 点值表示法 傅里叶(Fourier)变换 概述 前置知识 - 复数 单位根 快速傅里叶正变换(FFT) 快速傅里叶逆变换(I ...
- Note -「圆方树」学习笔记
目录 圆方树的定义 圆方树的构造 实现 细节 圆方树的运用 「BZOJ 3331」压力 「洛谷 P4320」道路相遇 「APIO 2018」「洛谷 P4630」铁人两项 「CF 487E」Touris ...
- Note -「Dijkstra 求解 MCMF」
食用前请先了解 SPFA + Dinic/EK 求解 MCMF. Sol. 总所周知,SPFA 牺牲了.于是我们寻求一些更稳定的算法求解 MCMF. 网络流算法的时间属于玄学,暂且判定为混乱中的稳定. ...
- 「TJOI / HEOI2016」字符串
「TJOI / HEOI2016」字符串 题目描述 佳媛姐姐过生日的时候,她的小伙伴从某东上买了一个生日礼物.生日礼物放在一个神奇的箱子中.箱子外边写了一个长为 \(n\) 的字符串 \(s\),和 ...
- [转帖]「日常小记」linux中强大且常用命令:find、grep
「日常小记」linux中强大且常用命令:find.grep https://zhuanlan.zhihu.com/p/74379265 在linux下面工作,有些命令能够大大提高效率.本文就向大家介绍 ...
随机推荐
- CKS 考试题整理 (09)-日志审计 log audit
Task 在cluster中启用审计日志.为此,请启用日志后端,并确保: 日志存储在 /var/log/kubernetes/audit-logs.txt 日志文件能保留 10 天 最多保留 2 个旧 ...
- 互动无极限:在线免费ChatGPT聊天工具-gpt4
在现代社会中,聊天交流已变得越来越普遍,并且不断发展成新的形式和类型.而如今,通过使用人工智能技术,我们可以更加便捷地进行自然的对话交流.那么,提供在线免费使用的ChatGPT聊天工具是否可以满足各种 ...
- 一文解开主流开源变更数据捕获技术之Flink CDC的入门使用
@ 目录 概述 定义 什么是CDC? CDC的分类 特性 应用场景 支持数据源 实战 Flink DataStream方式代码示例 FlinkSQL方式代码示例 概述 定义 flink-cdc-con ...
- FreeFileSync结合任务计划实现T级数据的全量备份和每日十几G数据的增量自动备份
1. 背景 公司现有nas存储中有共计1.8T左右的文件数据(一般是pdf.excel.图片.压缩文件等等格式),因为nas无法做备份:担心后面nas出现故障造成数据丢失,现急需一个解决方案实现如下目 ...
- 我坚定的认为,这个源码肯定是有 BUG 的!
你好呀,我是歪歪. 上周我不是发了<我试图给你分享一种自适应的负载均衡.>这篇文章嘛,里面一种叫做"自适应负载均衡"的负载均衡策略,核心思路就是从多个服务提供者中随机选 ...
- 用 Golang 从0到1实现一个高性能的 Worker Pool(一) - 每天5分钟玩转 GPT 编程系列(3)
目录 1. 概述 2. 设计 2.1 让 GPT-4 给出功能点 2.2 自己总结需求,再给 GPT 派活 3. 实现 3.1 你先随意发挥 3.2 你得让 Worker 跑起来呀 3.3 你说说 P ...
- 利用Abp过滤器实现业务数据“回收站”功能
@ 目录 原理 创建过滤器 使用过滤器 查询 删除 恢复 原理 回收站是当用户删除一条记录时,不是直接从数据库中删除,而是将其放入"回收站",以便用户可以在需要时恢复数据. 在Ab ...
- TFS 更换电脑名称后映射失效
TFS 更换电脑名称后映射失效 建议不要随便更改电脑名 环境 Visual Studio 2019 : Win10 操作步骤 查找 TFS 的相关配置文件.如果你知道你之前的电脑名字可以跳过这一步:如 ...
- Pycharm:显示每一行代码的修改记录
解决方案 安装插件GitToolBox
- 从module_init看内核模块
开篇 module_init是linux内核提供的一个宏, 可以用来在编写内核模块时注册一个初始化函数, 当模块被加载的时候, 内核负责执行这个初始化函数. 在编写设备驱动程序时, 使用这个宏看起来理 ...