(转)两种高效过滤敏感词算法--DFA算法和AC自动机算法

原文：https://blog.csdn.net/u013421629/article/details/83178970

一道bat面试题：快速替换10亿条标题中的5万个敏感词，有哪些解决思路？
有十亿个标题，存在一个文件中，一行一个标题。有5万个敏感词，存在另一个文件。写一个程序过滤掉所有标题中的所有敏感词，保存到另一个文件中。

1、DFA过滤敏感词算法

在实现文字过滤的算法中，DFA是比较好的实现算法。DFA即Deterministic Finite Automaton，也就是确定有穷自动机。
算法核心是建立了以敏感词为基础的许多敏感词树。

python 实现DFA算法：

# -*- coding:utf-8 -*-

import time

time1=time.time()

# DFA算法

class DFAFilter():

    def __init__(self):

        self.keyword_chains = {}

        self.delimit = '\x00'

    def add(self, keyword):

        keyword = keyword.lower()

        chars = keyword.strip()

        if not chars:

            return

        level = self.keyword_chains

        for i in range(len(chars)):

            if chars[i] in level:

                level = level[chars[i]]

            else:

                if not isinstance(level, dict):

                    break

                for j in range(i, len(chars)):

                    level[chars[j]] = {}

                    last_level, last_char = level, chars[j]

                    level = level[chars[j]]

                last_level[last_char] = {self.delimit: 0}

                break

        if i == len(chars) - 1:

            level[self.delimit] = 0

    def parse(self, path):

        with open(path,encoding='utf-8') as f:

            for keyword in f:

                self.add(str(keyword).strip())

    def filter(self, message, repl="*"):

        message = message.lower()

        ret = []

        start = 0

        while start < len(message):

            level = self.keyword_chains

            step_ins = 0

            for char in message[start:]:

                if char in level:

                    step_ins += 1

                    if self.delimit not in level[char]:

                        level = level[char]

                    else:

                        ret.append(repl * step_ins)

                        start += step_ins - 1

                        break

                else:

                    ret.append(message[start])

                    break

            else:

                ret.append(message[start])

            start += 1

        return ''.join(ret)

if __name__ == "__main__":

    gfw = DFAFilter()

    path="F:/文本反垃圾算法/sensitive_words.txt"

    gfw.parse(path)

    text="新疆骚乱苹果新品发布会雞八"

    result = gfw.filter(text)

    print(text)

    print(result)

    time2 = time.time()

    print('总共耗时：' + str(time2 - time1) + 's')

运行效果：

E:\laidefa\python.exe "E:/Program Files/pycharmproject/敏感词过滤算法/敏感词过滤算法DFA.py"

新疆骚乱苹果新品发布会雞八

****苹果新品发布会**

总共耗时：0.0010344982147216797s

Process finished with exit code 0

2、AC自动机过滤敏感词算法

AC自动机：一个常见的例子就是给出n个单词，再给出一段包含m个字符的文章，让你找出有多少个单词在文章里出现过。
简单地讲，AC自动机就是字典树+kmp算法+失配指针

# -*- coding:utf-8 -*-

import time

time1=time.time()

# AC自动机算法

class node(object):

    def __init__(self):

        self.next = {}

        self.fail = None

        self.isWord = False

        self.word = ""

class ac_automation(object):

    def __init__(self):

        self.root = node()

    # 添加敏感词函数

    def addword(self, word):

        temp_root = self.root

        for char in word:

            if char not in temp_root.next:

                temp_root.next[char] = node()

            temp_root = temp_root.next[char]

        temp_root.isWord = True

        temp_root.word = word

    # 失败指针函数

    def make_fail(self):

        temp_que = []

        temp_que.append(self.root)

        while len(temp_que) != 0:

            temp = temp_que.pop(0)

            p = None

            for key,value in temp.next.item():

                if temp == self.root:

                    temp.next[key].fail = self.root

                else:

                    p = temp.fail

                    while p is not None:

                        if key in p.next:

                            temp.next[key].fail = p.fail

                            break

                        p = p.fail

                    if p is None:

                        temp.next[key].fail = self.root

                temp_que.append(temp.next[key])

    # 查找敏感词函数

    def search(self, content):

        p = self.root

        result = []

        currentposition = 0

        while currentposition < len(content):

            word = content[currentposition]

            while word in p.next == False and p != self.root:

                p = p.fail

            if word in p.next:

                p = p.next[word]

            else:

                p = self.root

            if p.isWord:

                result.append(p.word)

                p = self.root

            currentposition += 1

        return result

    # 加载敏感词库函数

    def parse(self, path):

        with open(path,encoding='utf-8') as f:

            for keyword in f:

                self.addword(str(keyword).strip())

    # 敏感词替换函数

    def words_replace(self, text):

        """

        :param ah: AC自动机

        :param text: 文本

        :return: 过滤敏感词之后的文本

        """

        result = list(set(self.search(text)))

        for x in result:

            m = text.replace(x, '*' * len(x))

            text = m

        return text

if __name__ == '__main__':

    ah = ac_automation()

    path='F:/文本反垃圾算法/sensitive_words.txt'

    ah.parse(path)

    text1="新疆骚乱苹果新品发布会雞八"

    text2=ah.words_replace(text1)

    print(text1)

    print(text2)

    time2 = time.time()

    print('总共耗时：' + str(time2 - time1) + 's')

E:\laidefa\python.exe "E:/Program Files/pycharmproject/敏感词过滤算法/AC自动机过滤敏感词算法.py"

新疆骚乱苹果新品发布会雞八

****苹果新品发布会**

总共耗时：0.0010304450988769531s

Process finished with exit code 0

3、java 实现参考链接：
https://www.cnblogs.com/AlanLee/p/5329555.html

4、敏感词生成

# -*- coding:utf-8 -*-

path = 'F:/文本反垃圾算法/sensitive_worlds7.txt'

from 敏感词过滤算法.langconv import *

import pandas as pd

import pypinyin

# 文本转拼音

def pinyin(text):

    """

    :param text: 文本

    :return: 文本转拼音

    """

    gap = ' '

    piny = gap.join(pypinyin.lazy_pinyin(text))

    return piny

# 繁体转简体

def tradition2simple(text):

    """

    :param text: 要过滤的文本

    :return: 繁体转简体函数

    """

    line = Converter('zh-hans').convert(text)

    return line

data=pd.read_csv(path,sep='\t')

chinise_lable=[]

chinise_type=data['type']

for i in data['lable']:

    line=tradition2simple(i)

    chinise_lable.append(line)

chg_data=pd.DataFrame({'lable':chinise_lable,'type':chinise_type})

eng_lable=[]

eng_type=data['type']

for i in data['lable']:

    # print(i)

    piny=pinyin(i)

    # print(piny)

    eng_lable.append(piny)

eng_data=pd.DataFrame({'lable':eng_lable,'type':eng_type})

# print(eng_data)

# 合并

result=chg_data.append(eng_data,ignore_index=True)

# 数据框去重

res = result.drop_duplicates()

print(res)

# 输出

res.to_csv('F:/文本反垃圾算法/中英混合的敏感词10.txt',header=True,index=False,sep='\t',encoding='utf-8')

(转)两种高效过滤敏感词算法--DFA算法和AC自动机算法的更多相关文章

聚类算法K-Means算法和Mean Shift算法介绍及实现
Question:什么是聚类算法 1.聚类算法是一种非监督学习算法 2.聚类是在没有给定划分类别的情况下,根据数据相似度进行样本分组的一种方法 3.理论上,相同的组的数据之间有相同的属性或者是特征,不 ...
高效Java敏感词、关键词过滤工具包_过滤非法词句
敏感词.文字过滤是一个网站必不可少的功能,如何设计一个好的.高效的过滤算法是非常有必要的.前段时间我一个朋友(马上毕业,接触编程不久)要我帮他看一个文字过滤的东西,它说检索效率非常慢.我把它程序拿过来 ...
【SpringBoot】前缀树 Trie 过滤敏感词
1.过滤敏感词 Spring Boot实践,开发社区核心功能完成过滤敏感词 Trie 名称:Trie也叫做字典树.前缀树(Prefix Tree).单词查找树特点:查找效率高,消耗内存大应用:字 ...
web前端js过滤敏感词
web前端js过滤敏感词这里是用文本输入框还有文本域绑定了失去焦点事件,然后再遍历敏感词数组进行匹配和替换. var keywords=["阿扁","呵呵", ...
两种高效的事件处理模式(Proactor和Reactor)
典型的多线程服务器的线程模型 1. 每个请求创建一个线程,使用阻塞式 I/O 操作这是最简单的线程模型,1个线程处理1个连接的全部生命周期.该模型的优点在于:这个模型足够简单,它可以实现复杂的业务场 ...
SpringBoot开发十四-过滤敏感词
项目需求-过滤敏感词利用 Tire 树实现过滤敏感词定义前缀树,根据敏感词初始化前缀树,编写过滤敏感词的方法代码实现我们首先把敏感词存到一个文件 sensitive.txt: 赌博嫖娼吸毒 ...
过滤敏感词工具类SensitiveFilter
网上过滤敏感词工具类有的存在挺多bug,这是我自己改用的过滤敏感词工具类,目前来说没啥bug,如果有bug欢迎在评论指出使用前缀树 Trie 实现的过滤敏感词,树节点用静态内部类表示了,都写在一个 ...
AC自动机-算法详解
What's Aho-Corasick automaton? 一种多模式串匹配算法,该算法在1975年产生于贝尔实验室,是著名的多模式匹配算法之一. 简单的说,KMP用来在一篇文章中匹配一个模式串:但 ...
AC自动机算法详解
首先简要介绍一下AC自动机:Aho-Corasick automation,该算法在1975年产生于贝尔实验室,是著名的多模匹配算法之一.一个常见的例子就是给出n个单词,再给出一段包含m个字符的文章, ...

随机推荐

Ubuntu18.04下搭建LNMP教程-超详细图文（Nginx+MySQL+PHP含各种解决报错问题）
笔者最近在VM15.0上安装了Ubuntu18.,先来安装一个LNMP(Nginx+MySQL+PHP)网站服务器架构,为后续的实验做准备~ LNMP是指一组通常一起使用来运行动态网站或者服务 ...
《Windows内核安全与驱动开发》 5.1&5.2 内核与应用方面的编程
<Windows内核安全与驱动开发>阅读笔记 -- 索引目录 <Windows内核安全与驱动开发> 5.1&5.2 内核与应用方面的编程一.生成控制设备如果一个驱 ...
【CKB.DEV 茶话会】如何在 CKB 上实现用户自定义 Token
本贴内容主要来自于 CKB.DEV 茶话会第一期,本期主题是:如何在 CKB 上实现 UDT,分享人是:Cipher 王博. 茶话会现场视频: https://v.qq.com/x/page/x303 ...
全栈项目|小书架|微信小程序-实现搜索功能
效果图上图是小程序端实现的搜索功能效果图. 从图中可以看出点击首页搜索按钮即可进入搜索页面. 布局样式是:搜索框 + 热搜内容 + 搜索列表. 搜索框使用 lin-ui 中的 Searchbar组件 ...
从自动化到智能化，网易杭研的AIOps探索与实践
在大数据时代下,我们借助机器学习.数据仓库.大数据平台等大数据技术手段,将运维产生的数据进行分析.处理,得出最佳运维策略,以期实现对故障的事先干预,将风险降低到最低,从而降低运维成本,提升运维效率,最 ...
shell 文本单词计数
words.txt中的内容如下: the day is sunny the the the sunny is is 统计每个单词出现的次数,并降序输出. Unix Pipes脚本如下: cat wor ...
BZOJ 1191: [HNOI2006]超级英雄Hero（二分图匹配）
1191: [HNOI2006]超级英雄Hero Time Limit: 10 Sec Memory Limit: 162 MBSubmit: 6263 Solved: 2799[Submit][ ...
Orleans在.net core的开发
Goods 服务启动 using System; using System.Collections.Generic; using System.Linq; using System.Net; usi ...
JS页面跳转加密解密URL参数
页面跳转加密参数 window.location.href="foot.html?"+btoa(encodeURIComponent("goodid="+goo ...
探究UE4网络系列(二)、UE4网络核心类分析
转载请标明出处:http://www.cnblogs.com/zblade/ 一.概要前面分析了网络核心的基础类Socket/BSDSocket/SocketSubsystem/SocketSubs ...

(转)两种高效过滤敏感词算法--DFA算法和AC自动机算法

(转)两种高效过滤敏感词算法--DFA算法和AC自动机算法的更多相关文章

随机推荐

热门专题