1.用python进行精细中文分句（基于正则表达式）

中文分句，乍一看是一个挺简单的工作，一般我们只要找到一个【。！？】这类的典型断句符断开就可以了吗。
对于简单的文本这个做法是已经可行了（比如我看到这篇文章里有个简洁的实现方法

自然语言处理学习3：中文分句re.split()，jieba分词和词频统计FreqDist_zhuzuwei的博客-CSDN博客_jieba 分句

然而当我处理小说文本时，发现了这种思路的漏洞：

对于有双引号的句子，分句结果应该延后到双引号结束后，比如：

今天上午，我去“秘密基地”了。

省略号也是常见的句子分隔符，然而它超过了一个字符，用re.split()的方法就略有不便。

所以，这里我提供一个更加精细的解决方法，可以解决上面的问题：

# 版本为python3，如果为python2需要在字符串前面加上u

import re

def cut_sent(para):

    para = re.sub('([。！？\?])([^”’])', r"\1\n\2", para)  # 单字符断句符

    para = re.sub('(\.{6})([^”’])', r"\1\n\2", para)  # 英文省略号

    para = re.sub('(\…{2})([^”’])', r"\1\n\2", para)  # 中文省略号

    para = re.sub('([。！？\?][”’])([^，。！？\?])', r'\1\n\2', para)

    # 如果双引号前有终止符，那么双引号才是句子的终点，把分句符\n放到双引号后，注意前面的几句都小心保留了双引号

    para = para.rstrip()  # 段尾如果有多余的\n就去掉它

    # 很多规则中会考虑分号;，但是这里我把它忽略不计，破折号、英文双引号等同样忽略，需要的再做些简单调整即可。

    return para.split("\n")

检验效果

2. HarvestText：文本挖掘和预处理工具

HarvestText是一个专注无（弱）监督方法，能够整合领域知识（如类型，别名）对特定领域文本进行简单高效地处理和分析的库。适用于许多文本预处理和初步探索性分析任务，在小说分析，网络文本，专业文献等领域都有潜在应用价值。

处理数据时，除了分句可能还要先清洗特殊的数据格式，

如微博，HTML代码，URL，Email等，

某大佬！将一批常用的数据预处理和清洗操作都整合进了开发的HarvestText库

github（https://github.com/blmoistawinde/HarvestText）

码云：https://gitee.com/dingding962285595/HarvestText

使用文档：Welcome to HarvestText’s documentation! — HarvestText 0.8.1.7 documentation

2.1 文本清洗例子：

print("各种清洗文本")

ht0 = HarvestText()

# 默认的设置可用于清洗微博文本

text1 = "回复@钱旭明QXM:[嘻嘻][嘻嘻] //@钱旭明QXM:杨大哥[good][good]"

print("清洗微博【@和表情符等】")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1))

# URL的清理

text1 = "【#赵薇#：正筹备下一部电影 但不是青春片....http://t.cn/8FLopdQ"

print("清洗网址URL")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, remove_url=True))

# 清洗邮箱

text1 = "我的邮箱是abc@demo.com，欢迎联系"

print("清洗邮箱")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, email=True))

# 处理URL转义字符

text1 = "www.%E4%B8%AD%E6%96%87%20and%20space.com"

print("URL转正常字符")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, norm_url=True, remove_url=False))

text1 = "www.中文 and space.com"

print("正常字符转URL[含有中文和空格的request需要注意]")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, to_url=True, remove_url=False))

# 处理HTML转义字符

text1 = "&lt;a c&gt;&nbsp;''"

print("HTML转正常字符")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, norm_html=True))

# 繁体字转简体

text1 = "心碎誰買單"

print("繁体字转简体")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, t2s=True))

结果

各种清洗文本

清洗微博【@和表情符等】

原： 回复@钱旭明QXM:[嘻嘻][嘻嘻] //@钱旭明QXM:杨大哥[good][good]

清洗后： 杨大哥

清洗网址URL

原： 【#赵薇#：正筹备下一部电影 但不是青春片....http://t.cn/8FLopdQ

清洗后： 【#赵薇#：正筹备下一部电影 但不是青春片....

清洗邮箱

原： 我的邮箱是abc@demo.com，欢迎联系

清洗后： 我的邮箱是，欢迎联系

URL转正常字符

原： www.%E4%B8%AD%E6%96%87%20and%20space.com

清洗后： www.中文 and space.com

正常字符转URL[含有中文和空格的request需要注意]

原： www.中文 and space.com

清洗后： www.%E4%B8%AD%E6%96%87%20and%20space.com

HTML转正常字符

原： &lt;a c&gt;&nbsp;''

清洗后： <a c> ''

繁体字转简体

原： 心碎誰買單

清洗后： 心碎谁买单

用python进行精细中文分句（基于正则表达式），HarvestText：文本挖掘和预处理工具的更多相关文章

python爬虫实战获取豆瓣排名前250的电影信息--基于正则表达式
一.项目目标爬取豆瓣TOP250电影的评分.评价人数.短评等信息,并在其保存在txt文件中,html解析方式基于正则表达式二.确定页面内容爬虫地址:https://movie.douban.co ...
Python基于正则表达式实现文件内容替换的方法
Python基于正则表达式实现文件内容替换的方法本文实例讲述了Python基于正则表达式实现文件内容替换的方法.分享给大家供大家参考,具体如下: 最近因为有一个项目需要从普通的服务器移植到SAE,而 ...
转：python的nltk中文使用和学习资料汇总帮你入门提高
python的nltk中文使用和学习资料汇总帮你入门提高转:http://blog.csdn.net/huyoo/article/details/12188573 nltk的安装 nltk初步使用入 ...
python正则的中文处理
因工作需要,要查找中文汉字分词,因为python正则表达式\W+表示的是所有的中文字就连标点符号都包括.所以要想办法过滤掉. 参考博客:http://log.medcl.net/item/2011/0 ...
2019-02-18 扩展Python控制台实现中文反馈信息之二-正则替换
"中文编程"知乎专栏原文地址续前文扩展Python控制台实现中文反馈信息, 实现了如下效果: >>> 学 Traceback (most recent call ...
[转]python实现RESTful服务（基于flask）
python实现RESTful服务(基于flask) 原文: https://www.jianshu.com/p/6ac1cab17929 前言上一篇文章讲到如何用java实现RESTful服务, ...
Python爬虫教程-19-数据提取-正则表达式(re)
本篇主页内容:match的基本使用,search的基本使用,findall,finditer的基本使用,匹配中文,贪婪与非贪婪模式 Python爬虫教程-19-数据提取-正则表达式(re) 正则表达式 ...
python正则的中文处理(转)
匹配中文时,正则表达式规则和目标字串的编码格式必须相同 print sys.getdefaultencoding() text =u"#who#helloworld#a中文x#" ...
java匹配中文汉字的正则表达式
正则表达式匹配中文先要了解中文的编码代码如下复制代码 [u4E00-u9FA5]汉字?[uFE30-uFFA0]全角字符 [u4E00-u9FA5]汉字?[uFE30-uFFA0]全角字符匹配中 ...
Python中使用中文
python的中文问题一直是困扰新手的头疼问题,这篇文章将给你详细地讲解一下这方面的知识.当然,几乎可以确定的是,在将来的版本中,python会彻底解决此问题,不用我们这么麻烦了. 先来看看pytho ...

随机推荐

Hugging News #0203: 3.3 MB 的文生图模型、RHLF 训练框架、手机上能跑的 Transformer
每一周,我们的同事都会向社区的成员们发布一些关于 Hugging Face 相关的更新,包括我们的产品和平台更新.社区活动.学习资源和内容更新.开源库和模型更新等,我们将其称之为「Hugging Ne ...
POJ： 2236 Wireless Network 题解
POJ 2236 Wireless Network 加工并储存数据的数据结构并查集这是并查集的基本应用,两台修好的电脑若距离d内则加入合并.不过不小心的话会TLE,比如: #include < ...
Codeforces 670C （离散化入门题）
原题链接:https://codeforces.com/problemset/problem/670/C 题目大意: 有 n 个人,每人会且仅会一种语言. (n ≤ 2e5) 语言有各自的编号(≤ 1 ...
debian更新openssh 9.6
先更新一下,然后安装libssl-dev zlib1g-dev依赖文件 apt update apt install build-essential apt-get install -y libssl ...
上海丨阿里云 Serverless 技术实战营邀你来玩！
活动简介本次沙龙深度探讨 "Serverless 在中国企业的落地和开发者实操" 主题,我们特别邀请了来自阿里云一线技术专家,分享当前 Serverless 趋势和落地实践过程 ...
uni-app点赞效果
df -h与df -i的区别
一. df命令详解: linux中df命令的功能是用来检查linux服务器的文件系统的磁盘空间占用情况.可以利用该命令来获取硬盘被占用了多少空间,目前还剩下多少空间等信息 -a 全部文件系统列表 -h ...
GCC 指定运行期动态链接库搜索路径
链接器 ld 的 -rpath=dir 选项可以指定运行期 so 文件的搜索路径. GCC 的 -Wl,option 选项可以传递选项给链接器 ld. 所以组合起来,可以直接使用 -Wl,-rpath ...
shell 编程中 awk ，wc ，$0，$1 等命令的使用总结
本文为博主原创,转载请注明出处: 1. awk 的常用场景总结 2. wc 常用场景总结 3. $0,$1,$# 的使用总结 4. seq 的使用总结 5. 获取用户输入 read 使用 1. awk ...
spring启动流程 (6完结) springmvc启动流程
SpringMVC的启动入口在SpringServletContainerInitializer类,它是ServletContainerInitializer实现类(Servlet3.0新特性).在实 ...

用python进行精细中文分句（基于正则表达式），HarvestText：文本挖掘和预处理工具

1.用python进行精细中文分句（基于正则表达式）

2. HarvestText：文本挖掘和预处理工具

2.1 文本清洗例子：

用python进行精细中文分句（基于正则表达式），HarvestText：文本挖掘和预处理工具的更多相关文章

随机推荐

热门专题