1.用python进行精细中文分句（基于正则表达式）

中文分句，乍一看是一个挺简单的工作，一般我们只要找到一个【。！？】这类的典型断句符断开就可以了吗。
对于简单的文本这个做法是已经可行了（比如我看到这篇文章里有个简洁的实现方法

自然语言处理学习3：中文分句re.split()，jieba分词和词频统计FreqDist_zhuzuwei的博客-CSDN博客_jieba 分句

然而当我处理小说文本时，发现了这种思路的漏洞：

对于有双引号的句子，分句结果应该延后到双引号结束后，比如：

今天上午，我去“秘密基地”了。

省略号也是常见的句子分隔符，然而它超过了一个字符，用re.split()的方法就略有不便。

所以，这里我提供一个更加精细的解决方法，可以解决上面的问题：

# 版本为python3，如果为python2需要在字符串前面加上u

import re

def cut_sent(para):

    para = re.sub('([。！？\?])([^”’])', r"\1\n\2", para)  # 单字符断句符

    para = re.sub('(\.{6})([^”’])', r"\1\n\2", para)  # 英文省略号

    para = re.sub('(\…{2})([^”’])', r"\1\n\2", para)  # 中文省略号

    para = re.sub('([。！？\?][”’])([^，。！？\?])', r'\1\n\2', para)

    # 如果双引号前有终止符，那么双引号才是句子的终点，把分句符\n放到双引号后，注意前面的几句都小心保留了双引号

    para = para.rstrip()  # 段尾如果有多余的\n就去掉它

    # 很多规则中会考虑分号;，但是这里我把它忽略不计，破折号、英文双引号等同样忽略，需要的再做些简单调整即可。

    return para.split("\n")

检验效果

2. HarvestText：文本挖掘和预处理工具

HarvestText是一个专注无（弱）监督方法，能够整合领域知识（如类型，别名）对特定领域文本进行简单高效地处理和分析的库。适用于许多文本预处理和初步探索性分析任务，在小说分析，网络文本，专业文献等领域都有潜在应用价值。

处理数据时，除了分句可能还要先清洗特殊的数据格式，

如微博，HTML代码，URL，Email等，

某大佬！将一批常用的数据预处理和清洗操作都整合进了开发的HarvestText库

github（https://github.com/blmoistawinde/HarvestText）

码云：https://gitee.com/dingding962285595/HarvestText

使用文档：Welcome to HarvestText’s documentation! — HarvestText 0.8.1.7 documentation

2.1 文本清洗例子：

print("各种清洗文本")

ht0 = HarvestText()

# 默认的设置可用于清洗微博文本

text1 = "回复@钱旭明QXM:[嘻嘻][嘻嘻] //@钱旭明QXM:杨大哥[good][good]"

print("清洗微博【@和表情符等】")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1))

# URL的清理

text1 = "【#赵薇#：正筹备下一部电影 但不是青春片....http://t.cn/8FLopdQ"

print("清洗网址URL")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, remove_url=True))

# 清洗邮箱

text1 = "我的邮箱是abc@demo.com，欢迎联系"

print("清洗邮箱")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, email=True))

# 处理URL转义字符

text1 = "www.%E4%B8%AD%E6%96%87%20and%20space.com"

print("URL转正常字符")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, norm_url=True, remove_url=False))

text1 = "www.中文 and space.com"

print("正常字符转URL[含有中文和空格的request需要注意]")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, to_url=True, remove_url=False))

# 处理HTML转义字符

text1 = "&lt;a c&gt;&nbsp;''"

print("HTML转正常字符")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, norm_html=True))

# 繁体字转简体

text1 = "心碎誰買單"

print("繁体字转简体")

print("原：", text1)

print("清洗后：", ht0.clean_text(text1, t2s=True))

结果

各种清洗文本

清洗微博【@和表情符等】

原： 回复@钱旭明QXM:[嘻嘻][嘻嘻] //@钱旭明QXM:杨大哥[good][good]

清洗后： 杨大哥

清洗网址URL

原： 【#赵薇#：正筹备下一部电影 但不是青春片....http://t.cn/8FLopdQ

清洗后： 【#赵薇#：正筹备下一部电影 但不是青春片....

清洗邮箱

原： 我的邮箱是abc@demo.com，欢迎联系

清洗后： 我的邮箱是，欢迎联系

URL转正常字符

原： www.%E4%B8%AD%E6%96%87%20and%20space.com

清洗后： www.中文 and space.com

正常字符转URL[含有中文和空格的request需要注意]

原： www.中文 and space.com

清洗后： www.%E4%B8%AD%E6%96%87%20and%20space.com

HTML转正常字符

原： &lt;a c&gt;&nbsp;''

清洗后： <a c> ''

繁体字转简体

原： 心碎誰買單

清洗后： 心碎谁买单

用python进行精细中文分句（基于正则表达式），HarvestText：文本挖掘和预处理工具的更多相关文章

python爬虫实战获取豆瓣排名前250的电影信息--基于正则表达式
一.项目目标爬取豆瓣TOP250电影的评分.评价人数.短评等信息,并在其保存在txt文件中,html解析方式基于正则表达式二.确定页面内容爬虫地址:https://movie.douban.co ...
Python基于正则表达式实现文件内容替换的方法
Python基于正则表达式实现文件内容替换的方法本文实例讲述了Python基于正则表达式实现文件内容替换的方法.分享给大家供大家参考,具体如下: 最近因为有一个项目需要从普通的服务器移植到SAE,而 ...
转：python的nltk中文使用和学习资料汇总帮你入门提高
python的nltk中文使用和学习资料汇总帮你入门提高转:http://blog.csdn.net/huyoo/article/details/12188573 nltk的安装 nltk初步使用入 ...
python正则的中文处理
因工作需要,要查找中文汉字分词,因为python正则表达式\W+表示的是所有的中文字就连标点符号都包括.所以要想办法过滤掉. 参考博客:http://log.medcl.net/item/2011/0 ...
2019-02-18 扩展Python控制台实现中文反馈信息之二-正则替换
"中文编程"知乎专栏原文地址续前文扩展Python控制台实现中文反馈信息, 实现了如下效果: >>> 学 Traceback (most recent call ...
[转]python实现RESTful服务（基于flask）
python实现RESTful服务(基于flask) 原文: https://www.jianshu.com/p/6ac1cab17929 前言上一篇文章讲到如何用java实现RESTful服务, ...
Python爬虫教程-19-数据提取-正则表达式(re)
本篇主页内容:match的基本使用,search的基本使用,findall,finditer的基本使用,匹配中文,贪婪与非贪婪模式 Python爬虫教程-19-数据提取-正则表达式(re) 正则表达式 ...
python正则的中文处理(转)
匹配中文时,正则表达式规则和目标字串的编码格式必须相同 print sys.getdefaultencoding() text =u"#who#helloworld#a中文x#" ...
java匹配中文汉字的正则表达式
正则表达式匹配中文先要了解中文的编码代码如下复制代码 [u4E00-u9FA5]汉字?[uFE30-uFFA0]全角字符 [u4E00-u9FA5]汉字?[uFE30-uFFA0]全角字符匹配中 ...
Python中使用中文
python的中文问题一直是困扰新手的头疼问题,这篇文章将给你详细地讲解一下这方面的知识.当然,几乎可以确定的是,在将来的版本中,python会彻底解决此问题,不用我们这么麻烦了. 先来看看pytho ...

随机推荐

python虚拟环境venv
Python3虚拟环境是为了在开发过程中隔离项目所需的 Python 环境.虚拟环境允许我们在同一台计算机上的不同项目中使用不同的 Python 版本和软件包,而不会相互干扰首先创建一个虚拟环境的工 ...
Codeforces Round #734 (Div. 3) A~D1 个人题解
比赛链接:Here 1551A. Polycarp and Coins (签到) 题意: 我们有任意个面额为 \(1\) 和 \(2\) 的硬币去支付 \(n\) 元账单, 现在请问怎么去分配数额使得 ...
OpenSCA技术原理之npm依赖解析
本文主要介绍基于npm包管理器的组件成分解析原理. npm 介绍 npm(全称Node Package Manager)是Node.js的预设软件包管理器. npm的依赖管理文件是package.js ...
SAE 2.0，让容器化应用开发更简单
云原生容器化应用托管模式的演变云原生这个概念从提出,到壮大,再到今天的极大普及,始终处于一个不断演进和革新的过程中.云原生体系下应用的托管形态是随着企业应用架构在不断演进的.最早的应用大多是集中式. ...
java实现mysqlplus查询一个月之间的数据
先说需求使用mysqlplus查询一个月之内的数据,传入的参数是202108 要求就查8月份这个月的所有数据,oracle数据中数据记录的时间类型是Date类型 public static void ...
一、docker入门（概念）
系列导航一.docker入门(概念) 二.docker的安装和镜像管理三.docker容器的常用命令四.容器的网络访问五.容器端口转发六.docker数据卷七.手动制作docker镜像八 ...
vue学习笔记二、环境搭建+项目创建
系列导航 vue学习笔记一.环境搭建 vue学习笔记二.环境搭建+项目创建 vue学习笔记三.文件和目录结构 vue学习笔记四.定义组件(组件基本结构) vue学习笔记五.创建子组件实例 v ...
vmware超融合基础安装与配置
目录 vmware超融合安装配置ESXI 安装VMware vCenter Server 安装vCenter插件安装vCenter 使用VMware Vsphere Client登录Vcenter ...
昆虫科学院 AtCoder Race Ranking 2023 Autumn
概况为提高选手们的训练 / 比赛热情,我们(昆虫科学院)通过商讨,在 \(2023-5-25\) 仿照 AtCoder Race Ranking (WTF) 机制,设立了"昆虫科学院 At ...
为什么 sort() 中的 return a-b 可以决定升序
arr.sort( function(a,b){ return a-b; } ) 千万不要理解成 a 减 b 其实它代表的是26个字母中的 a 和 b b 比 a 大,所以 a - b 就是升序,写成 ...

用python进行精细中文分句（基于正则表达式），HarvestText：文本挖掘和预处理工具

1.用python进行精细中文分句（基于正则表达式）

2. HarvestText：文本挖掘和预处理工具

2.1 文本清洗例子：

用python进行精细中文分句（基于正则表达式），HarvestText：文本挖掘和预处理工具的更多相关文章

随机推荐

热门专题