Python中文语料批量预处理手记

手记实用系列文章：

语料预处理封装类：

#coding=utf-8

import os

import jieba

import sys

import re

import time

import jieba.posseg as pseg

sys.path.append("../")

jieba.load_userdict("../Database/userdict.txt") # 加载自定义分词词典

'''

title：利用结巴分词进行文本语料处理：单文本处理器、批量文件处理器

    1 首先对文本进行遍历查找

    2 创建原始文本的保存结构

    3 对原文本进行结巴分词和停用词处理

    4 对预处理结果进行标准化格式，并保存原文件结构路径

author：白宁超

myblog：http://www.cnblogs.com/baiboy/

'''

'''

分词.词性标注以及去停用词

stopwordspath： 停用词路径

dealpath：中文数据预处理文件的路径

savepath：中文数据预处理结果的保存路径

'''

def cutTxtWord(dealpath,savepath,stopwordspath):

    stopwords = {}.fromkeys([ line.rstrip() for line in open(stopwordspath,"r",encoding='utf-8')]) # 停用词表

    with open(dealpath,"r",encoding='utf-8') as f:

        txtlist=f.read() # 读取待处理的文本

    words =pseg.cut(txtlist) # 带词性标注的分词结果

    cutresult=""# 获取去除停用词后的分词结果

    for word, flag in words:

        if word not in stopwords:

            cutresult += word+"/"+flag+" " #去停用词

            getFlag(cutresult,savepath) #

'''

分词.词性标注以及去停用词

stopwordspath： 停用词路径

read_folder_path ：中文数据预处理文件的路径

write_folder_path ：中文数据预处理结果的保存路径

filescount=300 #设置文件夹下文件最多多少个

'''

def cutFileWord(read_folder_path,write_folder_path,stopwordspath):

    # 停用词表

    stopwords = {}.fromkeys([ line.rstrip() for line in open(stopwordspath,"r",encoding='utf-8')])

    # 获取待处理根目录下的所有类别

    folder_list = os.listdir(read_folder_path)

    # 类间循环

    for folder in folder_list:

        #某类下的路径

        new_folder_path = os.path.join(read_folder_path, folder)

        # 创建保存文件目录

        path=write_folder_path+folder #保存文件的子文件

        isExists=os.path.exists(path)

        if not isExists:

            os.makedirs(path)

            print(path+' 创建成功')

        else: pass

        save_folder_path = os.path.join(write_folder_path, folder)#某类下的保存路径

        print('--> 请稍等，正在处理中...')

        # 类内循环

        files = os.listdir(new_folder_path)

        j = 1

        for file in files:

            if j > len(files): break

            dealpath = os.path.join(new_folder_path, file) #处理单个文件的路径

            with open(dealpath,"r",encoding='utf-8') as f:

                txtlist=f.read()

                # python 过滤中文、英文标点特殊符号

                # txtlist1 = re.sub("[\s+\.\!\/_,$%^*(+\"\']+|[+——！，。？、~@#￥%……&*（）]+", "",txtlist)

            words =pseg.cut(txtlist) # 带词性标注的分词结果

            cutresult="" # 单个文本：分词后经停用词处理后的结果

            for word, flag in words:

                if word not in stopwords:

                    cutresult += word+"/"+flag+" " #去停用词

            savepath = os.path.join(save_folder_path,file)

            getFlag(cutresult,savepath)

            j += 1

'''

做词性筛选

cutresult：str类型，初切分的结果

savepath： 保存文件路径

'''

def getFlag(cutresult,savepath):

    txtlist=[] #过滤掉的词性后的结果

    #词列表为自己定义要过滤掉的词性

    cixing=["/x","/zg","/uj","/ul","/e","/d","/uz","/y"]

    for line in cutresult.split('\n'):

        line_list2=re.split('[ ]', line)

        line_list2.append("\n") # 保持原段落格式存在

        line_list=line_list2[:]

        for segs in line_list2:

            for K in cixing:

                if K in segs:

                    line_list.remove(segs)

                    break

                else:

                    pass

        txtlist.extend(line_list)

    # 去除词性标签

    resultlist=txtlist[:]

    flagresult=""

    for v in txtlist:

        if "/" in v:

            slope=v.index("/")

            letter=v[0:slope]+" "

            flagresult+= letter

        else:

            flagresult+= v

    standdata(flagresult,savepath)

'''

标准化处理，去除空行，空白字符等。

flagresult:筛选过的结果

'''

def standdata(flagresult,savepath):

    f2=open(savepath,"w",encoding='utf-8')

    for line in flagresult.split('\n'):

        if len(line)>=2:

            line_clean="/ ".join(line.split())

            lines=line_clean+" "+"\n"

            f2.write(lines)

        else: pass

    f2.close()

if __name__ == '__main__' :

    t1=time.time()

    # 测试单个文件

    dealpath="../Database/SogouC/FileTest/1.txt"

    savepath="../Database/SogouCCut/FileTest/1.txt"

    stopwordspath='../Database/stopwords/CH_stopWords.txt'

    stopwordspath1='../Database/stopwords/HG_stopWords.txt' # 哈工大停用词表

    # 批量处理文件夹下的文件

    # rfolder_path = '../Database/SogouC/Sample/'

    rfolder_path = '../Database/SogouC/FileNews/'

    # 分词处理后保存根路径

    wfolder_path = '../Database/SogouCCut/'

    # 中文语料预处理器

    # cutTxtWord(dealpath,savepath,stopwordspath) # 单文本预处理器

    cutFileWord(rfolder_path,wfolder_path,stopwordspath) # 多文本预处理器

    t2=time.time()

    print("中文语料语处理完成，耗时："+str(t2-t1)+"秒。") #反馈结果

执行结果：

Python中文语料批量预处理手记的更多相关文章

python中文语料分词处理，按字或者词cut_sentence
cut_sentence.py import string import jieba import jieba.posseg as psg import logging #关闭jieba日制 jieb ...
Python中结巴分词使用手记
手记实用系列文章: 1 结巴分词和自然语言处理HanLP处理手记 2 Python中文语料批量预处理手记 3 自然语言处理手记 4 Python中调用自然语言处理工具HanLP手记 5 Python中 ...
基于CBOW网络手动实现面向中文语料的word2vec
最近在工作之余学习NLP相关的知识,对word2vec的原理进行了研究.在本篇文章中,尝试使用TensorFlow自行构建.训练出一个word2vec模型,以强化学习效果,加深理解. 一.背景知识: ...
wiki中文语料的word2vec模型构建
一.利用wiki中文语料进行word2vec模型构建 1)数据获取到wiki官网下载中文语料,下载完成后会得到命名为zhwiki-latest-pages-articles.xml.bz2的文件,里 ...
python调用hanlp分词包手记
python调用hanlp分词包手记 Hanlp作为一款重要的分词工具,本月初的时候看到大快搜索发布了hanlp的1.7版本,新增了文本聚类.流水线分词等功能.关于hanlp1.7版本的新功能,后 ...
word2vec词向量处理中文语料
word2vec介绍 word2vec官网:https://code.google.com/p/word2vec/ word2vec是google的一个开源工具,能够根据输入的词的集合计算出词与词之间 ...
利用RNN进行中文文本分类（数据集是复旦中文语料）
利用TfidfVectorizer进行中文文本分类(数据集是复旦中文语料) 1.训练词向量数据预处理参考利用TfidfVectorizer进行中文文本分类(数据集是复旦中文语料) ,现在我们有了分词 ...
基于tensorflow的文本分类总结（数据集是复旦中文语料）
代码已上传到github:https://github.com/taishan1994/tensorflow-text-classification 往期精彩: 利用TfidfVectorizer进行 ...
【原】python中文文本挖掘资料集合
这些网址是我在学习python中文文本挖掘时觉得比较好的网站,记录一下,后期也会不定期添加: 1.http://www.52nlp.cn/python-%E7%BD%91%E9%A1%B5%E7% ...

随机推荐

将eclipse的maven项目导入到intellij idea中
最近项目中需要用到idea,需要将原来的eclipse项目进行转移.捣鼓了半天终于成功了,在这里和大家分享下,希望对大家有所帮助,如有错误,欢迎指正. idea的确是一款很智能的开发工具,真的是爱不释 ...
java web项目为什么我们要放弃jsp？
前戏: 以前的项目大多数都是java程序猿又当爹又当妈,又搞前端(ajax/jquery/js/html/css等等),又搞后端(java/mysql/Oracle等等). 随着时代的发展,渐渐的许多 ...
python 全栈开发，Day119(Flask初识,Render Redirect HttpResponse,request,模板语言 Jinja2,用户登录例子,内置Session)
一.Flask初识首先,要看你学没学过Django 如果学过Django 的同学,请从头看到尾,如果没有学过Django的同学,并且不想学习Django的同学,轻饶过第一部分三大主流Web框架对比 ...
（第7篇）灵活易用易维护的hadoop数据仓库工具——Hive
摘要: Hive灵活易用且易于维护,十分适合数据仓库的统计分析,什么样的结构让它具备这些特性?我们如何才能灵活操作hive呢? 博主福利给大家推荐一套hadoop视频课程 [百度hadoop核心架构 ...
asp.net core服务的生命周期
Transient:每一次GetService都会创建一个新的实例 Scoped:在同一个Scope内只初始化一个实例 ,可以理解为( 每一个request级别只创建一个实例,同一个http requ ...
AndrodStudio报错： Cannot launch AVD in emulator.
Cannot launch AVD in emulator.Output:Hax is enabledHax ram_size 0x60000000HAX is working and emulato ...
CI入门
CI入门一.[查]按条件获取一条记录获取数据有返回数组形式或对象形式,row_array().result_array()是以数组形式返回:row().result()是以对象形式返回.同样的,更 ...
linux下php命令无法使用如何解决
本文主要和大家分享linux下php命令无法使用如何解决,测试是否添加php环境变量方法: 如下:输入php -v 显示 php 命令没有找到 [root@iz8vbhc4d7zoazstpw7gw8 ...
自适应阈值二值化之最大类间方差法(大津法，OTSU)
最大类间方差法是由日本学者大津(Nobuyuki Otsu)于1979年提出的,是一种自适应的阈值确定的方法,又叫大津法,简称OTSU.它是按图像的灰度特性,将图像分成背景和目标2部分.背景和目标之间 ...
hdu3047 Zjnu Stadium【带权并查集】
<题目链接> <转载于 >>> > 题目大意: 有n个人坐在zjnu体育馆里面,然后给出m个他们之间的距离, A B X, 代表B的座位比A多X. 然后求出这 ...

Python中文语料批量预处理手记

手记实用系列文章：

语料预处理封装类：

执行结果：

Python中文语料批量预处理手记的更多相关文章

随机推荐

热门专题