wiki中文语料+word2vec (python3.5 windows win7)

环境： win7+python3.5

1. 下载wiki中文分词语料 使用迅雷下载会快不少，大小为1个多G

https://dumps.wikimedia.org/zhwiki/latest/zhwiki-latest-pages-articles.xml.bz2

2. 安装opencc用于中文的简繁替换

安装exe的版本

到https://bintray.com/package/files/byvoid/opencc/OpenCC 中下载

opencc-1.0.1-win64.7z

并解压放置到自定义的目录下

也可安装 python版本的：

pip install opencc-python

安装时会报错：

报错一： ImportError: No module named distribute_setup

解决方法，到 http://www.minitw.com/download/distribute_setup.zip 下载ZIP，解压后将.py文件放置到电脑的分盘:\你安裝Python的目录\Lib(例如：C:\Python35\Lib)

报错二：chown() missing 1 required positional argument: 'numeric_owner'

到distribute_setup.py中，找到self.chown(tarinfo, dirpath)，改为chown(tarinfo, dirpath, '');

报错三： import opencc时，报错 no module named 'version'

将opencc的__init__.py 中的from version import __version__改为from .version import __version__

3. 将wiki的资料转为文本txt

python process_wiki.py zhwiki-latest-pages-articles.xml.bz2 wiki.zh.text

解压后得到925M的文件，由于wiki中的东西是会定期更新的，所以不同时间下载得到的大小不一样

process_wiki.py 源码如下：

注：网上的版本大多是针对python2的，使用python3进行解压会在output.write(space.join(text) + "\n")这一句出现提示关于byte或str的错误，所以需要有如下修改：

space = b' '#原来是space = ' '
...

for text in wiki.get_texts():
    s=space.join(text)
    s=s.decode('utf8') + "\n"
output.write(s)

#!/usr/bin/env python
# -*- coding: utf-8 -*-
# 修改后的代码如下：
import logging
import os.path
import sys
from gensim.corpora importWikiCorpus
if __name__ =='__main__':
program = os.path.basename(sys.argv[0])
logger = logging.getLogger(program)
logging.basicConfig(format='%(asctime)s: %(levelname)s: %(message)s')
logging.root.setLevel(level=logging.INFO)
logger.info("running %s"%' '.join(sys.argv))
# check and process input arguments
if len(sys.argv)<3:
print(globals()['__doc__']% locals())
sys.exit(1)
inp, outp = sys.argv[1:3]
space = b' '
i =0
output = open(outp,'w',encoding='utf-8')
wiki =WikiCorpus(inp, lemmatize=False, dictionary={})
for text in wiki.get_texts():
s=space.join(text)
s=s.decode('utf8')+"\n"
output.write(s)
i = i +1
if(i %10000==0):
logger.info("Saved "+ str(i)+" articles")
output.close()
logger.info("Finished Saved "+ str(i)+" articles")

4. 繁简转化

进入解压后的opencc的目录，打开dos窗口，输入

opencc -i wiki.zh.text -o wiki.zh.jian.text -c t2s.json

则会得到wiki.zh.jian.text，里面是简体的中文

此时，大家会比较好奇，里边装着的到底是什么东西~

由于解压后的txt有900多M大，用txt打开比较困难，所以我们采用python自带的IO进行读取

import codecs,sys
import opencc
f=codecs.open('zh.wiki.txt','r',encoding="utf8")
line=f.readline()
print(line)

打印的结果如下，可以看出文档中包含多干行文字，每一行文字为一篇文章，每一个空格表示此处原为一个标点符号

简体的打印结果如下：

5. 分词

由第四步得到语料仅由标点隔开，还需将其分割成词

此处使用结巴分词 pip install jieba 即可安装

结巴的具体介绍见：https://github.com/fxsjy/jieba

结巴分词参考了https://codesky.me/archives/ubuntu-python-jieba-word2vec-wiki-tutol.wind 中的做法

由于编码的原因，此处使用了codecs

import jieba
import jieba.analyse
import jieba.posseg as pseg
import codecs,sys
def cut_words(sentence):
#print sentence
return" ".join(jieba.cut(sentence)).encode('utf-8')
f=codecs.open('zh.jian.wiki.txt','r',encoding="utf8")
target = codecs.open("zh.jian.wiki.seg.txt",'w',encoding="utf8")
print('open files')
line_num=1
line = f.readline()
while line:
print('---- processing ', line_num,' article----------------')
line_seg =" ".join(jieba.cut(line))
target.writelines(line_seg)
line_num = line_num +1
line = f.readline()
f.close()
target.close()
exit()
while line:
curr =[]
for oneline in line:
#print(oneline)
curr.append(oneline)
after_cut = map(cut_words, curr)
target.writelines(after_cut)
print('saved ',line_num,' articles')
exit()
line = f.readline1()
f.close()
target.close()

分词后的文档长这个样子：

6. 训练word2vec模型

python train_word2vec_model.py zh.jian.wiki.seg.txt wiki.zh.text.model wiki.zh.text.vector

train_word2vec_model.py源码如下：

import logging
import os.path
import sys
import multiprocessing
from gensim.corpora importWikiCorpus
from gensim.models importWord2Vec
from gensim.models.word2vec importLineSentence
if __name__ =='__main__':
program = os.path.basename(sys.argv[0])
logger = logging.getLogger(program)
logging.basicConfig(format='%(asctime)s: %(levelname)s: %(message)s')
logging.root.setLevel(level=logging.INFO)
logger.info("running %s"%' '.join(sys.argv))
# check and process input arguments
if len(sys.argv)<4:
print(globals()['__doc__']% locals())
sys.exit(1)
inp, outp1, outp2 = sys.argv[1:4]
model =Word2Vec(LineSentence(inp), size=400, window=5, min_count=5, workers=multiprocessing.cpu_count())
model.save(outp1)
model.save_word2vec_format(outp2, binary=False)

训练时长，看个人的机子配置，我训了一天。。。（吐槽一下换不了的破机子）

最终得到

7. 测试训练好的模型

结果如下：

但是呀，这个语句改成这样：

得到的结果却是：

难道这个模型宫斗剧看多了，发现皇上和太后是一家人，低阶的后宫女人是一团，只有皇后是个另类？

剩下的，各位自己去调戏吧，应该乐趣不少~

来自为知笔记(Wiz)

wiki中文语料+word2vec (python3.5 windows win7)的更多相关文章

wiki中文语料的word2vec模型构建
一.利用wiki中文语料进行word2vec模型构建 1)数据获取到wiki官网下载中文语料,下载完成后会得到命名为zhwiki-latest-pages-articles.xml.bz2的文件,里 ...
word2vec词向量处理中文语料
word2vec介绍 word2vec官网:https://code.google.com/p/word2vec/ word2vec是google的一个开源工具,能够根据输入的词的集合计算出词与词之间 ...
基于CBOW网络手动实现面向中文语料的word2vec
最近在工作之余学习NLP相关的知识,对word2vec的原理进行了研究.在本篇文章中,尝试使用TensorFlow自行构建.训练出一个word2vec模型,以强化学习效果,加深理解. 一.背景知识: ...
利用RNN进行中文文本分类（数据集是复旦中文语料）
利用TfidfVectorizer进行中文文本分类(数据集是复旦中文语料) 1.训练词向量数据预处理参考利用TfidfVectorizer进行中文文本分类(数据集是复旦中文语料) ,现在我们有了分词 ...
基于tensorflow的文本分类总结（数据集是复旦中文语料）
代码已上传到github:https://github.com/taishan1994/tensorflow-text-classification 往期精彩: 利用TfidfVectorizer进行 ...
利用CNN进行中文文本分类（数据集是复旦中文语料）
利用TfidfVectorizer进行中文文本分类(数据集是复旦中文语料) 利用RNN进行中文文本分类(数据集是复旦中文语料) 上一节我们利用了RNN(GRU)对中文文本进行了分类,本节我们将继续使用 ...
python3 在 windows 读取路径多了一个\u202a 是咋回
python3 在 windows 读取路径多了一个\u202a 是咋回事
Python中文语料批量预处理手记
手记实用系列文章: 1 结巴分词和自然语言处理HanLP处理手记 2 Python中文语料批量预处理手记 3 自然语言处理手记 4 Python中调用自然语言处理工具HanLP手记 5 Python中 ...
windows Win7如何设置多用户同时远程登录
windows Win7如何设置多用户同时远程登录 1.创建一个用户密码永不过期 2.在本地组策略编辑器里面,依次展开计算机配置--->管理模板--->Windows组件---> ...

随机推荐

linux下添加自动启动项，linux 开机自动启动脚本方法
#service servicename status是当前状态#chkconfig --list servicename是查看启动状态,也就是是否开机自动启动首先写好脚本,如 mysql,把它放到 ...
ItelliJ IDEA开发工具使用—创建一个web项目
转 http://blog.csdn.net/wangyang1354/article/details/50452806 最近想用IDEA编辑器开发,但是平时都用MyEclipse和eclipse ...
Eclipse 教程
Eclipse 教程 Eclipse 是一个开放源代码的.基于 Java 的可扩展开发平台. Eclipse 是 Java 的集成开发环境(IDE),当然 Eclipse 也可以作为其他开发语言的集成 ...
ASP.Net MVC开发基础学习笔记（8）：新建数据页面
前言前面解说了怎样创建一个查询页面并给查询页面加入排序.搜索及分页功能.今天我们来讲讲怎样向这个列表加入数据. 解说的顺序将依照加入数据的步骤的时间顺序来进行,方便大家理清逻辑关系. 本节将涉 ...
C/C++程序到内存分配（转）
一.一个由C/C++编译到程序占用的内存分为以下几个部分: 1.栈区(stack)——由编译器自动分配释放,在不需要的时候自动清除.用于存放函数的参数.局部变量等.操作方式类似数据结构中的栈(后进先出 ...
CentOS 6.4安装Puppet
CentOS安装Puppet 环境介绍:centos6.4x64 採用CentOS-6.4-x86_64-minimal.iso最小化安装 puppet版本号3.6.2.ruby1.8.7,f ...
ORACLE 11G 单实例磁盘文件系统 DG 归档日志删除脚本基于RED HAT LINUX 5.3 X86 64BIT
近期做个DG的归档日志删除, [oracle@.local logs]crontab -l * 8 * * * sh /home/oracle/dbscripts/del_arc.sh 该脚本分别调用 ...
DDR硬件设计要点详解（包括电源部分）
转自 http://www.fairchildic.org/module/forum/thread-658-1-1.html (原帖包括详细的附件内容) 1. 电源 DDR的电源可以分为三类A.主电源 ...
用户'sa'登录失败（错误18456）解决方案图解
原创作品,允许转载,转载时请务必以超链接形式标明文章原始出处 .作者信息和本声明.否则将追究法律责任.http://thenear.blog.51cto.com/4686262/865544 htt ...

wiki中文语料+word2vec (python3.5 windows win7)

wiki中文语料+word2vec (python3.5 windows win7)的更多相关文章

随机推荐

热门专题