近几天在做自然语言处理,看了一篇论文:面向知识库的中文自然语言问句的语义理解,里面提到了中文的分词,大家都知道对于英文的分词,NLTK有很好的支持,但是NLTK对于中文的分词并不是很好(其实也没有怎么尝试,哈哈哈!)

然后发现了jieba(结巴)分词,发现还是很强大的,还有一个THULAC(http://thulac.thunlp.org/#%E7%BC%96%E8%AF%91%E5%92%8C%E5%AE%89%E8%A3%85),THULAC我还没有试过,这次先来展示一下jieba分词的一些基本用法,后期继续更新

本文并非原创,参考的博客有:http://blog.csdn.net/xiaoxiangzi222/article/details/53483931

#-*- coding:utf-8 -*-
import jieba
import jieba.posseg as jp string='已结婚的和尚未结婚的青年都要实行计划生育'
#全模式
list1=jieba.cut(string,cut_all=True)
print "/".join(list1)
#精确模式
list2=jieba.cut(string,cut_all=False)
print "/".join(list2)
#搜索引擎模式(****默认是精确模式*****)
list3=jieba.cut_for_search(string)
print "/".join(list3) print '*'*80 # 问题来了:
# ①已/结婚/的/和/尚未/结婚/的/青年/都/要/实行/计划生育
# ②已/结婚/的/和尚/未/结婚/的/青年/都/要/实行/计划生育
# 这两个貌似好想都可以,那到底是怎么分词的呢,大家接着往下看 #添加自己的词典进行分词
#userdict.txt:
# 和尚 10000000 n (词+空格+词频+空格+词性)
jieba.load_userdict("userdict.txt")
#修改词频之后,结果就是②
list4=jieba.cut(string)
print "/".join(list4) jieba.del_word('和尚')
list7=jieba.cut(string)
print "/".join(list7) print '*'*80
#动态更改分词器
string1='李小福是创新办主任也是云计算方面的专家'
list5=jieba.cut(string1)
print "/".join(list5)
jieba.add_word('创新办','','n')
jieba.add_word('云计算')
list6=jieba.cut(string1)
print "/".join(list6) print '*'*80
#显示词性
words =jp.cut(string)
for w in words:
print w.word, w.flag

运行结果:  

已/结婚/的/和尚/尚未/未结/结婚/的/青年/都/要/实行/计划/计划生育/生育
已/结婚/的/和/尚未/结婚/的/青年/都/要/实行/计划生育
已/结婚/的/和/尚未/结婚/的/青年/都/要/实行/计划/生育/计划生育
********************************************************************************
已/结婚/的/和尚/未/结婚/的/青年/都/要/实行/计划生育
已/结婚/的/和/尚未/结婚/的/青年/都/要/实行/计划生育
********************************************************************************
李小福/是/创新/办/主任/也/是/云/计算/方面/的/专家
李小福/是/创新办/主任/也/是/云计算/方面/的/专家
********************************************************************************
已 d
结婚 v
的 uj
和 c
尚未 d
结婚 v
的 uj
青年 t
都 d
要 v
实行 v
计划生育 l

jieba分词(1)的更多相关文章

  1. widows下jieba分词的安装

    在切词的时候使用到jieba分词器,安装如下: 切入到结巴包,执行 python setup.py install 安装后,可以直接在代码中引用: import jieba

  2. 【原】关于使用jieba分词+PyInstaller进行打包时出现的一些问题的解决方法

    错误现象: 最近在做一个小项目,在Python中使用了jieba分词,感觉非常简洁方便.在Python端进行调试的时候没有任何问题,使用PyInstaller打包成exe文件后,就会报错: 错误原因分 ...

  3. Lucene.net(4.8.0) 学习问题记录五: JIEba分词和Lucene的结合,以及对分词器的思考

    前言:目前自己在做使用Lucene.net和PanGu分词实现全文检索的工作,不过自己是把别人做好的项目进行迁移.因为项目整体要迁移到ASP.NET Core 2.0版本,而Lucene使用的版本是3 ...

  4. python结巴(jieba)分词

    python结巴(jieba)分词 一.特点 1.支持三种分词模式: (1)精确模式:试图将句子最精确的切开,适合文本分析. (2)全模式:把句子中所有可以成词的词语都扫描出来,速度非常快,但是不能解 ...

  5. pypinyin, jieba分词与Gensim

    一 . pypinyin from pypinyin import lazy_pinyin, TONE, TONE2, TONE3 word = '孙悟空' print(lazy_pinyin(wor ...

  6. 使用pynlpir增强jieba分词的准确度

    在使用jieba分词时,发现分词准确度不高.特别是一些专业词汇,比如堡垒机,只能分出堡垒,并不能分出堡垒机.这样导致的问题是很多时候检索并不准确. 经过对比测试,发现nlpir进行分词效果更好.但是n ...

  7. 自然语言处理之jieba分词

    在处理英文文本时,由于英文文本天生自带分词效果,可以直接通过词之间的空格来分词(但是有些人名.地名等需要考虑作为一个整体,比如New York).而对于中文还有其他类似形式的语言,我们需要根据来特殊处 ...

  8. jieba分词(3)

    jieba分词中Tokenize的使用,Tokenize主要是用来返回词语在原文的弃之位置,下面贴上代码: #-*- coding:utf-8 -*- from __future__ import u ...

  9. jieba分词(2)

    结巴分词系统中实现了两种关键词抽取法,一种是TF-IDF关键词抽取算法另一种是TextRank关键词抽取算法,它们都是无监督的算法. 以下是两种算法的使用: #-*- coding:utf-8 -*- ...

随机推荐

  1. 第20章:MongoDB-聚合操作--聚合管道--$unwind

    ①$unwind 在查询数据的时候经常会返回数组信息,但是数组并不方便信息的浏览,所以提供有“$unwind”可以将数组数据变为独立的字符串内容. 将文档中数组类型的字段拆分成多条,每条文档包含数组中 ...

  2. 20155205 《Java程序设计》0510课上实践博客

    20155205 <Java程序设计>0510课上实践博客 一.教材代码检查-p98 未提交成功原因: 一开始在iterm中运行,但是结果出错,没有时间提交了.这个提交其实很简单,没有提交 ...

  3. bzoj2388(分块 凸包)

    好像没有什么高级数据结构能够很高效地实现这个东西: 那就上万能的分块,我们用一些数形结合的思想,把下标看成横坐标,前缀和的值看成纵坐标: 给区间内每个数都加k相当于相邻两点的斜率都加上k: 这种东西我 ...

  4. (多重背包)hdu--2191--悼念512汶川大地震遇难同胞——珍惜现在,感恩生活

    Problem Description 急!灾区的食物依然短缺!为了挽救灾区同胞的生命,心系灾区同胞的你准备自己采购一些粮食支援灾区,现在假设你一共有资金n元,而市场有m种大米,每种大米都是袋装产品, ...

  5. 基类的析构函数写成virtual虚析构函数

    虚函数作用:动态绑定,实现多态效果. 场景问题: 派生类中有资源需要回收,而在编程中采用多态,由基类的指针指向派生类,则在释放的时候,如果基类的析构函数不是virtual,则派生类的析构函数得不到释放 ...

  6. jQuery插件初级练习1答案

    html: <script> $(".btn").click(function(){ $.color($("#box"),"blue&qu ...

  7. bootstrap2.1

    <html>   <head>   <meta charset="utf-8" />   <title></title> ...

  8. hive函数 get_json_object的使用

    hive提供了json的解析函数:get_json_object 使用方法 对于jsonArray(json数组),如person表的xjson字段有数据: [{"name":&q ...

  9. letcode code]Maximum Subarray

    1 题目: Find the contiguous subarray within an array (containing at least one number) which has the la ...

  10. ASP.NET Core2利用MassTransit集成RabbitMQ

    在ASP.NET Core上利用MassTransit来集成使用RabbitMQ真的很简单,代码也很简洁.近期因为项目需要,我便在这基础上再次进行了封装,抽成了公共方法,使得使用RabbitMQ的调用 ...