python调用hanlp分词包手记

python调用hanlp分词包手记

Hanlp作为一款重要的分词工具，本月初的时候看到大快搜索发布了hanlp的1.7版本，新增了文本聚类、流水线分词等功能。关于hanlp1.7版本的新功能，后面有使用的到时候在给大家分享。本篇分享一个在python里调用hanlp分词包的过程文章，供需要的朋友参考学习交流！以下为文章内容：

1.在python下安装pyhanlp

sudo pip install pyhanlp

（详见pyhanlp官方文档）

2.pyhanlp的一些使用方法

（1）Hanlp.segment的使用

from pyhanlp import *

print HanLP.segment("今天开心了吗？")

#输出：[今天/t, 开心/a, 了/ule, 吗/y, ？/w]

（2）其它API函数的使用。

（pyhanlp里已经含有以下这些功能了，可以直接调用）

1 - # API列表

2CustomDictionary= LazyLoadingJClass('com.hankcs.hanlp.dictionary.CustomDictionary')

3 HanLP = SafeJClass('com.hankcs.hanlp.HanLP')

4 HanLP.Config = JClass('com.hankcs.hanlp.HanLP$Config')

5PerceptronLexicalAnalyzer= SafeJClass('com.hankcs.hanlp.model.perceptron.PerceptronLexicalAnalyzer')

6 DoubleArrayTrieSegment = SafeJClass('com.hankcs.hanlp.seg.Other.DoubleArrayTrieSegment')

7AhoCorasickDoubleArrayTrie = SafeJClass('com.hankcs.hanlp.collection.AhoCorasick.AhoCorasickDoubleArrayTrie')

8IOUtil = SafeJClass('com.hankcs.hanlp.corpus.io.IOUtil')

9TraditionalChineseTokenizer=SafeJClass('com.hankcs.hanlp.tokenizer.TraditionalChineseTokenizer')

调用方法

analyzer=PerceptronLexicalAnalyzer()

a =analyzer.analyze("今天开心了吗？")

print a

3.其它更多的功能的实现。

①　比如繁体分词，自动生成摘要这些hanlp能实现的，但不在以上API函数里面的，我们可以通过以下方法。

②　首先要在“../pyhanlp/init.py”pycharm文件下通过jclass语句引入更深类路径。比如（我引入的是中文繁体分词这个API函数）

③　TraditionalChineseTokenizer=SafeJClass('com.hankcs.hanlp.tokenizer.TraditionalChineseTokenizer')

④　然后就可以直接调用了，真的超级棒。

⑤　print TraditionalChineseTokenizer.segment('三華裔獲得傑出青年獎‘)

⑥　#输出：[三/m, 華裔/n, 獲得/v, 傑出青年/nz, 獎/n]

⑦　-其它更多的API函数的路径请参考java原代码。

---------------------

作者：小傻子kkk

python调用hanlp分词包手记的更多相关文章

Python中结巴分词使用手记
手记实用系列文章: 1 结巴分词和自然语言处理HanLP处理手记 2 Python中文语料批量预处理手记 3 自然语言处理手记 4 Python中调用自然语言处理工具HanLP手记 5 Python中 ...
python调用hanlp进行命名实体识别
本文分享自 6丁一的猫的博客,主要是python调用hanlp进行命名实体识别的方法介绍.以下为分享的全文. 1.python与jdk版本位数一致 2.pip install jpype1(pyth ...
自然语言处理工具python调用hanlp中文实体识别
Hanlp作为一款重要的中文分词工具,在GitHub的用户量已经非常之高,应该可以看得出来大家对于hanlp这款分词工具还是很认可的.本篇继续分享一篇关于hanlp的使用实例即Python调用hanl ...
自然语言处理工具python调用hanlp的方法步骤
Python调用hanlp的方法此前有分享过,本篇文章分享自“逍遥自在017”的博客,个别处有修改,阅读时请注意! 1.首先安装jpype 首先各种坑,jdk和python 版本位数必须一致,我用的是 ...
Spring MVCD框架中调用HanLP分词的方法
项目简要:关于java web的一个项目,用的Spring MVCd 框架.鉴于参与此次项目的人中并不是所人都做的Spring,为了能够提高效率,建议大家是先抛开SPring来写自己负责的模块,最后再 ...
Python中文语料批量预处理手记
手记实用系列文章: 1 结巴分词和自然语言处理HanLP处理手记 2 Python中文语料批量预处理手记 3 自然语言处理手记 4 Python中调用自然语言处理工具HanLP手记 5 Python中 ...
HanLP分词命名实体提取详解
HanLP分词命名实体提取详解分享一篇大神的关于hanlp分词命名实体提取的经验文章,文章中分享的内容略有一段时间(使用的hanlp版本比较老),最新一版的hanlp已经出来了,也可以去看看新版 ...
在Python中调用Java扩展包HanLP测试记录
最近在研究中文分词及自然语言相关的内容,关注到JAVA环境下的HanLP,HanLP是一个致力于向生产环境普及NLP技术的开源Java工具包,支持中文分词(N-最短路分词.CRF分词.索引分词.用户自 ...
python实战===用python调用jar包（原创）
一个困扰我很久的问题,今天终于解决了.用python调用jar包很简单,但是网上的人就是乱转载.自己试都不试就转载,让我走了很多弯路背景:python3.6 32位 + jre 32位 + ...

随机推荐

jar安装
安装sdk jar 安装到本地 mvn install:install-file -Dfile=F:\workspace\api-cookbook\java\src\main\lib\sdk-1.10 ...
【Python】sql-内连接，左连接，右连接，union
内连接: mysql> select * from book_wangjing as book_1 inner join user_wangjing as user_1 on book_1.id ...
【转】如何在win10（64位系统）上安装apache服务器
如何在win10(64位系统)上安装apache服务器今天装了Apache服务器,下面是我总结的方法: 一,准备软件 1.64位的apache版本传送门:http://www.apacheloun ...
python实现数组和链表的归并排序
归并排序是一种稳定的排序,采用分而治之策略,可以用于顺序储存结构,也易于在链表上实现.其原理如下图: 算法时间复杂度为 O(nlogn),空间复杂度为 O(n). 1 在数组上实现 def merg ...
iOS 静态库代码混淆方案
基于开源 Obfuscator-LLVM方案下载安装最新版本 Obfuscator-LLVM,目前3.6.1 $ git clone -b llvm-3.6.1 https://github.com ...
九度OJ1111题-单词替换
题目1111:单词替换时间限制:1 秒内存限制:32 兆特殊判题:否提交:6752 解决:1891 题目描述: 输入一个字符串,以回车结束(字符串长度<=100).该字符串由若干个单词组 ...
[LeetCode&Python] Problem 705. Design HashSet
Design a HashSet without using any built-in hash table libraries. To be specific, your design should ...
Oracle导入导出表
使用PL SQL Developer进行操作一.导出工具<<导出表<<sql插入<<选择用户和要导出的表,勾选创建表,选择输出文件(格式最好为.sql),点击导 ...
多点搜的bfs
Problem L. 跑图Time limit: 1000msMemory limit: 65536KBDescription跑图是 RPG 游戏中很烦躁的事情.玩家需要跑到距离他最近的传送点的位置. ...
Dependency Parsing -13 chapter（Speech and Language Processing）
https://web.stanford.edu/~jurafsky/slp3/13.pdf constituent-based 基于成分的phrasal constituents and phras ...

python调用hanlp分词包手记

python调用hanlp分词包手记的更多相关文章

随机推荐

热门专题