Lucene 6.0下使用IK分词器

Lucene 6.0使用IK分词器需要修改修改IKAnalyzer和IKTokenizer.

使用时先新建一个MyIKTokenizer类,一个MyIkAnalyzer类：

MyIKTokenizer.java

import java.io.IOException;

import java.io.Reader;

import org.apache.lucene.analysis.Tokenizer;

import org.apache.lucene.analysis.tokenattributes.CharTermAttribute;

import org.apache.lucene.analysis.tokenattributes.OffsetAttribute;

import org.apache.lucene.analysis.tokenattributes.TypeAttribute;

import org.wltea.analyzer.core.IKSegmenter;

import org.wltea.analyzer.core.Lexeme;

public class MyIKTokenizer extends Tokenizer {

    // IK分词器实现

    private IKSegmenter _IKImplement;

    // 词元文本属性

    private final CharTermAttribute termAtt;

    // 词元位移属性

    private final OffsetAttribute offsetAtt;

    // 词元分类属性（该属性分类参考org.wltea.analyzer.core.Lexeme中的分类常量）

    private final TypeAttribute typeAtt;

    // 记录最后一个词元的结束位置

    private int endPosition;

    public MyIKTokenizer(Reader in) {

        this(in, false);

    }

    public MyIKTokenizer(Reader in, boolean useSmart) {

        offsetAtt = addAttribute(OffsetAttribute.class);

        termAtt = addAttribute(CharTermAttribute.class);

        typeAtt = addAttribute(TypeAttribute.class);

        _IKImplement = new IKSegmenter(input, useSmart);

    }

    @Override

    public boolean incrementToken() throws IOException {

        // 清除所有的词元属性

        clearAttributes();

        Lexeme nextLexeme = _IKImplement.next();

        if (nextLexeme != null) {

            // 将Lexeme转成Attributes

            // 设置词元文本

            termAtt.append(nextLexeme.getLexemeText());

            // 设置词元长度

            termAtt.setLength(nextLexeme.getLength());

            // 设置词元位移

            offsetAtt.setOffset(nextLexeme.getBeginPosition(),

                    nextLexeme.getEndPosition());

            // 记录分词的最后位置

            endPosition = nextLexeme.getEndPosition();

            // 记录词元分类

            typeAtt.setType(nextLexeme.getLexemeTypeString());

            // 返会true告知还有下个词元

            return true;

        }

        // 返会false告知词元输出完毕

        return false;

    }

    public void reset() throws IOException {

        super.reset();

        _IKImplement.reset(input);

    }

    @Override

    public final void end() {

        // set final offset

        int finalOffset = correctOffset(this.endPosition);

        offsetAtt.setOffset(finalOffset, finalOffset);

    }

}

MyIkAnalyzer.java

package cn.ucas.lucene.ik;

import java.io.Reader;

import java.io.StringReader;

import org.apache.lucene.analysis.Analyzer;

import org.apache.lucene.util.IOUtils;

public class MyIkAnalyzer extends Analyzer {

    @Override

    protected TokenStreamComponents createComponents(String arg0) {

        Reader reader=null;

        try{

            reader=new StringReader(arg0);

            MyIKTokenizer it = new MyIKTokenizer(reader);

            return new Analyzer.TokenStreamComponents(it);

        }finally {

            IOUtils.closeWhileHandlingException(reader);

        }

    }

}

在Lucene中使用IK分词器：

Analyzer myIkAnalyzer=new MyIkAnalyzer();

Lucene 6.0下使用IK分词器的更多相关文章

ElasticSearch6.5.0 【安装IK分词器】
不得不夸奖一下ES的周边资源,比如这个IK分词器,紧跟ES的版本,卢本伟牛逼!另外ES更新太快了吧,几乎不到半个月一个小版本就发布了!!目前已经发了6.5.2,估计我还没怎么玩就到7.0了. 下载分 ...
Elasticsearch下安装ik分词器
安装ik分词器(必须安装maven) 上传相应jar包解压到相应目录 unzip elasticsearch-analysis-ik-master.zip(zip包) cp -r elasticse ...
【杂记】docker搭建ELK 集群6.4.0版本 + elasticsearch-head IK分词器与拼音分词器整合
大佬博客地址:https://blog.csdn.net/supermao1013/article/category/8269552 docker elasticsearch 集群启动命令 docke ...
Linux下,非Docker启动Elasticsearch 6.3.0,安装ik分词器插件,以及使用Kibana测试Elasticsearch,
Linux下,非Docker启动Elasticsearch 6.3.0 查看java版本,需要1.8版本 java -version yum -y install java 创建用户,因为elasti ...
IK分词器原理与源码分析
原文:http://3dobe.com/archives/44/ 引言做搜索技术的不可能不接触分词器.个人认为为什么搜索引擎无法被数据库所替代的原因主要有两点,一个是在数据量比较大的时候,搜索引擎的 ...
Elasticsearch之文档的增删改查以及ik分词器
文档的增删改查增加文档使用elasticsearch-head查看修改文档使用elasticsearch-head查看删除文档使用elasticsearch-head查看查看文档的三种方 ...
（2）ElasticSearch在linux环境中集成IK分词器
1.简介 ElasticSearch默认自带的分词器,是标准分词器,对英文分词比较友好,但是对中文,只能把汉字一个个拆分.而elasticsearch-analysis-ik分词器能针对中文词项颗粒度 ...
lucene版本升级到4.6.0以上之后使用ik分词器遇到的问题
在将lucene core版本从4.5.1升级到4.7.0后,如下代码使用ik分词器报错 IKAnalyzer analyzer = new IKAnalyzer(true); StringReade ...
Lucene.net(4.8.0) 学习问题记录五: JIEba分词和Lucene的结合，以及对分词器的思考
前言:目前自己在做使用Lucene.net和PanGu分词实现全文检索的工作,不过自己是把别人做好的项目进行迁移.因为项目整体要迁移到ASP.NET Core 2.0版本,而Lucene使用的版本是3 ...

随机推荐

重拾Python(3):Pandas之Series对象的使用
Pandas是Python下最强大的数据分析和探索库,是基于Numpy库构建的,支持类似SQL的结构化数据的增.删.查.改,具有丰富的数据处理函数.Pandas有两大数据结构:Series和DataF ...
Java面试题2--数据类型
1. Java的数据类型? 2. Java的封装类型? 3. 基本类型和封装类型的区别? 基本类型只能按值传递,而对应的封装类是按引用传递的. 基本类型是在堆栈上创建的,而所有的对象类型都是在堆上创建 ...
Vim+Vundle+YouCompleteMe 安装
这段时间在Centos 7上开发c++程序,想为vim安装YouCompleteMe插件,参照几个博客无果,果断上官网找解决方案.功夫不负苦心人,终于搞定. 学习东西还是要多上官网. 下面送上本次的收 ...
Hibernate 学习之Query查询（HQL查询）
package com.itcloud.test; import com.itcloud.pojo.Dept; import org.hibernate.Session; import org.hib ...
[LeetCode] Longest Line of Consecutive One in Matrix 矩阵中最长的连续1
Given a 01 matrix M, find the longest line of consecutive one in the matrix. The line could be horiz ...
Python数据抓取_BeautifulSoup模块的使用
在数据抓取的过程中,我们往往都需要对数据进行处理本篇文章我们主要来介绍python的HTML和XML的分析库 BeautifulSoup 的官方文档网站如下 https://www.crummy.c ...
空间漫游(SAC大佬的测试)
题目描述由于球哥和巨佬嘉诚交了很多保护费,我们有钱进行一次 d 维空间漫游.d 维空间中有 d 个正交坐标轴,可以用这些坐标轴来描述你在空间中的位置和移动的方向.例如,d = 1 时,空间是一个数轴, ...
神在夏至祭降下了神谕(oracle)
首先这道题样例很多,先一个一个看我们发现k为奇数是必为winter,其实可以证明 k为奇数时,k=a+(a+1)意味着可以直接实现winter士兵+1,summer士兵-1 k为偶数时,显然当m也为 ...
●BZOJ 4237 稻草人
题链: http://www.lydsy.com/JudgeOnline/problem.php?id=4237 题解: CDQ分治,单调栈把所有点先按x从小到大排序,然后去CDQ分治y坐标. 在分 ...
【网络流】【BZOJ1221】【HNOI2001】软件开发
原题链接:http://www.lydsy.com/JudgeOnline/problem.php?id=1221 题意:你有3种方法进行对毛巾的处理,不同的处理方法有不同的cost,问你要如何规划才 ...

Lucene 6.0下使用IK分词器

MyIKTokenizer.java

MyIkAnalyzer.java

Lucene 6.0下使用IK分词器的更多相关文章

随机推荐

热门专题