lucene构建同义词分词器

lucene4.0版本号以后已经用TokenStreamComponents 代替了TokenStream流。里面包含了filter和tokenizer

在较复杂的lucene搜索业务场景下，直接网上下载一个作为项目的分词器，是不够的。那么怎么去评定一个中文分词器的好与差：一般来讲。有两个点。词库和搜索效率，也就是算法。

lucene的倒排列表中，不同的分词单元有不同的PositionIncrementAttribute，假设两个词之间PositionIncrementAttribute距离为0。则为同义词；比方：我定义美国和中国这两个词在倒排列表中是同一个位置及距离为0，那么搜索美国的话，中国也能出来。

这就是同义词搜索原理。

下面代码（用mmseg的 Tokenizer 去切词之后，然后再做同义词）：

先自己定义分词器：

package hhc;

import java.io.Reader;

import org.apache.lucene.analysis.Analyzer;

import org.apache.lucene.analysis.TokenStream;

import com.chenlb.mmseg4j.Dictionary;

import com.chenlb.mmseg4j.MaxWordSeg;

import com.chenlb.mmseg4j.analysis.MMSegTokenizer;

/**

 * 写一个分词器，一般能够參照原来分词器是怎么写法的

 * @author hhc

 *

 */

public class MySameAnalyzer extends Analyzer{

	//同义词

	private SamewordContext samewordContext=null;

	public MySameAnalyzer(SamewordContext samewordContext){

		this.samewordContext=samewordContext;

	}

	@Override

	public TokenStream tokenStream(String fieldName, Reader reader) {

		//

		Dictionary dic=Dictionary.getInstance();

		return new MySameTokenFilter(new MMSegTokenizer(new MaxWordSeg(dic), reader),samewordContext);

	}

}

然后再对TokenStream流做同义词处理

package hhc;

import java.io.IOException;

import java.util.Stack;

import org.apache.lucene.analysis.TokenFilter;

import org.apache.lucene.analysis.TokenStream;

import org.apache.lucene.analysis.tokenattributes.CharTermAttribute;

import org.apache.lucene.analysis.tokenattributes.PositionIncrementAttribute;

import org.apache.lucene.util.AttributeSource;

public class MySameTokenFilter extends TokenFilter {

	// 分词单元信息

	private CharTermAttribute cta = null;

	// 位置信息

	private PositionIncrementAttribute pia = null;

	// 状态

	private AttributeSource.State current;

	// 同义词集合

	private Stack<String> sames = null;

	private SamewordContext samewordContext=null;

	protected MySameTokenFilter(TokenStream input,SamewordContext samewordContext) {

		super(input);

		cta = input.addAttribute(CharTermAttribute.class);

		pia = input.addAttribute(PositionIncrementAttribute.class);

		sames=new Stack<String>();

		this.samewordContext=samewordContext;

	}

	@Override

	public boolean incrementToken() throws IOException {

		try {

			if (sames!=null&&sames.size()> 0) {

				// 删除对象在堆栈,然后返回的对象上的函数值。而且获取这个同义词

				String str = sames.pop();

				// 还原状态

				restoreState(current);

				cta.setEmpty();

				cta.append(str);

				pia.setPositionIncrement(0);

				return true;

			}

			// 假设流中没有数据了。

			if (!input.incrementToken())return false;

			/**

			 * 流中有数据的话，进行对应的同义词

			 */

			// 处理切分出来的词的信息

			if (existAddSameword(cta.toString())) {

				// 把当前状态先保存

				current = captureState();

			}

		} catch (Exception e) {

			// TODO: handle exception

			e.printStackTrace();

		}

		return true;

	}

	/**

	 * 推断是否该分词单元存在

	 *

	 * @param word

	 * @return

	 */

	private boolean existAddSameword(String word) {

	    String[] words=samewordContext.getSameword(word);

		if (words != null) {

			for (String s : words) {

				sames.push(s);

			}

			return true;

		}

		return false;

	}

}

lucene构建同义词分词器的更多相关文章

【Lucene3.6.2入门系列】第05节_自定义停用词分词器和同义词分词器
首先是用于显示分词信息的HelloCustomAnalyzer.java package com.jadyer.lucene; import java.io.IOException; import j ...
Apache Lucene(全文检索引擎)—分词器
目录返回目录:http://www.cnblogs.com/hanyinglong/p/5464604.html 本项目Demo已上传GitHub,欢迎大家fork下载学习:https://gith ...
Lucene系列四：Lucene提供的分词器、IKAnalyze中文分词器集成、扩展 IKAnalyzer的停用词和新词
一.Lucene提供的分词器StandardAnalyzer和SmartChineseAnalyzer 1.新建一个测试Lucene提供的分词器的maven项目LuceneAnalyzer 2. 在p ...
【原创】Lucene.Net+盘古分词器(详细介绍)
本章阅读概要 1.Lucenne.Net简介 2.介绍盘古分词器 3.Lucene.Net实例分析 4.结束语(Demo下载) Lucene.Net简介 Lucene.net是Lucene的.net移 ...
Lucene.Net+盘古分词器(详细介绍)(转)
出处:http://www.cnblogs.com/magicchaiy/archive/2013/06/07/LuceneNet%E7%9B%98%E5%8F%A4%E5%88%86%E8%AF%8 ...
Lucene的中文分词器IKAnalyzer
分词器对英文的支持是非常好的. 一般分词经过的流程: 1)切分关键词 2)去除停用词 3)把英文单词转为小写但是老外写的分词器对中文分词一般都是单字分词,分词的效果不好. 国人林良益写的IK Ana ...
Lucene的中文分词器
1 什么是中文分词器学过英文的都知道,英文是以单词为单位的,单词与单词之间以空格或者逗号句号隔开. 而中文的语义比较特殊,很难像英文那样,一个汉字一个汉字来划分. 所以需要一个能自动识别中文语义的分 ...
重写lucene.net的分词器支持3.0.3.0版本
lucene.net中每个分词器都是一个类,同时有一个辅助类,这个辅助类完成分词的大部分逻辑.分词类以Analyzer结尾,辅助类通常以Tokenizer结尾.分类词全部继承自Analyzer类,辅助 ...
Lucene.Net+盘古分词器(详细介绍)
本章阅读概要1.Lucenne.Net简介2.介绍盘古分词器3.Lucene.Net实例分析4.结束语(Demo下载)Lucene.Net简介 Lucene.net是Lucene的.net移植版本,是 ...

随机推荐

Mongoose之 SchemaTypes 数据类型
SchemaTypes 数据类型 SchemaTypes handle definition of path defaults, validation, getters, setters, field ...
NFC (Near Filed Communication)
NFC的用途:近场通信(Near Field Communication,NFC),又称近距离无线通信,是一种短距离的高频无线通信技术,允许电子设备之间进行非接触式点对点数据传输(在十厘米内)交换数据 ...
Oracle 11g服务器安装详细步骤——图文教程
1.大家可以根据自己的操作系统是多少位(32位或64位)的,到官网下载相应的安装程序,如下图所示. 有一点需要注意,Oracle的安装程序分成2个文件,下载后将2个文件解压到同一目录即可. 2.下载完 ...
使用SQLPLUS创建用户名和表空间
用sqlplus为oracle创建用户和表空间用sqlplus为oracle创建用户和表空间用Oracle10g自带的企业管理器或PL/SQL图形化的方法创建表空间和用户以及分配权限是相对比较简单的, ...
ionic生成apk使用build命令下载gradle-2.2.1-all.zip卡，解决方案
ionic生成apk使用build命令下载gradle-2.2.1-all.zip卡,解决方案直接使用ionic build android命令,自动下载gradle-2.2.1-all.zip超慢 ...
从零开始搭建ELK+GPE监控预警系统
前言本文可能不会详细记录每一步实现的过程,但一定程度上可以引领小伙伴走向更开阔的视野,串联每个环节,呈现予你不一样的效果. 业务规模 8个平台 100+台服务器 10+个集群分组微服务600+ 用 ...
图文详解AO打印（端桥模式）
一.概述 AO打印是英文Active-Online Print的简称,也称主动在线打印.打印前支持AO通讯协议的AO打印机首先通过普通网络与C-Lodop服务保持在线链接,网页程序利用JavaSc ...
PHP截取带有汉字的字符串，将汉字按两个字节计算
<?php header("Content-type:text/html;charset=utf-8"); /** *截取字符串,汉字占两个字节,字母占一个字节 *页面编码必 ...
mybatis批量修改
使用mybats经常要用到批量修改或者删除,贴出批量修改的代码.如果是批量删除,可将update换成delete. <update id="changestatus" par ...
java并发之同步辅助类（Semphore、CountDownLatch、CyclicBarrier、Phaser）
线程同步辅助类,主要学习两点: 1.上述几种同步辅助类的作用以及常用的方法 2.适用场景,如果有适当的场景可以用到,那无疑是最好的 semaphore(seməˌfôr) 含义信号量就是可以声明多把 ...

lucene构建同义词分词器

lucene构建同义词分词器的更多相关文章

随机推荐

热门专题