Lucene中Analyzer语句分析

Lucene中Analyzer语句分析,利用lucene中自带的词法分析工具Analyzer，进行对句子的分析。

源代码如下：

 package com.test;

 import java.io.IOException;

 import java.io.StringReader;

 import java.util.List;

 import org.apache.lucene.analysis.Analyzer;

 import org.apache.lucene.analysis.SimpleAnalyzer;

 import org.apache.lucene.analysis.StopAnalyzer;

 import org.apache.lucene.analysis.Token;

 import org.apache.lucene.analysis.TokenStream;

 import org.apache.lucene.analysis.WhitespaceAnalyzer;

 import org.apache.lucene.analysis.standard.StandardAnalyzer;

 import org.apache.lucene.analysis.tokenattributes.TermToBytesRefAttribute;

 import org.apache.lucene.util.Version;

 import com.bean.mashupDerscriptionTest;

 import com.daoImpl.MashupDaoImpl;

 import com.gargoylesoftware.htmlunit.javascript.host.Comment;

 public class KeyWordsTest {

     /**

      * @param args

      */

     public static void main(String[] args) {

         MashupDaoImpl mashupDao = new MashupDaoImpl();

         List<mashupDerscriptionTest> list = mashupDao

                 .findAllmashupDescripteonTest();

         int i = 1;

         String comment = null;

         for (mashupDerscriptionTest mashup : list) {

             // 描述为空去名字作为描述

             if (mashup.getComments().equals("")) {

                 comment = mashup.getName();

             } else {

                 comment = mashup.getComments();

             }

 //            System.out.println(comment);

             //对读取的描述利用Lucene中的Analyzer进行句子分析产生

             //空格及各种符号分割,去掉停止词，停止词包括 is,are,in,on,the等无实际意义的词

             StringReader reader = new StringReader(comment);

             Analyzer analyzer = new StopAnalyzer();

             TokenStream tStream = analyzer.tokenStream("", reader);

             Token t;

             try {

                 while ((t = tStream.next()) != null) {

                     //对每个单词采用

                     System.out.print(t.termText()+" ");

                 }

                 System.out.println((i++)+"条描述分词结束！");

             } catch (IOException e) {

                 e.printStackTrace();

             }

         }

     }

 }

　　注:数据来源于数据库中......

Lucene中Analyzer语句分析的更多相关文章

《Lucene in Action 第二版》第4章节学习总结 -- Lucene中的分析
通过第四章的学习,可以了解lucene的分析过程是怎样的,并且可以学会如何使用lucene内置分析器,以及自定义分析器.下面是具体总结 1. 分析(Analysis)是什么? 在lucene中,分析就 ...
免费的Lucene 原理与代码分析完整版下载
Lucene是一个基于Java的高效的全文检索库.那么什么是全文检索,为什么需要全文检索?目前人们生活中出现的数据总的来说分为两类:结构化数据和非结构化数据.很容易理解,结构化数据是有固定格式和结构的 ...
Lucene 中的Tokenizer, TokenFilter学习
lucene中的TokenStream,TokenFilter之间关系 TokenStream是一个能够在被调用后产生语汇单元序列的类,其中有两个类型:Tokenizer和TokenFilte ...
lucene中Field简析
http://blog.csdn.net/zhaoxiao2008/article/details/14180019 先看一段lucene3代码 Document doc = new Document ...
如何理解T-SQL中Merge语句
写在前面的话:之前看过Merge语句,感觉没什么用,完全可以用其他的方式来替代,最近又看了看Merge语句,确实挺好用,可以少写很多代码,看起来也很紧凑,当然也有别的优点. ====正文开始===== ...
lucene中FSDirectory、RAMDirectory的用法
package com.ljq.one; import java.io.BufferedReader;import java.io.File;import java.io.FileInputStrea ...
tsql语句分析工具转
一款好用且免费的语句分析工具在调优过程中的查询语句优化阶段,分析语句的执行计划是必经之路,一款好的执行计划分析工具确实可以帮助我们事半功倍一款名为“Plan Explorer“,自己用的挺爽,不私 ...
oracle过程中动态语句实现
oracle过程中动态语句实现一般的PL/SQL程序设计中,在DML和事务控制的语句中可以直接使用SQL,但是DDL语句及系统控制语句却不能在PL/SQL中直接使用,要想实现在PL/SQL中使用DD ...
mysql语句分析
explain的每个输出行提供一个表的相关信息,并且每个行包括下面的列: 1,id select识别符.这是select的查询序列号.2,select_type 可以为一下任何一种类型simple ...

随机推荐

JAVA面试题基础部分（二）
10.使用 final 关键字修饰一个变量时,是引用不能变,还是引用的对象不能变?使用 final 关键字修饰一个变量时,是指引用变量不能变,引用变量所指向的对象中的内容还是可以改变的.例如,对于如下 ...
读书笔记「Python编程：从入门到实践」_6.字典
6.1 一个简单的字典 alien_0 = {'color': 'green', 'points': 5} print(alien_0['color']) print(alien_0['points' ...
js replace替换所有字符
'abc...'.replace(new RegExp('oldStr', 'gm'), 'newStr')
maven多个子项目、父项目之间的引用问题
在项目时用到maven管理项目,在一个就项目的基础上开发新的项目:关于子项目和父项目,子项目与子项目之间的调用问题,发现自己存在不足,以下是自己查询的问题,解决了自己的疑惑. 问题下面是一个简略的项 ...
python tips:类的专有属性
实例通常能够调用类的属性,但是有些属性是类专有的,实例无法调用. 实例调用方法时查找属性时,首先在自己的__dict__中找,找不到去类中找,在类中能够找到的属性都位于dir(cls)中,如果类的某些 ...
bzoj 4994: [Usaco2017 Feb]Why Did the Cow Cross the Road III 树状数组_排序
Description 给定长度为2N的序列,1~N各处现过2次,i第一次出现位置记为ai,第二次记为bi,求满足ai<aj<bi<bj的对数题解: 方法一: 搞一个KDtree, ...
Linux 性能检查命令总结
iostat -x 1 查看磁盘的IO负载 Linux系统出现了性能问题,一般我们可以通过top.iostat,vmstat等命令来查看初步定位问题.其中iostat可以给我们提供丰富的IO状态数据 ...
grunt入门出处：http://artwl.cnblogs.com
grunt-contrib-uglify uglify是一个文件压缩插件,项目地址:https://github.com/gruntjs/grunt-contrib-uglify 本文将以一个DEMO ...
[jzoj 5775]【NOIP2008模拟】农夫约的假期 (前缀和+递推)
传送门 Description 在某国有一个叫农夫约的人,他养了很多羊,其中有两头名叫mm和hh,他们的歌声十分好听,被当地人称为"魔音"······ 农夫约也有自己的假期呀!他要 ...
SQL中IS NOT NULL与!=NULL的区别
平时经常会遇到这两种写法:IS NOT NULL与!=NULL.也经常会遇到数据库有符合条件!=NULL的数据,但是返回为空集合.实际上,是由于对二者使用区别理解不透彻. 默认情况下,推荐使用 IS ...

Lucene中Analyzer语句分析

Lucene中Analyzer语句分析的更多相关文章

随机推荐

热门专题