lucene学习的小结

pom.xml设置

    <dependency>

        <groupId>junit</groupId>

        <artifactId>junit</artifactId>

        <version>4.12</version>

        <scope>test</scope>

    </dependency>

      <dependency>

        <groupId>org.apache.lucene</groupId>

        <artifactId>lucene-core</artifactId>

        <version>5.3.1</version>

    </dependency>

    <dependency>

    <groupId>org.apache.lucene</groupId>

        <artifactId>lucene-queryparser</artifactId>

        <version>5.3.1</version>

    </dependency>

    <dependency>

        <groupId>org.apache.lucene</groupId>

        <artifactId>lucene-analyzers-common</artifactId>

        <version>5.3.1</version>

    </dependency>

    <dependency>

        <groupId>org.apache.lucene</groupId>

        <artifactId>lucene-analyzers-smartcn</artifactId>

        <version>5.3.1</version>

    </dependency>

    <dependency>

        <groupId>org.apache.lucene</groupId>

        <artifactId>lucene-highlighter</artifactId>

        <version>5.3.1</version>

    </dependency>

生成索引IndexingTest.java

package com.chabansheng.lucene;

import java.nio.file.Paths;

import ...;public class IndexingTest {

    private String ids[]={"1","2","3","4"};

    private String authors[]={"Jack","Marry","John","Json"};

    private String positions[]={"accounting","technician","salesperson","boss"};

    private String titles[]={"Java is a good language.","Java is a cross platform language","Java powerful","You should learn java"};

    private String contents[]={

            "If possible, use the same JRE major version at both index and search time.",

            "When upgrading to a different JRE major version, consider re-indexing. ",

            "Different JRE major versions may implement different versions of Unicode,",

            "For example: with Java 1.4, `LetterTokenizer` will split around the character U+02C6,"

    };

    private Directory dir;

    /**

     * 生成索引

     * @throws Exception

     */

    @Test

    public void index()throws Exception{

        dir=FSDirectory.open(Paths.get("D:\\lucene3"));

        //获取IndexWriter实例

        Analyzer analyzer=new StandardAnalyzer(); // 标准分词器

        IndexWriterConfig iwc=new IndexWriterConfig(analyzer);

        IndexWriter writer=new IndexWriter(dir, iwc);

        for(int i=0;i<ids.length;i++){

            Document doc=new Document();

            doc.add(new StringField("id", ids[i], Field.Store.YES));

            doc.add(new StringField("author",authors[i],Field.Store.YES));

            doc.add(new StringField("position",positions[i],Field.Store.YES));

            // 加权操作

            TextField field=new TextField("title", titles[i], Field.Store.YES);

            if("boss".equals(positions[i])){

                field.setBoost(1.5f);

            }

            doc.add(field);

            doc.add(new TextField("content", contents[i], Field.Store.NO));

            writer.addDocument(doc); // 添加文档

        }

        writer.close();

    }

    /**

     * 查询索引方式一

     * @throws Exception

     */

    @Test

    public void search()throws Exception{

        dir=FSDirectory.open(Paths.get("D:\\lucene"));

        IndexReader reader=DirectoryReader.open(dir);

        IndexSearcher is=new IndexSearcher(reader);

        String searchField="title";

        String q="java";

        //Term方式查询

        Term t=new Term(searchField,q);

        Query query=new TermQuery(t);

        TopDocs hits=is.search(query, 10);

        System.out.println("匹配 '"+q+"'，总共查询到"+hits.totalHits+"个文档");

        for(ScoreDoc scoreDoc:hits.scoreDocs){

            Document doc=is.doc(scoreDoc.doc);

            System.out.println(doc.get("author"));

        }

        reader.close();

    }

}

查询索引方式二Searcher.java

package com.chabansheng.lucene;

import java.io.StringReader;

import java.nio.file.Paths;

import ...;public class Searcher {

    public static void search(String indexDir,String q)throws Exception{

        Directory dir=FSDirectory.open(Paths.get(indexDir));

        IndexReader reader=DirectoryReader.open(dir);

        IndexSearcher is=new IndexSearcher(reader);

        //QueryParser查询方式

        // Analyzer analyzer=new StandardAnalyzer(); // 标准分词器

        SmartChineseAnalyzer analyzer=new SmartChineseAnalyzer();

        QueryParser parser=new QueryParser("desc", analyzer);

        Query query=parser.parse(q);

        TopDocs hits=is.search(query, 10);

        //高亮行号

        QueryScorer scorer=new QueryScorer(query);

        Fragmenter fragmenter=new SimpleSpanFragmenter(scorer);

        SimpleHTMLFormatter simpleHTMLFormatter=new SimpleHTMLFormatter("<b><font color='red'>","</font></b>");

        Highlighter highlighter=new Highlighter(simpleHTMLFormatter, scorer);

        highlighter.setTextFragmenter(fragmenter);

        for(ScoreDoc scoreDoc:hits.scoreDocs){

            Document doc=is.doc(scoreDoc.doc);

            System.out.println(doc.get("city"));

            System.out.println(doc.get("desc"));

            String desc=doc.get("desc");

            if(desc!=null){

                TokenStream tokenStream=analyzer.tokenStream("desc", new StringReader(desc));

                System.out.println(highlighter.getBestFragment(tokenStream, desc));

            }

        }

        reader.close();

    }

    public static void main(String[] args) {

        String indexDir="D:\\lucene2";

        String q="南京文明";

        try {

            search(indexDir,q);

        } catch (Exception e) {

            // TODO Auto-generated catch block

            e.printStackTrace();

        }

    }

}

package com.chabansheng.lucene;
import java.nio.file.Paths;
import org.apache.lucene.analysis.Analyzer;import org.apache.lucene.analysis.standard.StandardAnalyzer;import org.apache.lucene.document.Document;import org.apache.lucene.document.Field;import org.apache.lucene.document.StringField;import org.apache.lucene.document.TextField;import org.apache.lucene.index.DirectoryReader;import org.apache.lucene.index.IndexReader;import org.apache.lucene.index.IndexWriter;import org.apache.lucene.index.IndexWriterConfig;import org.apache.lucene.index.Term;import org.apache.lucene.search.IndexSearcher;import org.apache.lucene.search.Query;import org.apache.lucene.search.ScoreDoc;import org.apache.lucene.search.TermQuery;import org.apache.lucene.search.TopDocs;import org.apache.lucene.store.Directory;import org.apache.lucene.store.FSDirectory;import org.junit.Test;
public class IndexingTest {
private String ids[]={"1","2","3","4"};private String authors[]={"Jack","Marry","John","Json"};private String positions[]={"accounting","technician","salesperson","boss"};private String titles[]={"Java is a good language.","Java is a cross platform language","Java powerful","You should learn java"};private String contents[]={"If possible, use the same JRE major version at both index and search time.","When upgrading to a different JRE major version, consider re-indexing. ","Different JRE major versions may implement different versions of Unicode,","For example: with Java 1.4, `LetterTokenizer` will split around the character U+02C6,"};private Directory dir;/** * 生成索引 * @throws Exception */@Testpublic void index()throws Exception{dir=FSDirectory.open(Paths.get("D:\\lucene3"));//获取IndexWriter实例Analyzer analyzer=new StandardAnalyzer(); // 标准分词器IndexWriterConfig iwc=new IndexWriterConfig(analyzer);IndexWriter writer=new IndexWriter(dir, iwc);for(int i=0;i<ids.length;i++){Document doc=new Document();doc.add(new StringField("id", ids[i], Field.Store.YES));doc.add(new StringField("author",authors[i],Field.Store.YES));doc.add(new StringField("position",positions[i],Field.Store.YES));// 加权操作TextField field=new TextField("title", titles[i], Field.Store.YES);if("boss".equals(positions[i])){field.setBoost(1.5f);}doc.add(field);doc.add(new TextField("content", contents[i], Field.Store.NO));writer.addDocument(doc); // 添加文档}writer.close();}
/** * 查询 * @throws Exception */@Testpublic void search()throws Exception{dir=FSDirectory.open(Paths.get("D:\\lucene3"));IndexReader reader=DirectoryReader.open(dir);IndexSearcher is=new IndexSearcher(reader);String searchField="title";String q="java";//Term方式查询Term t=new Term(searchField,q);Query query=new TermQuery(t);TopDocs hits=is.search(query, 10);System.out.println("匹配 '"+q+"'，总共查询到"+hits.totalHits+"个文档");for(ScoreDoc scoreDoc:hits.scoreDocs){Document doc=is.doc(scoreDoc.doc);System.out.println(doc.get("author"));}reader.close();}}

lucene学习的小结的更多相关文章

Lucene学习笔记（更新）
1.Lucene学习笔记 http://www.cnblogs.com/hanganglin/articles/3453415.html
Lucene学习总结之七：Lucene搜索过程解析
一.Lucene搜索过程总论搜索的过程总的来说就是将词典及倒排表信息从索引中读出来,根据用户输入的查询语句合并倒排表,得到结果文档集并对文档进行打分的过程. 其可用如下图示: 总共包括以下几个过程: ...
Lucene学习总结之六：Lucene打分公式的数学推导
在进行Lucene的搜索过程解析之前,有必要单独的一张把Lucene score公式的推导,各部分的意义阐述一下.因为Lucene的搜索过程,很重要的一个步骤就是逐步的计算各部分的分数. Lucene ...
Lucene学习-深入Lucene分词器,TokenStream获取分词详细信息
Lucene学习-深入Lucene分词器,TokenStream获取分词详细信息在此回复牛妞的关于程序中分词器的问题,其实可以直接很简单的在词库中配置就好了,Lucene中分词的所有信息我们都可以从 ...
Lucene学习入门——下载初识
本文从官网下载Lucene开始,一步一步进行Lucene的应用学习研究.下载初识Snowball Stemmer 1.下载 (1)首先,去Lucne的Apache官网主页 http://lucene. ...
Lucene学习总结之七：Lucene搜索过程解析 2014-06-25 14:23 863人阅读评论(1) 收藏
一.Lucene搜索过程总论搜索的过程总的来说就是将词典及倒排表信息从索引中读出来,根据用户输入的查询语句合并倒排表,得到结果文档集并对文档进行打分的过程. 其可用如下图示: 总共包括以下几个过程: ...
Lucene学习总结之六：Lucene打分公式的数学推导 2014-06-25 14:20 384人阅读评论(0) 收藏
在进行Lucene的搜索过程解析之前,有必要单独的一张把Lucene score公式的推导,各部分的意义阐述一下.因为Lucene的搜索过程,很重要的一个步骤就是逐步的计算各部分的分数. Lucene ...
openresty 学习笔记小结:综合应用实例
openresty 学习笔记小结:综合应用实例这个综合实验实现的功能其实很简单,用户访问一个页面,显示一个默认页面.输入参数(post或者get都可以),如果参数在数据库查询得到并满足一定条件,根据 ...
Apache Lucene学习笔记
Hadoop概述 Apache lucene: 全球第一个开源的全文检索引擎工具包完整的查询引擎和搜索引擎部分文本分析引擎开发人员在此基础建立完整的全文检索引擎以下为转载:http://www ...

随机推荐

AI 强化学习
强化学习(reinforcement learning,简称RL), agent policy state action 目标最大化累计reward 参考链接: https://en.wikipe ...
BZOJ3711 Druzyny 最大值分治、线段树
传送门被暴力包菜了,然而还不会卡-- 有一个很暴力的DP:设\(f_i\)表示给\(1\)到\(i\)分好组最多可以分多少组,转移枚举最后一个组.接下来考虑优化这个暴力. 考虑:对于每一个位置\(i ...
想要开发自己的PHP框架需要那些知识储备？
作者:安正超链接:https://www.zhihu.com/question/26635323/answer/33812516来源:知乎著作权归作者所有.商业转载请联系作者获得授权,非商业转载请注明 ...
git方法 GUI here
注:stage changed是将所有修改归集到一次commit,如果要分开commit,则应该使用ctrl+t来一个一个文件的stage
微信小程序开发编程手记20190303
三元表达式: 运算: 引号与花括号之间如果有空格,将被视为字符串: pages页面容器标签: vscode:
第五章· Redis主从复制介绍
一.Redis主从复制二.Redis主从复制工作机制一.Redis主从复制 Redis复制功能简单介绍 1)使用异步复制.2)一个主服务器可以有多个从服务器.3)从服务器也可以有自己的从服务器.4 ...
JUC (java.util.concurrent)
1.什么是线程?什么是进程? 2.多线程的状态? public enum State { //6种状态 NEW, RUNNABLE, //可运行 BLOCKED, //阻塞 WAITING, //等待 ...
【算法】—— LRU算法
LRU原理 LRU(Least recently used,最近最少使用)算法根据数据的历史访问记录来进行淘汰数据,其核心思想是“如果数据最近被访问过,那么将来被访问的几率也更高”. 实现1 最常见的 ...
求一个数组中重复数字的个数，要求复杂度为O(n)
给出代码 #include <stdio.h> #include <unistd.h> #include <iostream> #include <memor ...
mysql慢查询日志按天切割归纳
问题描述: mysql开启慢查询功能,再正常不过,那么存在这样一种情况:慢查询写入的文件位置和文件名是指定好的,如果慢查询时间设定严苛,不出意外,记录慢查询的单个文件大小会日益增大,几十兆或者上百兆, ...

lucene学习的小结

lucene学习的小结的更多相关文章

随机推荐

热门专题