lucene学习的小结

pom.xml设置

    <dependency>

        <groupId>junit</groupId>

        <artifactId>junit</artifactId>

        <version>4.12</version>

        <scope>test</scope>

    </dependency>

      <dependency>

        <groupId>org.apache.lucene</groupId>

        <artifactId>lucene-core</artifactId>

        <version>5.3.1</version>

    </dependency>

    <dependency>

    <groupId>org.apache.lucene</groupId>

        <artifactId>lucene-queryparser</artifactId>

        <version>5.3.1</version>

    </dependency>

    <dependency>

        <groupId>org.apache.lucene</groupId>

        <artifactId>lucene-analyzers-common</artifactId>

        <version>5.3.1</version>

    </dependency>

    <dependency>

        <groupId>org.apache.lucene</groupId>

        <artifactId>lucene-analyzers-smartcn</artifactId>

        <version>5.3.1</version>

    </dependency>

    <dependency>

        <groupId>org.apache.lucene</groupId>

        <artifactId>lucene-highlighter</artifactId>

        <version>5.3.1</version>

    </dependency>

生成索引IndexingTest.java

package com.chabansheng.lucene;

import java.nio.file.Paths;

import ...;public class IndexingTest {

    private String ids[]={"1","2","3","4"};

    private String authors[]={"Jack","Marry","John","Json"};

    private String positions[]={"accounting","technician","salesperson","boss"};

    private String titles[]={"Java is a good language.","Java is a cross platform language","Java powerful","You should learn java"};

    private String contents[]={

            "If possible, use the same JRE major version at both index and search time.",

            "When upgrading to a different JRE major version, consider re-indexing. ",

            "Different JRE major versions may implement different versions of Unicode,",

            "For example: with Java 1.4, `LetterTokenizer` will split around the character U+02C6,"

    };

    private Directory dir;

    /**

     * 生成索引

     * @throws Exception

     */

    @Test

    public void index()throws Exception{

        dir=FSDirectory.open(Paths.get("D:\\lucene3"));

        //获取IndexWriter实例

        Analyzer analyzer=new StandardAnalyzer(); // 标准分词器

        IndexWriterConfig iwc=new IndexWriterConfig(analyzer);

        IndexWriter writer=new IndexWriter(dir, iwc);

        for(int i=0;i<ids.length;i++){

            Document doc=new Document();

            doc.add(new StringField("id", ids[i], Field.Store.YES));

            doc.add(new StringField("author",authors[i],Field.Store.YES));

            doc.add(new StringField("position",positions[i],Field.Store.YES));

            // 加权操作

            TextField field=new TextField("title", titles[i], Field.Store.YES);

            if("boss".equals(positions[i])){

                field.setBoost(1.5f);

            }

            doc.add(field);

            doc.add(new TextField("content", contents[i], Field.Store.NO));

            writer.addDocument(doc); // 添加文档

        }

        writer.close();

    }

    /**

     * 查询索引方式一

     * @throws Exception

     */

    @Test

    public void search()throws Exception{

        dir=FSDirectory.open(Paths.get("D:\\lucene"));

        IndexReader reader=DirectoryReader.open(dir);

        IndexSearcher is=new IndexSearcher(reader);

        String searchField="title";

        String q="java";

        //Term方式查询

        Term t=new Term(searchField,q);

        Query query=new TermQuery(t);

        TopDocs hits=is.search(query, 10);

        System.out.println("匹配 '"+q+"'，总共查询到"+hits.totalHits+"个文档");

        for(ScoreDoc scoreDoc:hits.scoreDocs){

            Document doc=is.doc(scoreDoc.doc);

            System.out.println(doc.get("author"));

        }

        reader.close();

    }

}

查询索引方式二Searcher.java

package com.chabansheng.lucene;

import java.io.StringReader;

import java.nio.file.Paths;

import ...;public class Searcher {

    public static void search(String indexDir,String q)throws Exception{

        Directory dir=FSDirectory.open(Paths.get(indexDir));

        IndexReader reader=DirectoryReader.open(dir);

        IndexSearcher is=new IndexSearcher(reader);

        //QueryParser查询方式

        // Analyzer analyzer=new StandardAnalyzer(); // 标准分词器

        SmartChineseAnalyzer analyzer=new SmartChineseAnalyzer();

        QueryParser parser=new QueryParser("desc", analyzer);

        Query query=parser.parse(q);

        TopDocs hits=is.search(query, 10);

        //高亮行号

        QueryScorer scorer=new QueryScorer(query);

        Fragmenter fragmenter=new SimpleSpanFragmenter(scorer);

        SimpleHTMLFormatter simpleHTMLFormatter=new SimpleHTMLFormatter("<b><font color='red'>","</font></b>");

        Highlighter highlighter=new Highlighter(simpleHTMLFormatter, scorer);

        highlighter.setTextFragmenter(fragmenter);

        for(ScoreDoc scoreDoc:hits.scoreDocs){

            Document doc=is.doc(scoreDoc.doc);

            System.out.println(doc.get("city"));

            System.out.println(doc.get("desc"));

            String desc=doc.get("desc");

            if(desc!=null){

                TokenStream tokenStream=analyzer.tokenStream("desc", new StringReader(desc));

                System.out.println(highlighter.getBestFragment(tokenStream, desc));

            }

        }

        reader.close();

    }

    public static void main(String[] args) {

        String indexDir="D:\\lucene2";

        String q="南京文明";

        try {

            search(indexDir,q);

        } catch (Exception e) {

            // TODO Auto-generated catch block

            e.printStackTrace();

        }

    }

}

package com.chabansheng.lucene;
import java.nio.file.Paths;
import org.apache.lucene.analysis.Analyzer;import org.apache.lucene.analysis.standard.StandardAnalyzer;import org.apache.lucene.document.Document;import org.apache.lucene.document.Field;import org.apache.lucene.document.StringField;import org.apache.lucene.document.TextField;import org.apache.lucene.index.DirectoryReader;import org.apache.lucene.index.IndexReader;import org.apache.lucene.index.IndexWriter;import org.apache.lucene.index.IndexWriterConfig;import org.apache.lucene.index.Term;import org.apache.lucene.search.IndexSearcher;import org.apache.lucene.search.Query;import org.apache.lucene.search.ScoreDoc;import org.apache.lucene.search.TermQuery;import org.apache.lucene.search.TopDocs;import org.apache.lucene.store.Directory;import org.apache.lucene.store.FSDirectory;import org.junit.Test;
public class IndexingTest {
private String ids[]={"1","2","3","4"};private String authors[]={"Jack","Marry","John","Json"};private String positions[]={"accounting","technician","salesperson","boss"};private String titles[]={"Java is a good language.","Java is a cross platform language","Java powerful","You should learn java"};private String contents[]={"If possible, use the same JRE major version at both index and search time.","When upgrading to a different JRE major version, consider re-indexing. ","Different JRE major versions may implement different versions of Unicode,","For example: with Java 1.4, `LetterTokenizer` will split around the character U+02C6,"};private Directory dir;/** * 生成索引 * @throws Exception */@Testpublic void index()throws Exception{dir=FSDirectory.open(Paths.get("D:\\lucene3"));//获取IndexWriter实例Analyzer analyzer=new StandardAnalyzer(); // 标准分词器IndexWriterConfig iwc=new IndexWriterConfig(analyzer);IndexWriter writer=new IndexWriter(dir, iwc);for(int i=0;i<ids.length;i++){Document doc=new Document();doc.add(new StringField("id", ids[i], Field.Store.YES));doc.add(new StringField("author",authors[i],Field.Store.YES));doc.add(new StringField("position",positions[i],Field.Store.YES));// 加权操作TextField field=new TextField("title", titles[i], Field.Store.YES);if("boss".equals(positions[i])){field.setBoost(1.5f);}doc.add(field);doc.add(new TextField("content", contents[i], Field.Store.NO));writer.addDocument(doc); // 添加文档}writer.close();}
/** * 查询 * @throws Exception */@Testpublic void search()throws Exception{dir=FSDirectory.open(Paths.get("D:\\lucene3"));IndexReader reader=DirectoryReader.open(dir);IndexSearcher is=new IndexSearcher(reader);String searchField="title";String q="java";//Term方式查询Term t=new Term(searchField,q);Query query=new TermQuery(t);TopDocs hits=is.search(query, 10);System.out.println("匹配 '"+q+"'，总共查询到"+hits.totalHits+"个文档");for(ScoreDoc scoreDoc:hits.scoreDocs){Document doc=is.doc(scoreDoc.doc);System.out.println(doc.get("author"));}reader.close();}}

lucene学习的小结的更多相关文章

Lucene学习笔记（更新）
1.Lucene学习笔记 http://www.cnblogs.com/hanganglin/articles/3453415.html
Lucene学习总结之七：Lucene搜索过程解析
一.Lucene搜索过程总论搜索的过程总的来说就是将词典及倒排表信息从索引中读出来,根据用户输入的查询语句合并倒排表,得到结果文档集并对文档进行打分的过程. 其可用如下图示: 总共包括以下几个过程: ...
Lucene学习总结之六：Lucene打分公式的数学推导
在进行Lucene的搜索过程解析之前,有必要单独的一张把Lucene score公式的推导,各部分的意义阐述一下.因为Lucene的搜索过程,很重要的一个步骤就是逐步的计算各部分的分数. Lucene ...
Lucene学习-深入Lucene分词器,TokenStream获取分词详细信息
Lucene学习-深入Lucene分词器,TokenStream获取分词详细信息在此回复牛妞的关于程序中分词器的问题,其实可以直接很简单的在词库中配置就好了,Lucene中分词的所有信息我们都可以从 ...
Lucene学习入门——下载初识
本文从官网下载Lucene开始,一步一步进行Lucene的应用学习研究.下载初识Snowball Stemmer 1.下载 (1)首先,去Lucne的Apache官网主页 http://lucene. ...
Lucene学习总结之七：Lucene搜索过程解析 2014-06-25 14:23 863人阅读评论(1) 收藏
一.Lucene搜索过程总论搜索的过程总的来说就是将词典及倒排表信息从索引中读出来,根据用户输入的查询语句合并倒排表,得到结果文档集并对文档进行打分的过程. 其可用如下图示: 总共包括以下几个过程: ...
Lucene学习总结之六：Lucene打分公式的数学推导 2014-06-25 14:20 384人阅读评论(0) 收藏
在进行Lucene的搜索过程解析之前,有必要单独的一张把Lucene score公式的推导,各部分的意义阐述一下.因为Lucene的搜索过程,很重要的一个步骤就是逐步的计算各部分的分数. Lucene ...
openresty 学习笔记小结:综合应用实例
openresty 学习笔记小结:综合应用实例这个综合实验实现的功能其实很简单,用户访问一个页面,显示一个默认页面.输入参数(post或者get都可以),如果参数在数据库查询得到并满足一定条件,根据 ...
Apache Lucene学习笔记
Hadoop概述 Apache lucene: 全球第一个开源的全文检索引擎工具包完整的查询引擎和搜索引擎部分文本分析引擎开发人员在此基础建立完整的全文检索引擎以下为转载:http://www ...

随机推荐

vue slot插槽的使用
slot插槽的使用场景父组件向子组件传递dom时会用到插槽作用域插槽:当同一个子组件想要在不同的父组件里展示不同的状态,可以使用作用域插槽.展示的状态由父组件来决定注:想要修改父组件向子 ...
微信小程序遍历Echarts图表，实现多个饼图
如何在微信小程序中使用Echarts可以看我的另一个教程:点击查看首先看一个简单的例子 1.wxml文件 <view style='width:100%;height:200rpx'> ...
DOTween坑点
Sequence相关如实现一个物体有序列的运动,A->B->C,需要实例化Sequence与实现方法在同一处调用. Sequence m_Sequence; void SequenceM ...
Spring 使用AOP——基于注解配置
首先,使用注解实现AOP是基于AspectJ方式的. 创建包含切点方法的类 package cn.ganlixin.test; import org.aspectj.lang.annotation.P ...
Google Closure Compiler高级压缩混淆Javascript代码
一.背景前端开发中,特别是移动端,Javascript代码压缩已经成为上线必备条件. 如今主流的Js代码压缩工具主要有: 1)Uglify http://lisperator.net/uglifyj ...
Python——hashilib 模块（哈希模块）
hashilib 模块摘要算法 import hashlib # 提供摘要算法的模块 md5 = hashlib.md5() md5.update(b'alex3714') print(md5.he ...
Django 框架基础
Python web框架本质收发socket消息 --> 按照HTTP协议消息格式去解析消息路径和要执行的函数的对应关系 --> 主要的业务逻辑字符串替换 --> 模板(特殊 ...
Disconf 分布式配置管理平台（安装配置）
Disconf 分布式配置管理平台(安装配置) 依赖环境 Nginx:处理静态资源请求.动态请求转发到Tomcat Tomcat:处理Nginx的请求 Redis:用户session管理 MySQL: ...
[hashcat]基于字典和暴力破解尝试找到rar3-hp的压缩包密码
1.使用rar2john找到md5 2.基于字典 hashcat -a 0 -m 12500 /root/Desktop/md5.txt /usr/share/wordlists/weakpass.t ...
mysql shell 定时备份
#!/bin/sh if [ ! -d "/data/backup" ]; then mkdir -p /data/backup fi db_user=" ...

lucene学习的小结

lucene学习的小结的更多相关文章

随机推荐

热门专题