Lucene 查询分页技术

常用的Lucene查询代码如下所示，该代码的作用是将path路径下的所有索引信息返回

 public String matchAll(String path) {

         try {

             Directory directory = FSDirectory.open(new File(path));

             DirectoryReader reader = DirectoryReader.open(directory);

             IndexSearcher searcher = new IndexSearcher(reader);

             MatchAllDocsQuery query = new MatchAllDocsQuery();

             ScoreDoc[] hits = searcher.search(query, null, Integer.MAX_VALUE).scoreDocs;

             StringBuffer buffer = new StringBuffer();

             for (int i = 0; i < hits.length; i++) {

                 Document hitDocument = searcher.doc(hits[i].doc);

 //                System.out.println(hitDocument.get("key")

 //                        + "......"+hitDocument.get("value"));

                 buffer.append(hitDocument.get("key")+";"+hitDocument.get("value")+"|");

             }

             return buffer.toString();

         } catch (IOException e) {

             e.printStackTrace();

         }

         return null;

     }

但是当该文件夹下索引的数目比较巨大，那么在执行以下代码的时候，则会出现java.lang.OutOfMemoryError: Java heap space的提示

ScoreDoc[] hits = searcher.search(query, null, Integer.MAX_VALUE).scoreDocs;

这时候，我们可以考虑使用分页技术，比如以前大约1亿条数据，我们可以将其分成100个100W的页，每次对100W条索引数据进行处理，这样就可以避免上述情况的发生。在Lucene 中，我们使用searchAfter的方法实现上述功能。它的官方API介绍如下所示：

public TopDocs searchAfter(ScoreDoc after,

                  Query query,

                  int n)

                    throws IOException

Finds the top n hits for query where all results are after a previous result (after).

By passing the bottom result from a previous page as after, this method can be used for efficient 'deep-paging' across potentially large result sets.

Throws:: BooleanQuery.TooManyClauses; IOException

 private String transToContent(IndexSearcher searcher,TopDocs topDocs) throws IOException {

         ScoreDoc[] scoreDocs = topDocs.scoreDocs;

         StringBuffer sb = new StringBuffer();

         for(int i=0; i<scoreDocs.length; i++) {

             Document doc  = searcher.doc(scoreDocs[i].doc);

             sb.append(doc.get("key")+";"+doc.get("value")+"|");

         }

         return sb.toString();

     }

     private void matchAll(String path) {

         try {

             Directory directory = FSDirectory.open(new File(path));

             DirectoryReader reader = DirectoryReader.open(directory);

             IndexSearcher searcher = new IndexSearcher(reader);

             ScoreDoc after = null;

             TopDocs topDocs = searcher.searchAfter(after, new MatchAllDocsQuery(), Preference.PAGE_SIZE);

             int curPage = 1;

             while(topDocs.scoreDocs.length > 0) {

                 System.out.println("Current Page:"+ (curPage++) );

                 System.out.println(transToContent(searcher, topDocs));

                 after = topDocs.scoreDocs[topDocs.scoreDocs.length -1];

                 topDocs = searcher.searchAfter(after, new MatchAllDocsQuery(), Preference.PAGE_SIZE);

             }

         } catch (IOException e) {

             e.printStackTrace();

         }

     }

Lucene 查询分页技术的更多相关文章

lucene 查询+分页+排序
lucene 查询+分页+排序 1.定义一个工厂类 LuceneFactory 1 import java.io.IOException; 2 3 import org.apache.lucene.a ...
关于Lucene全文检索相关技术
Lucene技术专门解决海量数据下的模糊搜索问题. Lucene主要完成的是数据预处理.建立倒排索引,及搜索.排名.高亮显示等功能全文检索相关词语概要: 单词和文档矩阵: 文档(Document): ...
Lucene 查询原理传统二级索引方案倒排链合并倒排索引跳表位图
提问: 1.倒排索引与传统数据库的索引相比优势? 2.在lucene中如果想做范围查找,根据上面的FST模型可以看出来,需要遍历FST找到包含这个range的一个点然后进入对应的倒排链,然后进行求并集 ...
Servlet分页技术
这是看韩顺平老师的servlet视频,自己动手写的,楼主看韩顺平老师的servlet是2006制作的,用的是sql server数据库,自己又用的是oracle数据库,所以怕有的同学遇到同样的问题,不 ...
jsp-------------之分页技术（一）
jsp分页技术之: 如下图:百度的喵看上图中卡哇伊的小苗的爪子下面的数字,就是分页啦!那我们如何做出这样一个效果呢? 下面我们来逐一分解: jsp分页技术一 : (算法) /* int pageS ...
关于Ajax无刷新分页技术的一些研究 c#
关于Ajax无刷新分页技术的一些研究 c# 小弟新手,求大神有更好的解决方案,指教下~ 以前做项目,用过GridView的刷新分页,也用过EasyUI的封装好的分页技术,最近在老项目的基础上加新功能, ...
动态多条件查询分页以及排序(一)--MVC与Entity Framework版url分页版
一.前言多条件查询分页以及排序每个系统里都会有这个的代码做好这块可以大大提高开发效率所以博主分享下自己的6个版本的多条件查询分页以及排序二.目前状况不论是ado.net 还是EF ...
Javaweb 第15天 web练习和分页技术
第15天 web练习和分页技术复习day14内容: 学习新技术的思路? 分析功能的思路? 使用queryRunner操作数据库的步骤? ResultSetHandler接口常用实现类(三个重点)? ...
浅谈Java分页技术
话不多言.我们要实现java分页技术,我们首先就需要定义四个变量,他们是: int pageSize;//每页显示多少条记录 int pageNow;//希望现实第几页 int pageCount; ...

随机推荐

PCAP文件格式分析(做抓包软件之必备)
转载源:http://blog.csdn.net/anzijin/article/details/2008333 http://www.ebnd.cn/2009/09/07/file-format-a ...
ECharts之force力导向布局图——数据源说明及后端API约定
Echarts ? 关于 Echarts 请移步这里 force 力导向图实现方式,如: function require_EC () { require( [ 'echarts', //载入for ...
欢迎来怼第二周Scrum会议六（总第十三次）
一.小组信息队名:欢迎来怼小组成员队长:田继平成员:李圆圆,葛美义,王伟东,姜珊,邵朔,冉华小组照片二.开会信息时间:2017/10/25 17:19~17:35(总计16min).地点:东 ...
对石家庄铁道大学网站UI的分析
作为我们团队的PM,老师对我们提出了一些额外的要求,所以我发表这篇博客来谈一下对石家庄铁道大学网站UI的分析. 首先,PM 对项目所有功能的把握, 特别是UI.最差的UI, 体现了 ...
网页调用vlc并播放网络视频
环境:windows/android/ios windows端保存以下内容为reg文件并运行 Windows Registry Editor Version 5.00 [HKEY_CLASSES_RO ...
prefix pch 中引用cocoapods 中的头文件失败
如题,遇到这个问题,卡了几个小时,记下来防止下次再卡住: 解决办法: 1.pod install, 2.新建pch文件:projectname-Prefix.pch, 3.按要求在工程配置中添加, O ...
asp.net登录状态验证
文章:ASP.NET 登录验证文章:ASP.NET MVC下判断用户登录和授权状态方法文章:.net学习笔记---HttpHandle与HttpModule 第一篇文章,介绍了 1)早期的Base ...
Objective - C 之延展
延展:为已有的类新增私有方法,只能在本类中使用一.创建过程: 二.总结: 1.延展只有.h文件,在其中写新方法的声明,在原本的类(Person)中写方法的实现: 2.上述的方法其实很不安全,因为如果 ...
【转载】mysql建表date类型不能设置默认值
如题,mysql建表date类型的不能设置一个默认值,比如我这样: CREATE TABLE `new_table` ( `biryhday` datetime NULL DEFAULT '1996- ...
App流量测试--使用安卓自身提供的TCP收发长度统计功能
在Linux系统有3个地方保存流量统计文件,对于Android系统同样也适用: (1)在/proc/net/dev下可以查看各个网络接口的收发流量 (等同adb shell cat /proc/pi ...

Lucene 查询分页技术

Lucene 查询分页技术的更多相关文章

随机推荐

热门专题