Lucene.net 全文检索文件

using Lucene.Net.Analysis;

using Lucene.Net.Analysis.Tokenattributes;

using Lucene.Net.Documents;

using Lucene.Net.Index;

using Lucene.Net.QueryParsers;

using Lucene.Net.Search;

using Lucene.Net.Store;

using System;

using System.Collections.Generic;

using System.IO;

using System.Linq;

using System.Text;

using System.Threading.Tasks;

namespace TestApp

{

    class Program

    {

        static void Main()

        {

            #region 查词

            StringBuilder sb = new StringBuilder();

            //索引库目录

            Lucene.Net.Store.Directory dir_search = FSDirectory.Open(new System.IO.DirectoryInfo("IndexDir"), new NoLockFactory());

            IndexReader reader = IndexReader.Open(dir_search, true);

            IndexSearcher search = null;

            try

            {

                search = new IndexSearcher(reader);

                QueryParser parser = new QueryParser(Lucene.Net.Util.Version.LUCENE_30, "body", new PanGuAnalyzer());

                Query query = parser.Parse(LuceneHelper.GetKeyWordSplid("文章"));

                //执行搜索，获取查询结果集对象

                TopDocs ts = search.Search(query, null, );

                ///获取命中的文档信息对象

                ScoreDoc[] docs = ts.ScoreDocs;

                for (int i = ; i < docs.Length; i++)

                {

                    int docId = docs[i].Doc;

                    Document doc = search.Doc(docId);

                    var t = doc.Get("number");

                    Console.WriteLine(t);

                    var b = doc.Get("body");

                    Console.WriteLine(b);

                }

            }

            catch (Exception ex)

            {

                throw;

            }

            finally

            {

                if (search != null)

                    search.Dispose();

                if (dir_search != null)

                    dir_search.Dispose();

            }

            #endregion

        }

        //帮助类，对搜索的关键词进行分词

        public static class LuceneHelper

        {

            public static string GetKeyWordSplid(string keywords)

            {

                StringBuilder sb = new StringBuilder();

                Analyzer analyzer = new PanGuAnalyzer();

                TokenStream stream = analyzer.TokenStream(keywords, new StringReader(keywords));

                ITermAttribute ita = null;

                bool hasNext = stream.IncrementToken();

                while (hasNext)

                {

                    ita = stream.GetAttribute<ITermAttribute>();

                    sb.Append(ita.Term + " ");

                    hasNext = stream.IncrementToken();

                }

                return sb.ToString();

            }

        }

        /// <summary>

        /// 创建索引文件

        /// </summary>

        private static void CreateIndex()

        {

            IndexWriter writer = null;

            Analyzer analyzer = new PanGuAnalyzer();

            Lucene.Net.Store.Directory dir = FSDirectory.Open(new System.IO.DirectoryInfo("../ItemIndexDir"));

            try

            {

                ////IndexReader:对索引进行读取的类。

                //该语句的作用：判断索引库文件夹是否存在以及索引特征文件是否存在。

                bool isCreate = !IndexReader.IndexExists(dir);

                writer = new IndexWriter(dir, analyzer, isCreate, IndexWriter.MaxFieldLength.UNLIMITED);

                //添加索引

                for (int i = ; i <= ; i++)

                {

                    Document doc = new Document();

                    string path = System.IO.Directory.GetParent(System.IO.Directory.GetCurrentDirectory()).Parent.FullName + @"\Data\Test\" + i + ".txt";

                    string text = File.ReadAllText(path, Encoding.Default);

                    //Field.Store.YES:表示是否存储原值。只有当Field.Store.YES在后面才能用doc.Get("number")取出值来.Field.Index. NOT_ANALYZED:不进行分词保存

                    doc.Add(new Field("number", i.ToString(), Field.Store.YES, Field.Index.NOT_ANALYZED));

                    // Lucene.Net.Documents.Field.TermVector.WITH_POSITIONS_OFFSETS:不仅保存分词还保存分词的距离。

                    doc.Add(new Field("body", text, Field.Store.YES, Field.Index.ANALYZED, Field.TermVector.WITH_POSITIONS_OFFSETS));

                    writer.AddDocument(doc);

                }

                writer.Optimize();

            }

            catch (Exception ex)

            {

                throw;

            }

            finally

            {

                if (writer != null)

                    writer.Dispose();

                if (dir != null)

                    dir.Dispose();

            }

        }

    }

}

Lucene.net 全文检索文件的更多相关文章

lucene解决全文检索word2003，word2007的办法
在上一篇文章中 ,lucene只能全文检索word2003,无法检索2007,并且只能加载部分内容,无法加载全文内容.为解决此问题,找到了如下方法 POI 读取word (word 2003 和 wo ...
Solr4.8.0源码分析(10)之Lucene的索引文件(3)
Solr4.8.0源码分析(10)之Lucene的索引文件(3) 1. .si文件 .si文件存储了段的元数据,主要涉及SegmentInfoFormat.java和Segmentinfo.java这 ...
JAVAEE——Lucene基础：什么是全文检索、Lucene实现全文检索的流程、配置开发环境、索引库创建与管理
1. 学习计划第一天:Lucene的基础知识 1.案例分析:什么是全文检索,如何实现全文检索 2.Lucene实现全文检索的流程 a) 创建索引 b) 查询索引 3.配置开发环境 4.创建索引库 5 ...
Solr4.8.0源码分析(12)之Lucene的索引文件(5)
Solr4.8.0源码分析(12)之Lucene的索引文件(5) 1. 存储域数据文件(.fdt和.fdx) Solr4.8.0里面使用的fdt和fdx的格式是lucene4.1的.为了提升压缩比,S ...
Solr4.8.0源码分析(11)之Lucene的索引文件(4)
Solr4.8.0源码分析(11)之Lucene的索引文件(4) 1. .dvd和.dvm文件 .dvm是存放了DocValue域的元数据,比如DocValue偏移量. .dvd则存放了DocValu ...
Solr4.8.0源码分析(9)之Lucene的索引文件(2)
Solr4.8.0源码分析(9)之Lucene的索引文件(2) 一. Segments_N文件一个索引对应一个目录,索引文件都存放在目录里面.Solr的索引文件存放在Solr/Home下的core/ ...
Solr4.8.0源码分析(8)之Lucene的索引文件(1)
Solr4.8.0源码分析(8)之Lucene的索引文件(1) 题记:最近有幸看到觉先大神的Lucene的博客,感觉自己之前学习的以及工作的太为肤浅,所以决定先跟随觉先大神的博客学习下Lucene的原 ...
Lucene的全文检索学习
Lucene的官方网站(Apache的顶级项目):http://lucene.apache.org/ 1.什么是Lucene? Lucene 是 apache 软件基金会的一个子项目,由 Doug C ...
基于Lucene的全文检索实践
由于项目的需要,使用到了全文检索技术,这里将前段时间所做的工作进行一个实践总结,方便以后查阅.在实际的工作中,需要灵活的使用lucene里面的查询技术,以达到满足业务要求与搜索性能提升的目的. 一.全 ...

随机推荐

安装Oracle客户端寻找配置文件tnsnames.ora
# tnsnames.ora Network Configuration File: D:\app\Administrator\product\11.2.0\dbhome_1\network\admi ...
C盘满了如何清理
一.C:\inetpub\logs\LogFiles\ 中的日志文件可以全部删除二.C盘上右键>属性>磁盘清理和系统磁盘清理三.百度下载:魔方清理大师>逐项清理四.卸载较大的不常 ...
js取当前页面名称
// 取当前页面名称(不带后缀名) function pageName() { var a = location.href; var b = a.split(& ...
mysql索引提高查询速度
使用索引提高查询速度 1.前言在web开发中,业务模版,业务逻辑(包括缓存.连接池)和数据库这三个部分,数据库在其中负责执行SQL查询并返回查询结果,是影响网站速度最重要的性能瓶颈.本文主要针对My ...
jdk8 jvm配置参数说明
这些选项是特定于Java HotSpot虚拟机的通用选项.-X 显示所有可用-X选项的帮助. -Xbatch 禁用后台编译.默认情况下,JVM将该方法编译为后台任务,以解释器模式运行该方法,直到后台编 ...
2015湖南湘潭 D 二分
2015湖南湘潭第七届大学生程序设计比赛 D题 Fraction Accepted : 133 Submit : 892 Time Limit : 1000 MS Memory Limit : ...
关于apicloud图片缓存
imageCache如果是同一个地址,得到的缓存文件名字是一样的.可能是对url md5了一下. apicloud目前有两种清除方式1 一种是api.clearCache 另一种方法当然是强大的 ...
hadoop 学习（四）之java操作hdfs
1.导入hadoop jar包将hadoop/share/common/目录.hadoop/share/common/lib/目录.hadoop/hdfs/目录.下的jar包加入eclipse. 2 ...
KOBAS
1. What is KOBAS 3.0? KOBAS (KEGG Orthology Based Annotation System) is a web server for gene/protei ...
2018.09.10 loj#10172. 涂抹果酱（状压dp）
传送门三进制状压感觉有点难写啊. 不过这题状态转移方程挺简单的. 就直接f[i][j]表示前i行第i行状态为j时的选法总数,分情况转移就行了. 代码: #include<bits/stdc++ ...

Lucene.net 全文检索文件

Lucene.net 全文检索文件的更多相关文章

随机推荐

热门专题