Lucence.Net学习+盘古分词

创建索引库

//读取文件，存储到索引库

public string CreateDatebase()

{

//获取索引库的路径

var indexPath = AppDomain.CurrentDomain.BaseDirectory + ConfigurationManager.AppSettings["IndexDateBase"];

FSDirectory directory = FSDirectory.Open(new DirectoryInfo(indexPath), new NoLockFactory());

IndexReader reader = IndexReader.Open(directory, true);

var searcher = new IndexSearcher(reader);

//搜索条件

var query = new PhraseQuery();

foreach (string word in GetPanGuAnalyzer(str))//先用空格，让用户去分词，空格分隔的就是词“计算机专业”

{

query.Add(new Term("body", word));

}

//组成词的字之间可以允许的距离

query.SetSlop(5);

TopScoreDocCollector collector = TopScoreDocCollector.create(1000, true);

searcher.Search(query, null, collector);//根据query查询条件进行查询，查询结果放入collector容器

ScoreDoc[] docs = collector.TopDocs(0, collector.GetTotalHits()).scoreDocs;//得到所有查询结果中的文档,GetTotalHits():表示总条数 TopDocs(300, 20);//表示得到300（从300开始），到320（结束）的文档内容.

var list = new List<string>();

for (int i = 0; i < docs.Length; i++)

{

int docId = docs[i].doc;//得到查询结果文档的id（Lucene内部分配的id）

Document doc = searcher.Doc(docId);//找到文档id对应的文档详细信息

var _str = doc.Get("body");

list.Add(_str);

}

ViewBag.List = list;

return View();

}

进行搜索

public ActionResult List(string str)

{

//获取索引库的路径

var indexPath = AppDomain.CurrentDomain.BaseDirectory + ConfigurationManager.AppSettings["IndexDateBase"];

FSDirectory directory = FSDirectory.Open(new DirectoryInfo(indexPath), new NoLockFactory());

IndexReader reader = IndexReader.Open(directory, true);

var searcher = new IndexSearcher(reader);

//搜索条件

var query = new PhraseQuery();

foreach (string word in GetPanGuAnalyzer(str))//先用空格，让用户去分词，空格分隔的就是词“计算机专业”

{

query.Add(new Term("body", word));

}

//组成词的字之间可以允许的距离

query.SetSlop(5);

TopScoreDocCollector collector = TopScoreDocCollector.create(1000, true);

searcher.Search(query, null, collector);//根据query查询条件进行查询，查询结果放入collector容器

var list = new List<string>();

for (int i = 0; i < docs.Length; i++)

{

int docId = docs[i].doc;//得到查询结果文档的id（Lucene内部分配的id）

Document doc = searcher.Doc(docId);//找到文档id对应的文档详细信息

var _str = doc.Get("body");

list.Add(_str);

}

ViewBag.List = list;

return View();

}

/// 对传递过来的字符串进行盘古分词

/// </summary>

/// <returns></returns>

public static List<string> GetPanGuAnalyzer(string txt)

{

List<string> list = new List<string>();

Analyzer analyzer = new PanGuAnalyzer();

TokenStream tokenStream = analyzer.TokenStream("", new StringReader(txt));

Lucene.Net.Analysis.Token token = null;

while ((token = tokenStream.Next()) != null)

{

list.Add(token.TermText());

}

return list;

}

IndexReader 删除数据

//获取字典

var directory = LucenceHelp.GetDirectory();

//先删除数据

IndexReader reader = IndexReader.Open(directory);

reader.DeleteDocuments(new Term("number", "0"));

reader.IsOptimized();

reader.Close();

IndexWriter 删除数据

//获取字典

var directory = LucenceHelp.GetDirectory();

var writer = new IndexWriter(directory, new PanGuAnalyzer(), false, IndexWriter.MaxFieldLength.UNLIMITED);

//删除的是与要匹配的关键字相关的文件

var term = new Term("body", name);

//删除的是文件名为13的文件

//var term = new Term("number", "13");

writer.DeleteDocuments(term);

writer.Optimize();

writer.Close();

修改索引

Analyzer analyzer = new PanGuAnalyzer();

//获取字典

var directory = LucenceHelp.GetDirectory();

//先删除数据

IndexReader reader = IndexReader.Open(directory);

reader.DeleteDocuments(new Term("number", "0"));

reader.Close();

//再添加数据

IndexWriter writer = new IndexWriter(directory, analyzer, false, IndexWriter.MaxFieldLength.LIMITED);

Document document = new Document();

document.Add(new Field("number", "0", Field.Store.YES, Field.Index.ANALYZED));

document.Add(new Field("body", "如家快捷酒店-0", Field.Store.YES, Field.Index.ANALYZED));

writer.AddDocument(document);

writer.Close();

要添加的文件

Lucence.Net学习+盘古分词的更多相关文章

lucence.net+盘古分词
第一步: 添加盘古和lucence的dll引用第二步: 拷贝Dict文件夹到项目 demo里面是Dictionaries 不过官方建议改成Dict 然后把所有项右击属性改为“如果较新则复制” 第 ...
Lucene.net入门学习（结合盘古分词）
Lucene简介 Lucene是apache软件基金会4 jakarta项目组的一个子项目,是一个开放源代码的全文检索引擎工具包,即它不是一个完整的全文检索引擎,而是一个全文检索引擎的架构,提供了完整 ...
Lucene.Net3.0.3+盘古分词器学习使用
一.Lucene.Net介绍 Lucene.net是Lucene的.net移植版本,是一个开源的全文检索引擎开发包,即它不是一个完整的全文检索引擎,而是一个全文检索引擎的架构,提供了完整的查询引擎和索 ...
Lucene.net入门学习（结合盘古分词）（转载）
作者:释迦苦僧出处:http://www.cnblogs.com/woxpp/p/3972233.html 本文版权归作者和博客园共有,欢迎转载,但未经作者同意必须保留此段声明,且在文章页面明显 ...
站内搜索——Lucene +盘古分词
为了方便的学习站内搜索,下面我来演示一个MVC项目. 1.首先在项目中[添加引入]三个程序集和[Dict]文件夹,并新建一个[分词内容存放目录] Lucene.Net.dll.PanGu.dll.Pa ...
Lucene.Net+盘古分词
前言各位朋友,谢谢大家的支持,由于文件过大,有考虑到版权的问题,故没有提供下载,本人已建立一个搜索技术交流群:77570783,源代码已上传至群共享,需要的朋友,请自行下载! 首先自问自答几个问题, ...
完整的站内搜索Demo(Lucene.Net+盘古分词)
前言首先自问自答几个问题,以让各位看官了解写此文的目的什么是站内搜索?与一般搜索的区别? 很多网站都有搜索功能,很多都是用SQL语句的Like实现的,但是Like无法做到模糊匹配(例如我搜索“.n ...
lucene.net 3.0.3、结合盘古分词进行搜索的小例子(转)
lucene.net 3.0.3.结合盘古分词进行搜索的小例子(分页功能) 添加:2013-12-25 更新:2013-12-26 新增分页功能. 更新:2013-12-27 新增按分类查询功能, ...
完整的站内搜索实战应用(Lucene.Net+盘古分词)
首先自问自答几个问题,以让各位看官了解写此文的目的什么是站内搜索?与一般搜索的区别? 多网站都有搜索功能,很多都是用SQL语句的Like实现的,但是Like无法做到模糊匹配(例如我搜索". ...

随机推荐

iOS深入学习（Block全面分析）
本文翻译自苹果的文档,有删减,也有添加自己的理解部分. 如果有Block语法不懂的,可以参考fuckingblocksyntax,里面对于Block 为了方便对比,下面的代码我假设是写在ViewCon ...
EF 4.0 更新数据时候的一个错误及其处理
错误如图: 修改下方法后可以进行更新了.但是中间多了一步查询 /// <summary> /// 更新一个产品分类 /// </summary> /// <param n ...
oracle 导入txt
没有Oraclehoume的情况下,执行下环境变量文件 sqlldr userid= DM/DM control = /home/oracle/libc/load.ctl load data infi ...
Asp.Net MVC 控制器
原文链接:http://www.asp.net/learn/mvc/ 这篇教程探索了ASP.NET MVC控制器(controller).控制器动作(controller action)和动作结果(a ...
一个JAVA代码
public class HelloJava { public static void main(String[] args) { System.out.println("这"); ...
ViEmu for VS2013-3.2.1 破解(转)
ViEmuVS2013-3.2.1 破解 VS升级到2013后,作为一个Vimer,自然需要更新最新的ViEmu插件,因为现在离了Vim,写代码已经寸步难行了. ViEmu 3.2.1的破解其实和 ...
C/C++中使用的正则表达式库
正则表达式正则表达式是对字符串操作的一种逻辑公式,就是用事先定义好的一些特定字符.及这些特定字符的组合,组成一个“规则字符串”,这个“规则字符串”用来表达对字符串的一种过滤逻辑. 正则引擎主要可以分 ...
随机数、continue、break
arc4random() — 返回一个随机数(无符号整型). 如果要随机一个 [a, b]范围内的整数公式:arc4random() % (b - a + 1) + a; #include &l ...
java 键盘输入多种方法 .(转载)
一.java不像C中拥有scanf这样功能强大的函数,大多是通过定义输入输出流对象.常用的类有BufferedReader,Scanner. 实例程序: 1.利用 Scanner 实现从键盘读入int ...
div图片垂直居中
div相对与table对于图片的垂直居中支持的并不好,特别对于不同浏览器的兼容性来说,这里我们看下一个简洁的css解决方法: 在曾经的淘宝UED 招聘中有这样一道题目: “使用纯CSS实现未知尺寸 ...

Lucence.Net学习+盘古分词

Lucence.Net学习+盘古分词的更多相关文章

随机推荐

热门专题