Lucene和索引

全文索引的原理：
是扫描每个词对每个词创建索引，指明这个词在文章出现的次数和位置

全文检索的流程：
对检索的对象（文章，文档，网页内容）预先建立文档域和索引域，在索引域会分词创建索引，
然后搜索关键词会从索引域查询对应的索引，
根据索引匹配出文档域的内容，获取最后结果。

什么时候用到ik分词器？
1. 关键词搜索时对关键词进行分词，
2. 对文档域和索引域时对索引分词

luncene自带中文分词器：
StandardAnalyzer，CJKAnalyzer ，SmartChineseAnalyzer，自带的不是很符合中国人的分析习惯，而且扩展性不是很好
第三方的中文分词器:paoding --比较好，可惜过时不能用了，mmseg4j --版本跟新太快，企业不喜欢用，IK-analyzer 我们用的比较多
ik分词器的安装：我么创建的是maven工程，使用maven命令进行安装。步骤：将jar包考到某盘如 D盘根目录，使用如下方式安装：
mvn install:install-file -Dfile=你的jar包路径\IKAnalyzer5.3.1.jar -DgroupId=org.wltea.ik-analyzer -DartifactId=ik-analyzer -Dversion=5.3.1.RELEASE -Dpackaging=jar
mvn install:install-file -Dfile=你的jar包路径\IK-Analyzer-extra-5.3.1.jar -DgroupId=org.wltea.ik-analyzer -DartifactId=ik-analyzer-extra -Dversion=5.3.1.RELEASE -Dpackaging=jar

使用步骤：
1.pom 文件依赖
2.导入配置文件：分别将ext.dic,IKAnalyzer.cfg.xml，stopword.dic文件拷贝到工程的resources目录
3. 在代码编写中，使用 ik分词器
直接： Analyzer analyzer = new IKAnalyzer();

创建索引
创建索引分为如下8个步骤：
采集数据从数据库查询数据
2.创建Document文档对象每一条记录对应一个文档
3.创建分析器（分词器）用来提取词汇
4.创建IndexWriterConfig配置信息类索引库配置信息
5.创建Directory对象，声明索引库存储位置
6.创建IndexWriter写入对象写入的是文档对象即数据库中查询到的数据
7.把Document写入到索引库中
8.释放资源
示例代码：
public class CreateIndex {
//创建BookDao实现类的实例，用户采集数据
private BookDao bookDao = new BookDaoImpl();

@Test
public void testCreateIndex() throws Exception {
//数据采集
List<Book> books = bookDao.queryBookList();
List<Document> docs = new ArrayList<Document>();
for (Book book : books) {
//创建文档对象
Document doc = new Document();
doc.add(new TextField("id",book.getId()+"", Field.Store.YES));
doc.add(new TextField("name",book.getName(), Field.Store.YES));
doc.add(new TextField("price",book.getPic()+"", Field.Store.YES));
doc.add(new TextField("pic",book.getPic(), Field.Store.YES));
doc.add(new TextField("desc",book.getDesc(), Field.Store.YES));
docs.add(doc);
}

//创建分词器
Analyzer analyzer = new StandardAnalyzer();

//索引存储位置
Directory directory = FSDirectory.open((new File("D:/index")).toPath());

//IndexWriterConfig配置了IndexWriter对象的参数信息
IndexWriterConfig indexWriterConfig = new IndexWriterConfig(analyzer);

//创建IndexWriter写入对象 Directory d, IndexWriterConfig conf
IndexWriter indexWriter = new IndexWriter(directory,indexWriterConfig);

//将文档写入到索引库
indexWriter.addDocuments(docs);

//提交操作
indexWriter.commit();

//回收资源
indexWriter.close();
}
}

luncene不是搜索引擎不是成品，只是一个工具，solr搜索框架或者es搜索框架才是成品

做SEO时，比如店铺装修时，关键词会优先被搜索引擎捕获

为什么要用全文检索？要么使用索引，但是模糊查询会导致索引失效进行全表扫描，所以使用全文检索方式解决关键词搜索

主键是默认带唯一索引

尝试 500万的记录查询，有索引和没有索引的差别是80 到100倍左右

结构：索引是一种数据结构二叉树，如果五等分每次查询减少80%的查询量
Oracle 的是Btree 索引结构

数据查询的方法：
1.顺序扫描法，直接查询文档，从头到尾查询所有文件和整个内容
2.倒排索引法，相对顺序扫描法的一种说法，不直接查询文档，倒着来，通过查询索引匹配文档得到结果。预先文档域，进行关键词的分词建立索引域，然后我们输入关键词查询时，从索引域去找到分词的索引匹配对应的文档内容，获取最终结果

全文检索技术的应用场景：
单机软件的搜索，如Word 里的搜索
站内搜索
垂直领域的搜索
专业引擎公司

全文索引工作原理：扫描每个词对每个词创建索引，指明这个词在文章出现的次数和位置

Lucene和索引的更多相关文章

lucene写索引出现锁文件的原因之一
lucene正常情况目录下的文件有三个文件. segments.gen segments_a08, 还有一个类似 _uw.cfs名字的东西. 当然,不一定都一样, 但肯定是这三个. 如果出现了很多文 ...
Lucene -- 实时索引
lucene的实时搜索可以分成:实时和近实时的搜索. 实时只能依靠内存了. 近实时可以用lucene中提供org.apache.lucene.index.DirectoryReader.open(In ...
lucene学习笔记：三，Lucene的索引文件格式
Lucene的索引里面存了些什么,如何存放的,也即Lucene的索引文件格式,是读懂Lucene源代码的一把钥匙. 当我们真正进入到Lucene源代码之中的时候,我们会发现: Lucene的索引过程, ...
lucene创建索引简单示例
利用空闲时间写了一个使用lucene创建索引简单示例, 1.使用maven创建的项目 2.需要用到的jar如下: 废话不多说,直接贴代码如下: 1.创建索引的类(HelloLucene): packa ...
如何提高Lucene构建索引的速度
如何提高Lucene构建索引的速度 hans(汉斯) 2013-01-27 10:12 对于Lucene>=2.3:IndexWriter可以自行根据内存使用来释放缓存.调用writer.set ...
Solr4.8.0源码分析(12)之Lucene的索引文件(5)
Solr4.8.0源码分析(12)之Lucene的索引文件(5) 1. 存储域数据文件(.fdt和.fdx) Solr4.8.0里面使用的fdt和fdx的格式是lucene4.1的.为了提升压缩比,S ...
Solr4.8.0源码分析(11)之Lucene的索引文件(4)
Solr4.8.0源码分析(11)之Lucene的索引文件(4) 1. .dvd和.dvm文件 .dvm是存放了DocValue域的元数据,比如DocValue偏移量. .dvd则存放了DocValu ...
Solr4.8.0源码分析(10)之Lucene的索引文件(3)
Solr4.8.0源码分析(10)之Lucene的索引文件(3) 1. .si文件 .si文件存储了段的元数据,主要涉及SegmentInfoFormat.java和Segmentinfo.java这 ...
Solr4.8.0源码分析(9)之Lucene的索引文件(2)
Solr4.8.0源码分析(9)之Lucene的索引文件(2) 一. Segments_N文件一个索引对应一个目录,索引文件都存放在目录里面.Solr的索引文件存放在Solr/Home下的core/ ...
Solr4.8.0源码分析(8)之Lucene的索引文件(1)
Solr4.8.0源码分析(8)之Lucene的索引文件(1) 题记:最近有幸看到觉先大神的Lucene的博客,感觉自己之前学习的以及工作的太为肤浅,所以决定先跟随觉先大神的博客学习下Lucene的原 ...

随机推荐

BUUCTF-Youngter-drive 双线程的思考
拿到后先upx脱壳,然后直接进从上向下看应该是输入慢慢看明显的加密这个函数大概是个加密但是这个sleep函数是什么鬼??? 以下将拓展些许有关"线程"的概念: 一 ...
Mybatis-Plus+Nacos+Dubbo进行远程RPC调用保姆级教程
默认你已经看过我之前的教程了,并且拥有上个教程完成的项目, 之前的教程 https://www.cnblogs.com/leafstar/p/17638782.html 1.在bank1的pom文件中 ...
《SQL与数据库基础》19. 日志
目录日志错误日志二进制日志日志格式日志查看日志删除查询日志慢查询日志本文以 MySQL 为例日志错误日志错误日志是 MySQL 中最重要的日志之一,它记录了当 mysql 启动 ...
influxdb 函数 non_negative_derivative 使用
转载请注明出处: 在InfluxDB中,non_negative_derivative()函数用于计算指定字段的非负导数.它可以用来计算时间序列数据的速率或增长率. 该函数的语法如下: non_neg ...
LeetCode952三部曲之二：小幅度优化(137ms -＞ 122ms，超39% -＞超51%)
欢迎访问我的GitHub 这里分类和汇总了欣宸的全部原创(含配套源码):https://github.com/zq2599/blog_demos 本篇概览本文是<LeetCode952三部曲& ...
响应式编程——初识 Flux 和 Mono
by emanjusaka from https://www.emanjusaka.top/archives/4 彼岸花开可奈何本文欢迎分享与聚合,全文转载请留下原文地址. 前言 Reactor ...
ES13 中11个令人惊叹的 JavaScript 新特性
前言与许多其他编程语言一样,JavaScript 也在不断发展.每年,该语言都会通过新功能变得更加强大,使开发人员能够编写更具表现力和简洁的代码. 小编今天就为大家介绍ES13中添加的最新功能,并查 ...
Linux系列教程——Linux磁盘管理、Linux进程管理、Linux系统服务、 Linux计划任务
@ 目录 1 Linux磁盘管理 1.磁盘的基本概念 1.什么是磁盘 2.磁盘的基本结构 3.磁盘的预备知识 1.磁盘的接口类型 2.磁盘的基本术语 3.磁盘在系统上的命名方式 4.磁盘基本分区Fdi ...
下载、安装CAN-EYE植被参数工具
本文介绍植被指数计算软件CAN-EYE的下载.安装方法. CAN-EYE软件是由法国国家农业研究院(French National Institute of Agricultural Rese ...
一场3天前的cf
啊这次的cf其实水的(指前4题) 题面就不给了awaT1其实就是一个贪心,其实手模一下就好了.可以发现,先让小的那个变大,然后在后面一直让小的加上大的统计一下次数就是答案了.因为如果是这样算的话,两 ...

Lucene和索引

Lucene和索引的更多相关文章

随机推荐

热门专题