solr5.5教程－Analyzer、Tokenizer、Filter

对于文本，solr在建立索引和搜索的时候需要对其做一定的处理（比如英文要去掉介词、转成小写、单词原形化等，中文要恰当地要分词）。这些工作，一般由Analyzers、Tokenizers、和Filter来实现。这三个东东配置在fieldType中。下面分别介绍一下

1、analyzer：告诉solr在建立索引和搜索的时候，如何处理text类型的内容，比如要不要去掉“a”、去掉介词、去掉复数，要不要全部变成小写等等……它在schema.xml文件中配置，可以直接指定一个类给它；也可以由tokenizer和filter的组合来实现。

此结点有几个参数：

type：可选参数，index或query，表名这个配置是在建立索引还是在搜索的时候使用
tokenizer：分词器，比如：StandardTokenizerFactory
filter：过滤器，比如：LowerCaseFilterFactory，小写转换

2、tokenizer：在analyzer结点内，指定analyzer的分词器。

3、filter：过滤器，比如：LowerCaseFilterFactory，小写转换

下面是一个配置的例子：

<fieldType name="text_ik" class="solr.TextField">

        <analyzer type="index" useSmart="false">

            <tokenizer class="org.wltea.analyzer.lucene.IKTokenizerFactory"/>

        </analyzer>

        <analyzer type="query" useSmart="true" class="org.wltea.analyzer.lucene.IKAnalyzer"/>

</fieldType>

Tokenizer和Filter的区别：

Tokenizer：接收text（通过从solr那里获得一个reader来读取文本），拆分成tokens，输出token stream
Filter：接收token stream，对每个token进行处理（比如：替换、丢弃、不理），输出token stream

因此，在配置文件中，Tokenizer放在第一位，Filter放在第二位直到最后一位。

对于简单的英文文本，可以这样配置（使用空格分词器，不需要tokenizer和filter）：

<fieldType name="nametext" class="solr.TextField">

    <analyzer class="org.apache.lucene.analysis.WhitespaceAnalyzer"/>

</fieldType>

一般情况下，需要更多的处理，比如：

<fieldType name="nametext" class="solr.TextField">

    <analyzer type="index">

        <tokenizer class="solr.StandardTokenizerFactory"/>

        <filter class="solr.StandardFilterFactory"/>

        <filter class="solr.LowerCaseFilterFactory"/>

        <filter class="solr.StopFilterFactory"/>

        <filter class="solr.EnglishPorterFilterFactory"/>

    </analyzer>

</fieldType>

注：type="index"或"type="query" 这个参数如果没有，则表示两种都适用。

注：那些Factory并不是真正的tokenizer或filter，而是负责创建一个实现tokenizer接口的类。

注：由于filters是顺序执行的，前一个的结果是后一个是输入，所以，一般通用的处理放在前面，特殊的处理靠后

这些tokenizer和filter是顺序执行的，在建索引的情况下，最后一个filter EnglishPorterFilterFactory的输出，就会被用来建立索引。而原文本是不会变的，比如A Red Cow的索引是red, cow，但原文件还是保持Many Cows。

tokenizer和filter的配置还可以接收额外的参数：

<fieldType name="semicolonDelimited" class="solr.TextField">

    <analyzer type="query">

        <tokenizer class="solr.PatternTokenizerFactory" pattern="; "/>

        <filter class="solr.LengthFilterFactory" min="2" max="7"/>

    <analyzer>

</fieldType>

solr5.5教程－Analyzer、Tokenizer、Filter的更多相关文章

Solr 6.7学习笔记（02）-- 配置文件 managed-schema (schema.xml) - Analyzer, tokenizer（4）
有些时候,我们需要自定义 fieldType.下面的例子就是自定义的 fieldType,<analyzer type="index"> 表示索引时怎么处理,<a ...
solr中的Tokenizer Filter
Tokenizer Tokenizer 的工作是将文本流分解为令牌,其中每个令牌(通常)是文本中字符的子序列.分析器知道它配置的字段,但 tokenizer 不是.Tokenizers 从字符流(Re ...
solr5.5教程－tomcat布署
tomcat和solr在各自官网下载,版本如下: tomcat版本:8.0.24 solr版本:5.5.0 1.solr解压后,目录结构如下: 2.tomcat的webapps里新建solr目录, 把 ...
solr5.5教程－solr.home 配置
solr/home是solr实例化core核的依据和入口,是必不可少的配置. 1.在web.xml中设置 <env-entry> <env-entry-name>solr/ho ...
solr5.5教程－schema.xml部分配置
本文章全部内容均翻译自solr自带的配置文件. 1.Field结点说明 name: 必须的,field的名字 type: 必须的,fieldType部分所定义的type的名字 index ...
solr5.5教程－solrconfig.xml，加载schema.xml
布署完成后,接下来要更深入的研究solr的原理和使用. 首先进入testcore这个文件夹下面,发现这个core的conf里并没有schema.xml.那么数据格式是在哪里定义的呢? 打开 solr_ ...
solr5.5教程－tomcat布署（2）
tomcat 布署成功后,接下来就是使用了. 首先要创建一个core. 1.选择右侧菜单, Core Admin -> Add Core. 注意:name自己定义,instanceDir要填写上 ...
ElasticSearch最全分词器比较及使用方法
介绍:ElasticSearch 是一个基于 Lucene 的搜索服务器.它提供了一个分布式多用户能力的全文搜索引擎,基于 RESTful web 接口.Elasticsearch 是用 Java 开 ...
solr学习之六--------Analyzer（分析器）、Tokenizer（分词器）
首先,不知道大家在前面的例子中没有试着搜索文本串,就是在第二节,我们添加了很多文档.如果字段值是一个文本.你如果只搜索这个字段的某个单词,是不是发现搜不到? 这就是因为我们没有配置Analyzer,因 ...

随机推荐

js中cookie的使用详细分析
JavaScript中的另一个机制:cookie,则可以达到真正全局变量的要求. cookie是浏览器提供的一种机制,它将document 对象的cookie属性提供给JavaScript.可以由J ...
[课程设计]Scrum 1.2 Spring 计划&系统流程&DayOne燃尽图
多鱼点餐系统WEB Spring 计划 ● 产品BACKLOG 多鱼点餐系统产品BACKLOG ID Name Imp Est How to demo Notes 1 设计框架结构 10 8 利用美学 ...
C#四种深拷贝方法
//四种深拷贝方法 public static T DeepCopyByReflect<T>(T obj) { //如果是字符串或值类型则直接返回 if (obj is string || ...
webbrowser 禁用 alert
void web_Navigated(object sender, WebBrowserNavigatedEventArgs e) { var web = sender as System.Windo ...
C#调试器导航
本快速入门演示如何在 Visual Studio 调试会话中导航,以及如何在会话中查看和更改程序状态. 本快速入门适用于不熟悉用 Visual Studio 进行调试的开发人员,以及要详细了解在 V ...
ios7 ios8 cell中下划线偏移（separator Insets）处理方法
在ios7中,UITableViewCell左侧会有默认15像素的空白.这时候,设置setSeparatorInset:UIEdgeInsetsZero 能将空白去掉. 但是在ios8中,设置setS ...
Oracle补习班第一天
My life is a straight line, turning only for you. 我的人生是一条直线,为你转弯
Mysql的视图、存储过程、函数、索引全解析
视图是查询命令结果构成的一个虚拟表(非真实存在),其本质是[根据SQL语句获取动态的数据集,并为其命名],用户使用时只需使用[名称]即可获取结果集合,并可以当作表来查询使用. 1创建视图 --格式:C ...
解决java compiler level does not match the version of the installed java project facet
在项目目录的.setting文件夹下的org.eclipse.wst.common.project.facet.core.xml中 <installed facet="java&quo ...
CRM Diagnostics CRM 2016 诊断
http://xxx.xxxxxx.xxx/Organization/tools/diagnostics/diag.aspx

solr5.5教程－Analyzer、Tokenizer、Filter

solr5.5教程－Analyzer、Tokenizer、Filter的更多相关文章

随机推荐

热门专题