Elasticsearch: 权威指南 » 深入搜索 » 多字段搜索

多数字段编辑

全文搜索被称作是 召回率（Recall） 与 精确率（Precision） 的战场： 召回率 ——返回所有的相关文档；精确率 ——不返回无关文档。目的是在结果的第一页中为用户呈现最为相关的文档。

为了提高召回率的效果，我们扩大搜索范围 ——不仅返回与用户搜索词精确匹配的文档，还会返回我们认为与查询相关的所有文档。如果一个用户搜索 “quick brown box” ，一个包含词语 fast foxes 的文档被认为是非常合理的返回结果。

如果包含词语 fast foxes 的文档是能找到的唯一相关文档，那么它会出现在结果列表的最上面，但是，如果有 100 个文档都出现了词语 quick brown fox ，那么这个包含词语 fast foxes 的文档当然会被认为是次相关的，它可能处于返回结果列表更下面的某个地方。当包含了很多潜在匹配之后，我们需要将最匹配的几个置于结果列表的顶部。

提高全文相关性精度的常用方式是为同一文本建立多种方式的索引，每种方式都提供了一个不同的相关度信号 signal 。主字段会以尽可能多的形式的去匹配尽可能多的文档。举个例子，我们可以进行以下操作：

使用词干提取来索引 jumps 、 jumping 和 jumped 样的词，将 jump 作为它们的词根形式。这样即使用户搜索 jumped ，也还是能找到包含 jumping 的匹配的文档。
将同义词包括其中，如 jump 、 leap 和 hop 。
移除变音或口音词：如 ésta 、 está 和 esta 都会以无变音形式 esta 来索引。

尽管如此，如果我们有两个文档，其中一个包含词 jumped ，另一个包含词 jumping ，用户很可能期望前者能排的更高，因为它正好与输入的搜索条件一致。

为了达到目的，我们可以将相同的文本索引到其他字段从而提供更为精确的匹配。一个字段可能是为词干未提取过的版本，另一个字段可能是变音过的原始词，第三个可能使用 shingles 提供词语相似性信息。这些附加的字段可以看成提高每个文档的相关度评分的信号 signals ，能匹配字段的越多越好。

一个文档如果与广度匹配的主字段相匹配，那么它会出现在结果列表中。如果文档同时又与 signal 信号字段匹配，那么它会获得额外加分，系统会提升它在结果列表中的位置。

我们会在本书稍后对同义词、词相似性、部分匹配以及其他潜在的信号进行讨论，但这里只使用词干已提取（stemmed）和未提取（unstemmed）的字段作为简单例子来说明这种技术。

多字段映射编辑

首先要做的事情就是对我们的字段索引两次：一次使用词干模式以及一次非词干模式。为了做到这点，采用 multifields 来实现，已经在 multifields 有所介绍：

DELETE /my_index

PUT /my_index

{

    "settings": { "number_of_shards": 1 },

    "mappings": {

        "my_type": {

            "properties": {

                "title": {

                    "type":     "string",

                    "analyzer": "english",

                    "fields": {

                        "std":   {

                            "type":     "string",

                            "analyzer": "standard"

                        }

                    }

                }

            }

        }

    }

}

拷贝为 CURL 在 SENSE 中查看

	参考被破坏的相关度.
	`title` 字段使用 `english` 英语分析器来提取词干。
	`title.std` 字段使用 `standard` 标准分析器，所以没有词干提取。

接着索引一些文档：

PUT /my_index/my_type/1

{ "title": "My rabbit jumps" }

PUT /my_index/my_type/2

{ "title": "Jumping jack rabbits" }

拷贝为 CURL 在 SENSE 中查看

这里用一个简单 match 查询 title 标题字段是否包含 jumping rabbits （跳跃的兔子）：

GET /my_index/_search

{

   "query": {

        "match": {

            "title": "jumping rabbits"

        }

    }

}

拷贝为 CURL 在 SENSE 中查看

因为有了 english 分析器，这个查询是在查找以 jump 和 rabbit 这两个被提取词的文档。两个文档的 title 字段都同时包括这两个词，所以两个文档得到的评分也相同：

{

  "hits": [

     {

        "_id": "1",

        "_score": 0.42039964,

        "_source": {

           "title": "My rabbit jumps"

        }

     },

     {

        "_id": "2",

        "_score": 0.42039964,

        "_source": {

           "title": "Jumping jack rabbits"

        }

     }

  ]

}

如果只是查询 title.std 字段，那么只有文档 2 是匹配的。尽管如此，如果同时查询两个字段，然后使用 bool 查询将评分结果合并，那么两个文档都是匹配的（ title 字段的作用），而且文档 2 的相关度评分更高（ title.std 字段的作用）：

GET /my_index/_search

{

   "query": {

        "multi_match": {

            "query":  "jumping rabbits",

            "type":   "most_fields",

            "fields": [ "title", "title.std" ]

        }

    }

}

拷贝为 CURL 在 SENSE 中查看

我们希望将所有匹配字段的评分合并起来，所以使用 most_fields 类型。这让 multi_match 查询用 bool 查询将两个字段语句包在里面，而不是使用 dis_max 查询。

{

  "hits": [

     {

        "_id": "2",

        "_score": 0.8226396,

        "_source": {

           "title": "Jumping jack rabbits"

        }

     },

     {

        "_id": "1",

        "_score": 0.10741998,

        "_source": {

           "title": "My rabbit jumps"

        }

     }

  ]

}

文档 2 现在的评分要比文档 1 高。

用广度匹配字段 title 包括尽可能多的文档——以提升召回率——同时又使用字段 title.std 作为信号将相关度更高的文档置于结果顶部。

每个字段对于最终评分的贡献可以通过自定义值 boost 来控制。比如，使 title 字段更为重要，这样同时也降低了其他信号字段的作用：

GET /my_index/_search

{

   "query": {

        "multi_match": {

            "query":       "jumping rabbits",

            "type":        "most_fields",

            "fields":      [ "title^10", "title.std" ]

拷贝为 CURL 在 SENSE 中查看

title 字段的 boost 的值为 10 使它比 title.std 更重要。

https://www.elastic.co/guide/cn/elasticsearch/guide/current/most-fields.html

Elasticsearch: 权威指南 » 深入搜索 » 多字段搜索 » 多数字段 good的更多相关文章

初识Elastic search—附《Elasticsearch权威指南—官方guide的译文》
本文作为Elastic search系列的开篇之作,简要介绍其简要历史.安装及基本概念和核心模块. 简史 Elastic search基于Lucene(信息检索引擎,ES里一个index—索引,一个索 ...
Elasticsearch权威指南（中文版）
Elasticsearch权威指南(中文版) 下载地址: https://pan.baidu.com/s/1bUGJmwS2Gp0B32xUyXxCIw 扫码下面二维码关注公众号回复100010 获取 ...
Elasticsearch: 权威指南（官方教程）
<Elasticsearch 权威指南>中文版序言前言基础入门深入搜索处理人类语言聚合地理位置数据建模管理.监控和部署
Elasticsearch 权威指南
Elasticsearch 权威指南 http://fuxiaopang.gitbooks.io/learnelasticsearch/content/index.html
Elasticsearch 权威指南 NESTAPI地址
Elasticsearch 权威指南:http://fuxiaopang.gitbooks.io/learnelasticsearch/content/index.html NEST:http://n ...
elasticsearch权威指南
elasticsearch权威指南 https://elasticsearch.cn/book/elasticsearch_definitive_guide_2.x/
elasticsearch 权威指南搜索阅读笔记(四)
多索引多type搜索分页搜索每页5条查询一到3页数据第一页:http://127.0.0.1:9200/blogs2/product/_search?size=5&from=0 第二页 ...
IDA Pro 权威指南学习笔记(九) - 数据搜索
Search -> Next Code 命令将光标移动到下一个包含指令的位置 Jump -> Jump to Function 命令可以打开所有函数,可以迅速选择一个函数并导航到该函数所在 ...
ElasticSearch权威指南学习（结构化查询）
请求体查询简单查询语句(lite)是一种有效的命令行adhoc查询.但是,如果你想要善用搜索,你必须使用请求体查询(request body search)API. 空查询我们以最简单的 sear ...
ElasticSearch权威指南学习（映射和分析）
概念映射(mapping)机制用于进行字段类型确认,将每个字段匹配为一种确定的数据类型(string, number, booleans, date等).+ 分析(analysis)机制用于进行全文 ...

随机推荐

linux下挂载U盘
转:http://www.cnblogs.com/yeahgis/archive/2012/04/05/2432779.html linux下挂载U盘一.Linux挂载U盘: 1.插入u盘到计算机, ...
一个简单的基于 DirectShow 的播放器 1（封装类）
DirectShow最主要的功能就是播放视频,在这里介绍一个简单的基于DirectShow的播放器的例子,是用MFC做的,今后有机会可以基于该播放器开发更复杂的播放器软件. 注:该例子取自于<D ...
链路层 - SLIP，PPP，
最常使用的封装格式是RFC 894定义的格式.图2 - 1显示了两种不同形式的封装格式.图中每个方框下面的数字是它们的字节长度. 两种帧格式都采用48 bit(6字节)的目的地址和源地址( 8 0 2 ...
StickyListHeaders的使用
我们知道在ios中字母的导航有悬停的效果,在android中,git上有大神实现了这种悬停的功能,我们只要将普通的Listview改为StickyListHeadersListView然后设置adap ...
Win7笔记本电脑启用虚拟WIFI共享上网
今天看了一个帖子,win7系统通过笔记本的无线网卡,启用虚拟Wifi功能共享上网,自己尝试了一下,感觉很好用,至少没有无线路由的自己,手机可以上wifi了,更新软件玩微信等等,都方便多了,好了,废话不 ...
摄像头ov2685中关于sensor id 设置的相关的寄存器地址
OV2685 : CHIP_ID address : 0x300A default : 0x26 address : 0x300B default : 0x85 address : 0x3 ...
Jedis对Redis的常用命令操作
本篇主要总结一些Jedis对Redis的常用命令操作: 1.对key操作命令 2.对String操作命令 3.对List操作命令 4.对Set操作命令 5.对Hash操作命令 6.排序操作指令一.项 ...
IT轮子系列（六）——Excel上传与解析，一套代码解决所有Excel业务上传，你Get到了吗
前言在日常开发当中,excel的上传与解析是很常见的.根据业务不同,解析的数据模型也都不一样.不同的数据模型也就需要不同的校验逻辑,这往往需要写多套的代码进行字段的检验,如必填项,数据格式.为了避免 ...
linux快速清空文件比如log日志
linux中快速清空文件内容的几种方法这篇文章主要介绍了linux中快速清空文件内容的几种方法,需要的朋友可以参考下权限要求: 至少执行用户对该文件有写的权限 --w------- 1 QA_Dep ...
Factory Method （工厂模式）
什么是工厂设计模式根据名字即可了解,工厂肯定是用来生产产品的,在我们的程序开发中,需要用到不同的类,对于熟悉SSH.SSM开发的可以知道,在初期学习的时候,总是有一个框架提供好的的factory供我 ...

Elasticsearch: 权威指南 » 深入搜索 » 多字段搜索 » 多数字段 good

多数字段编辑

多字段映射编辑

Elasticsearch: 权威指南 » 深入搜索 » 多字段搜索 » 多数字段 good的更多相关文章

随机推荐

热门专题