常用术语查询

该common术语查询是一个现代的替代提高了精确度和搜索结果的召回（采取禁用词进去），在不牺牲性能的禁用词。

问题

查询中的每个术语都有成本。搜索"The brown fox" 需要三个术语查询，每个查询一个"the"，"brown"并且 "fox"所有查询都针对索引中的所有文档执行。查询"the"可能与许多文档匹配，因此对相关性的影响比其他两个术语小得多。

以前，这个问题的解决方案是忽略高频率的术语。通过将其"the"视为停用词，我们减少了索引大小并减少了需要执行的术语查询的数量。

这种方法的问题在于，虽然停用词对相关性的影响很小，但它们仍然很重要。如果我们删除了停用词，我们就会失去精确度（例如，我们无法区分"happy" 和"not happy"），并且我们会失去回忆（例如，文本在索引中"The The"或者 "To be or not to be"根本不存在）。

解决方案

该common术语的查询将所述查询术语分为两组：更重要（即低频率而言）和不太重要的（即，高频率而言这将先前已停用词）。

首先，它搜索与更重要的术语匹配的文档。这些术语出现在较少的文档中，对相关性有较大影响。

然后，它对不太重要的术语执行第二次查询 - 这些术语经常出现并且对相关性的影响很小。但是，它不是计算所有匹配文档的相关性分数，而是仅计算_score已经与第一个查询匹配的文档。通过这种方式，高频项可以改善相关性计算，而无需支付性能不佳的成本。

如果查询仅包含高频术语，则单个查询将作为AND（连接）查询执行，换句话说，所有术语都是必需的。即使每个单独的术语与许多文档匹配，术语组合也会将结果集缩小到最相关的范围。单个查询也可以作为OR特定的查询执行minimum_should_match，在这种情况下，应该使用足够高的值。

根据条件将术语分配给高频或低频组 cutoff_frequency，可以将其指定为绝对频率（>=1）或相对频率（0.0 .. 1.0）。（请记住，文档频率是按照每个分片级别计算的，如博客文章中所述，相关性已被破坏。）

也许这个查询最有趣的属性是它自动适应域特定的停用词。例如，在视频托管网站上，常见的术语如"clip"或"video"将自动表现为停用词而无需维护手动列表。

示例

在此示例中，文档频率大于0.1％（例如"this"和"is"）的单词将被视为常用术语。

GET /_search

{

    "query": {

        "common": {

            "body": {

                "query": "this is bonsai cool",

                "cutoff_frequency": 0.001

            }

        }

    }

}

可以使用minimum_should_match （high_freq，low_freq），low_freq_operator（默认"or"）和high_freq_operator（默认"or"）参数控制应匹配的术语数。

低频方面，设置low_freq_operator以"and"使所需的所有条件：

GET /_search

{

    "query": {

        "common": {

            "body": {

                "query": "nelly the elephant as a cartoon",

                "cutoff_frequency": 0.001,

                "low_freq_operator": "and"

            }

        }

    }

}

这大致相当于：

GET /_search

{

    "query": {

        "bool": {

            "must": [

            { "term": { "body": "nelly"}},

            { "term": { "body": "elephant"}},

            { "term": { "body": "cartoon"}}

            ],

            "should": [

            { "term": { "body": "the"}},

            { "term": { "body": "as"}},

            { "term": { "body": "a"}}

            ]

        }

    }

}

或者用于 minimum_should_match 指定必须存在的低频项的最小数量或百分比，例如：

GET /_search

{

    "query": {

        "common": {

            "body": {

                "query": "nelly the elephant as a cartoon",

                "cutoff_frequency": 0.001,

                "minimum_should_match": 2

            }

        }

    }

}

这大致相当于：

GET /_search

{

    "query": {

        "bool": {

            "must": {

                "bool": {

                    "should": [

                    { "term": { "body": "nelly"}},

                    { "term": { "body": "elephant"}},

                    { "term": { "body": "cartoon"}}

                    ],

                    "minimum_should_match": 2

                }

            },

            "should": [

                { "term": { "body": "the"}},

                { "term": { "body": "as"}},

                { "term": { "body": "a"}}

                ]

        }

    }

}

minimum_should_match 使用附加low_freq和high_freq参数可以对低频和高频术语应用不同的术语。以下是提供其他参数的示例（请注意结构的变化）：

GET /_search

{

    "query": {

        "common": {

            "body": {

                "query": "nelly the elephant not as a cartoon",

                "cutoff_frequency": 0.001,

                "minimum_should_match": {

                    "low_freq" : 2,

                    "high_freq" : 3

                }

            }

        }

    }

}

这大致相当于：

GET /_search

{

    "query": {

        "bool": {

            "must": {

                "bool": {

                    "should": [

                    { "term": { "body": "nelly"}},

                    { "term": { "body": "elephant"}},

                    { "term": { "body": "cartoon"}}

                    ],

                    "minimum_should_match": 2

                }

            },

            "should": {

                "bool": {

                    "should": [

                    { "term": { "body": "the"}},

                    { "term": { "body": "not"}},

                    { "term": { "body": "as"}},

                    { "term": { "body": "a"}}

                    ],

                    "minimum_should_match": 3

                }

            }

        }

    }

}

在这种情况下，这意味着高频项在至少有三个时对相关性有影响。但是minimum_should_match 对于高频术语最有趣的用法是当只有高频术语时：

GET /_search

{

    "query": {

        "common": {

            "body": {

                "query": "how not to be",

                "cutoff_frequency": 0.001,

                "minimum_should_match": {

                    "low_freq" : 2,

                    "high_freq" : 3

                }

            }

        }

    }

}

这大致相当于：

GET /_search

{

    "query": {

        "bool": {

            "should": [

            { "term": { "body": "how"}},

            { "term": { "body": "not"}},

            { "term": { "body": "to"}},

            { "term": { "body": "be"}}

            ],

            "minimum_should_match": "3<50%"

        }

    }

}

然后，高频率生成的查询的限制性略低于AND。

该common术语查询还支持boost并analyzer作为参数。

elasticsearch 基础 —— Common Terms Query常用术语查询的更多相关文章

elasticsearch 基础 —— Update By Query API
Update By Query API 最简单的用法是_update_by_query在不更改源的情况下对索引中的每个文档执行更新.这对于获取新属性或其他一些在线映射更改很有用 .这是API: POS ...
elasticsearch 基础 —— Delete By Query API
Delete By Query API _delete_by_query 的简单用法,就是在查询匹配到的每个文档上执行删除.例如: POST twitter/_delete_by_query { &q ...
ES之四、Elasticsearch集群和索引常用命令
REST API用途 elasticsearch支持多种通讯,其中包括http请求响应服务,因此通过curl命令,可以发送http请求,并得到json返回内容. ES提供了很多全面的API,常用的RE ...
elasticsearch Terms Query 实现类似于sql in查询
本文demo基于elasticsearch 5.1.1, 项目中使用的还是较早的版本例如 import com.alibaba.fastjson.JSON; import org.elastics ...
ElasticSearch 常用的查询过滤语句
query 和 filter 的区别请看: http://www.cnblogs.com/ghj1976/p/5292740.html Filter DSL term 过滤 term主要用于精确匹配 ...
[转] ElasticSearch 常用的查询过滤语句
备忘remark https://www.cnblogs.com/ghj1976/p/5293250.html query 和 filter 的区别请看: http://www.cnblogs.co ...
ElasticSearch 7.X版本19个常用的查询语句
整理一篇常用的CRUD查询语句,之前这篇文件是在17年左右发表的,从英文翻译过来,现在采用7.x 版本进行实验,弃用的功能或者参数,我这边会进行更新,一起来学习吧. 为了演示不同类型的 Elastic ...
Elasticsearch(入门篇)——Query DSL与查询行为
ES提供了丰富多彩的查询接口,可以满足各种各样的查询要求.更多内容请参考:ELK修炼之道 Query DSL结构化查询 Query DSL是一个Java开源框架用于构建类型安全的SQL查询语句.采用A ...
Elasticsearch 常用基本查询
安装启动很简单,参考官网步骤:https://www.elastic.co/downloads/elasticsearch 为了介绍Elasticsearch中的不同查询类型,我们将对带有下列字段的文 ...

随机推荐

Rust(一)介绍安装
目录 Rust安装 Rust介绍: Windows 安装步骤: Helle world 创建项目文件夹: 写并执行程序: Rust安装安装过程简单快捷,直接参照官网即可,Rust安装 Rust介绍: ...
Docker之安装缺省指令
Docker 中有些指令不存在,需要额外的安装,这里做下安装记录. 更新软件源中的所有软件列表 apt-get update 安装 ifconfig apt install net-tools 安装 ...
python的次方操作
好简单,不需要import任何包 b=a**n就是求a的n次方,如果n=0.5就是开方如果开方的是负数或者附复数,需要 import math b=math.sqrt(a) 这样
一种算法的实现，几个相同大小的div组合在一起，判断是不是矩形
RabbitMQ核心概念和AMQP协议（二）
RabbitMQ是什么? RabbitMQ是一个开源的消息代理和队列服务器,用来通过普通协议,在完全不同的应用之间共享数据,RabbirMQ是使用Erlang语言来编写的,并且RabbitMQ是基于A ...
vue路由vue-router的安装和使用
1.安装,如果你没有在创建项目时候选择的情况下 cnpm install vue-router 2.使用假设App为根组件,两个自定义组件home及list main.js里操作 impor ...
Mybatis基于注解开启使用二级缓存
关于Mybatis的一级缓存和二级缓存的概念以及理解可以参照前面文章的介绍.前文连接:https://www.cnblogs.com/hopeofthevillage/p/11427438.html, ...
HDU6599:求本质不同的子串(回文串)长度及数量
目录 hdu6599题意: manacher+后缀自动机+倍增 \(O(nlog(n))\) manacher+后缀数组+二分 \(O(nlog(n))\) 回文树(回文自动机) \(O(n)\) @ ...
洛谷P1441 砝码称重（搜索，dfs+dp）
洛谷P1441 砝码称重 \(n\) 的范围为 \(n \le 20\) ,\(m\) 的范围为 \(m \le 4\) . 暴力遍历每一种砝码去除情况,共有 \(n^m\) 种情况. 对于剩余砝码求 ...
sqlalchemy.exc.IntegrityError: (mysql.connector.errors.IntegrityError) 1062 (23000): Duplicate entry '1' for key 'PRIMARY'
排错: 看到 Duplicate entry '1' for key 'PRIMARY'是主键错误看一看自己添加的数据id是1 再查询一下数据库中的表,发现id=1的记录已经存在了所以在代码中让i ...

elasticsearch 基础 —— Common Terms Query常用术语查询

常用术语查询

问题

解决方案

elasticsearch 基础 —— Common Terms Query常用术语查询的更多相关文章

随机推荐

热门专题