【ES】match_phrase与regexp

刚开始接触es，由于弄不清楚match_phrase和regexp导致很多查询结果与预想的不同。在这整理一下。

regexp：针对的是单个词项

match_phrase：针对的是多个词项的相对位置

它们的查询结果跟分析器分词的方式有很大关系。

比如，我有两个字符串"HELLO-world" 和 "hello.WORLD"，字段名称是title。

针对"HELLO-world"，看下面两个语句。第二个是可以匹配的，第一个不可以。

{ "regexp": { "title": "hello-w.*" }}

{ "match_phrase": { "title": "hello world" }}

分析一下，可以看到，HELLO-world被分为了两个单词，hello和world。

-GET _analyze

{

    "field": "title",

    "text": "HELLO-world"

}

---------------------------

{

  "tokens" : [

    {

      "token" : "hello",

      "start_offset" : ,

      "end_offset" : ,

      "type" : "<ALPHANUM>",

      "position" :

    },

    {

      "token" : "world",

      "start_offset" : ,

      "end_offset" : ,

      "type" : "<ALPHANUM>",

      "position" :

    }

  ]

}

首先，es是没有大写的，所有的字符都被转换成了小写。其次，"-"字符丢失了。

regexp是针对单个词项的，无论是hello还是world，都不符合正则条件，故没有匹配。

match_phrase是针对多个词项的。首先match_phrase的"hello world"被分为了hello和world两个单词，然后这两个单词在title的分词中都可以找到，并且相对位置满足条件，故语句可以匹配。

再看 "hello.WORLD"

{ "regexp": { "title": "hello\\.w.*" }}

{ "match_phrase": { "title": "hello world" }}

结果是，第一个可以匹配，而第二个不能。

原因看分词结果：

-GET_analyze

{

    "field": "title",

    "text": "hello.WORLD"

}

-------------------------------

{

  "tokens" : [

    {

      "token" : "hello.world",

      "start_offset" : ,

      "end_offset" : ,

      "type" : "<ALPHANUM>",

      "position" :

    }

  ]

}

坑爹的情况出现了，"."并不会被切分，整个"hello.world"被视作了一个词项。

match_phrase在词项中查找hello和world都查找不到，故不会匹配

regexp则能找到一个满足正则表达式的词项，故可以匹配。

ES的分词处理非常重要，很大的影响了查询结果！

【ES】match_phrase与regexp的更多相关文章

hot load那点事
热加载,最初接触的时候是使用create-react-app的时候,创建一个项目出来,修改一点代码,页面自动刷新了,贫道当时就感叹,这是造福开发者的事情. 再后来编写静态页面的时候使用 VS Code ...
ES match match_phrase term willcard的查询原理
比如:要求实现SQL中like “%xxxx%”的匹配效果. wildcard通配这种效果在ES中最匹配的做法是用wildcard query通配,这种情况不会对query分词,而是直接遍历倒排索引 ...
ES查询－match VS match_phrase
我们以一个查询的示例开始,我们在student这个type中存储了一些学生的基本信息,我们分别使用match和match_phrase进行查询. 首先,使用match进行检索,关键字是“He is”: ...
es 基于match_phrase的模糊匹配原理及使用
[版权声明]:本文章由danvid发布于http://danvid.cnblogs.com/,如需转载或部分使用请注明出处在业务中经常会遇到类似数据库的"like"的模糊匹配需求 ...
ES中文分词器之精确短语匹配（解决了match_phrase匹配不全的问题）
分词器选择调研了几种分词器,例如IK分词器,ansj分词器,mmseg分词器,发现IK的分词效果最好.举个例子: 词:<<是的>><span>哈<\span ...
es match、match_phrase、query_string和term的区别
(一)text字段和keyword字段的区别以下给出一个例子: 首先建立一个索引和类型,引入一个keywork的字段: PUT my_index { "mappings": { ...
ES 应用
1. ES的不同之处: 全文检索.处理同义词.通过相关性给文档评分, 从同样的数据中生成分析与聚合数据, 实时大型批处理. 安装es与kibana 1.下载:https://www.elastic ...
es中级部分知识点总结
--------------------------------------------------------------- 搜索开始-------------------------------- ...
ES之二：Elasticsearch原理
Elasticsearch是最近两年异军突起的一个兼有搜索引擎和NoSQL数据库功能的开源系统,基于Java/Lucene构建.最近研究了一下,感觉 Elasticsearch 的架构以及其开源的生态 ...

随机推荐

关于bottle WEB框架中签名cookie的一点理解
首先要理解一个概念 MAC (message authenticate code) 消息认证码(带密钥的Hash函数):密码学中,通信实体双方使用的一种验证机制,保证消息数据完整性的一种工具. 构造方 ...
Hadoop生态圈-通过CDH5.15.1部署spark1.6与spark2.3.0的版本兼容运行
Hadoop生态圈-通过CDH5.15.1部署spark1.6与spark2.3.0的版本兼容运行作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 在我的CDH5.15.1集群中,默 ...
WinForm ListView虚拟模式加载数据提高加载速度
将VirtualMode 属性设置为 true 会将 ListView 置于虚拟模式.控件不再使用Collection.Add()这种方式来添加数据,取而代之的是使用RetrieveVirtualIt ...
python -- 异步IO 协程
python 3.4 >>> import asyncio >>> from datetime import datetime >>> @asyn ...
URL基本结构
先来简单说下URI.URL.URN这三个鬼东西. URI全称Uniform Resource Identifier,统一资源标识符 URL全称Uniform Resource Locator,统一资源 ...
STM32建立基本项目
1.下载固件库解压 2.Keil建立项目,项目下建立三个文件夹3.各目录下从固件库中拷贝对应的目录 4.修改main.c文件 5.修改C++ 6.修改Include 7,编译.
7.SpringBoot 之 Web
添加资源处理 package org.springframework.boot.autoconfigure.web.servlet. public class WebMvcAutoConfigurat ...
spring注解第07课 @Valid和@Validated的总结区分
@Valid: @Valid注解用于校验,所属包为:javax.validation.Valid. ① 首先需要在实体类的相应字段上添加用于充当校验条件的注解,如:@Min,如下代码(age属于Gir ...
MSVCR120.dll丢失问题
一.问题:丢失MSVCR120.dll 二.解决方法到官网下载vcredist_x86.exe安装即可地址:https://www.microsoft.com/en-us/download/det ...
buildroot构建项目（八）--- u-boot 2017.11 适配开发板修改 5 ---- 系统启动初始化之五
执行完 board_init_f 后,跳回到 crt0.S中继续执行汇编语言 ldr r0, [r9, #GD_START_ADDR_SP] /* sp = gd->start_addr_sp, ...

【ES】match_phrase与regexp

【ES】match_phrase与regexp的更多相关文章

随机推荐

热门专题