【Elasticsearch 7 探索之路】（四）Analyzer 分析

上一篇，什么是倒排索引以及原理是什么。本篇讲解 Analyzer，了解 Analyzer 是什么，分词器是什么，以及 Elasticsearch 内置的分词器，最后再讲解中文分词是怎么做的。

一、Analysis 与 Analyzer

Analysis 文本分析是把全文本转换一系列单词（term/token)的过程，也叫分词

，Analysis 是通过 Analyzer 来实现的。 Elasticsearch 有多种内置的分析器，如果不满足也可以根据自己的需求定制化分析器，除了在数据写入时转换词条，匹配 Query 语句时候也需要用相同的分析器对查询语句进行分析。

二、Analyzer 的组成

Character Filters (针对原始文本处理，例如，可以使用字符过滤器将印度阿拉伯数字（٠ ١٢٣٤٥٦٧٨ ٩）转换为其等效的阿拉伯语-拉丁语（0123456789）)
Tokenizer（按照规则切分为单词）,将把文本 "Quick brown fox!" 转换成 terms [Quick, brown, fox!],tokenizer 还记录文本单词位置以及偏移量。
Token Filter(将切分的的单词进行加工、小写、刪除 stopwords，增加同义词）

三、Analyzer 内置的分词器

例子：The 2 QUICK Brown-Foxes jumped over the lazy dog's bone.

Standard Analyzer

默认分词器
按词分类
小写处理

#standard

GET _analyze

{

  "analyzer": "standard",

  "text": "The 2 QUICK Brown-Foxes jumped over the lazy dog's bone."

}

输出：

[the,2,quick,brown,foxes,a,jumped,over,the,lazy,dog's,bone]

Simple Analyzer

按照非字母切分，非字母则会被去除
小写处理

#simpe

GET _analyze

{

  "analyzer": "simple",

  "text": "The 2 QUICK Brown-Foxes jumped over the lazy dog's bone."

}

输出：

[the,quick,brown,foxes,jumped,over,the,lazy,dog,s,bone]

Stop Analyzer

小写处理
停用词过滤（the，a, is)

GET _analyze

{

  "analyzer": "stop",

  "text": "The 2 QUICK Brown-Foxes jumped over the lazy dog's bone."

}

输出：

[quick,brown,foxes,jumped,over,lazy,dog,s,bone]

Whitespace Analyzer

按空格切分

#stop

GET _analyze

{

  "analyzer": "whitespace",

  "text": "The 2 QUICK Brown-Foxes jumped over the lazy dog's bone."

}

输出：

[The,2,QUICK,Brown-Foxes,jumped,over,the,lazy,dog's,bone.]

Keyword Analyzer

不分词，当成一整个 term 输出

#keyword

GET _analyze

{

  "analyzer": "keyword",

  "text": "The 2 QUICK Brown-Foxes jumped over the lazy dog's bone."

}

输出：

[The 2 QUICK Brown-Foxes jumped over the lazy dog's bone.]

Patter Analyzer

通过正则表达式进行分词
默认是 \W+(非字母进行分隔)

GET _analyze

{

  "analyzer": "pattern",

  "text": "The 2 QUICK Brown-Foxes jumped over the lazy dog's bone."

}

输出：

[the,2,quick,brown,foxes,jumped,over,the,lazy,dog,s,bone]

Language Analyzer

支持语言：arabic, armenian, basque, bengali, bulgarian, catalan, czech, dutch, english, finnish, french, galician, german, hindi, hungarian, indonesian, irish, italian, latvian, lithuanian, norwegian, portuguese, romanian, russian, sorani, spanish, swedish, turkish.

#english

GET _analyze

{

  "analyzer": "english",

  "text": "The 2 QUICK Brown-Foxes jumped over the lazy dog's bone."

}

输出：

[2,quick,brown,fox,jump,over,the,lazy,dog,bone]

中文分词要比英文分词难，英文都以空格分隔，中文理解通常需要上下文理解才能有正确的理解，比如 [苹果，不大好吃]和

[苹果，不大，好吃]，这两句意思就不一样。

ICU Analyzer

ElasticSearch 默认以每个字对中文分隔，无法满足我们的需求。ICU Analyzer 使用国际化组件 Unicode (ICU) 函数库提供丰富的处理 Unicode ，更好支持中文分词，ICU Analyzer 不是默认分词器，需要先安装插件，安装命令 sudo bin/elasticsearch-plugin install analysis-icu。

POST _analyze

{

  "analyzer": "icu_analyzer",

  "text": "他说的确实在理”"

}

输出：

[他，说的，确实，在，理]



POST _analyze

{

  "analyzer": "standard",

  "text": "他说的确实在理”"

}

输出：

[他，说，的，确，实，在，理]

ICU 只是其中一种中文分词器，在 Github 上可以查找到其他中文分词器，比如 IK,THULAC，这些就不在这里提及，有兴趣可以自行了解。

四、总结

本篇对 Analyzer 进行详细讲解，ES 内置分词器是如何工作的，通过 ICU Analyzer 对中文分词的效果，下面总结内置的所有分词器的特点，做一个简单对比。

Standard Analyzer -- 默认分词器，按词切分，小写处理

Simple Analyzer -- 按照非字母切分（符号被过滤），小写处理

Stop Analyzer -- 小写处理，停用词过滤（the，a, is)

Whitespace Analyzer -- 按照空格切分，不转小写

Keyword Analyzer -- 不分词，直接将输入当作输出

Patter Analyzer -- 正则表达式，默认\W+ (非字符分隔）

Language Analyzer -- 提供了 30 多种常见语言的分词器

Customer Analyzer -- 自定义分词器

【Elasticsearch 7 探索之路】（三）倒排索引

 【Elasticsearch 7 探索之路】（二）文档的 CRUD 和批量操作

 【Elasticsearch 7 搜索之路】（一）什么是 Elasticsearch？

【Elasticsearch 7 探索之路】（四）Analyzer 分析的更多相关文章

【Elasticsearch 7 探索之路】（五）搜索相关 Search-API
本节主要讲解 Elasticsearch 的搜索相关功能 Search-API,讲解什么是 URL Search 和 Request Body Search 的语法,对常用的语法都会一一进行详细介绍 ...
【Elasticsearch 7 探索之路】（六）初识 Mapping
上一篇主要讲解什么是 URL Search 和 Request Body Search 的语法.本篇对 Mapping 的 Dynamic Mapping 以及手动创建 Mapping 进行讲解. 1 ...
ElasticSearch查询第四篇：匹配查询（Match）
<ElasticSearch查询>目录导航: ElasticSearch查询第一篇:搜索API ElasticSearch查询第二篇:文档更新 ElasticSearch查询第三篇: ...
【Elasticsearch 7 探索之路】（三）倒排索引
上一篇,我们介绍了 ES 文档的基本 CURE 和批量操作.我们都知道倒排索引是搜索引擎非常重要的一种数据结构,什么是倒排索引,倒排索引的原理是什么. 1 索引过程在讲解倒排索引前,我们先了解索引创 ...
ElasticSearch Index操作源码分析
ElasticSearch Index操作源码分析本文记录ElasticSearch创建索引执行源码流程.从执行流程角度看一下创建索引会涉及到哪些服务(比如AllocationService.Mas ...
ElasticSearch实战系列四: ElasticSearch理论知识介绍
前言在前几篇关于ElasticSearch的文章中,简单的讲了下有关ElasticSearch的一些使用,这篇文章讲一下有关 ElasticSearch的一些理论知识以及自己的一些见解. 虽然本人是 ...
ElasticSearch入门第四篇：使用C#添加和更新文档
这是ElasticSearch 2.4 版本系列的第四篇: ElasticSearch入门第一篇:Windows下安装ElasticSearch ElasticSearch入门第二篇:集群配置 E ...
[转]一次使用Eclipse Memory Analyzer分析Tomcat内存溢出
一次使用Eclipse Memory Analyzer分析Tomcat内存溢出前言在平时开发.测试过程中.甚至是生产环境中,有时会遇到OutOfMemoryError,Java堆溢出了,这表明程序 ...
利用Eventlog Analyzer分析日志
利用EventlogAnalyzer分析日志 ManageEngineEventLogAnalyzer是一个基于Web技术.实时的事件监控管理解决方案,能够提高企业网络安全.减少工作站和服务器的宕机事 ...

随机推荐

javascript domAPI整理
对一般兼容性和特点做了标识(主要是ie8+) 节点类型节点类型节点值标签节点(Element) 1 属性节点(Attr) 2 文本节点(Text) 3 CDATA节点(CDATASetion) ...
Kafka权威指南阅读笔记（第八章）
跨集群数据镜像使用场景: 区域集群和中心集群这种场景下,每个区域的应用程序只访问相应的区域内的集群.而有些情况下,需要将各个集群的信息汇总到中心集群,就可以用中心集群分析业务数据了. 冗余一个K ...
追查Could not get a databaseId from dataSource
Mybatis 创建连接池的时候报错: ERROR 2017-03-15 00:44:50,333 commons.JakartaCommonsLoggingImpl:38 Could not get ...
Android应用程序版本升级时签名冲突
这种错误特别容易在调试中出现,原因是你手机上的应用是直接用eclipse或者android studio安装的,而eclipse或者android studio有自己默认的签名:**debug.key ...
Navicate12激活教程(完整详细版)
写在前面最近身边的小伙伴苦于没有Navicat12的激活工具,不能使用最新版的Navicat,鉴于此,遂将自己整理的文章贴出来,供大家参考,不过个人还是主张维护正版的意愿,如果经济实力允许的话,还是 ...
Chrome插件开发（二）
作为一个前端开发者,我们经常需要和各种各样的接口打交道,很多时候我们的开发环境的域和接口所在的域是不同的,比如我们本地开发环境运行域是localhost,但接口所在的域是www.xx.com,这个时候 ...
C语言知识体系
吾尝终日而思矣,不如须臾之所学也: 吾尝跂而望矣,不如登高之博见也. 登高而招,臂非加长也,而见者远: 顺风而呼,声非加疾也,而闻者彰. 假舆马者,非利足也,而致千里: 假舟楫者,非能水也,而绝江河. ...
HTTP 304状态码的详细讲解
首先,对于304状态码不应该认为是一种错误,而是对客户端有缓存情况下服务端的一种响应. 客户端在请求一个文件的时候,发现自己缓存的文件有 Last Modified ,那么在请求中会包含 If Mod ...
通过Value获取Map中的键值Key的四种方法
1 简介我们都知道Map是存放键值对<Key,Value>的容器,知道了Key值,使用方法Map.get(key)能快速获取Value值.然而,有的时候我们需要反过来获取,知道Value ...
Nmap的一些常用的nse脚本
转自freebuf.com/ 点击跳转在这篇文章中,我们将研究最著名的渗透工具之一 Nmap 一款标志性的跨平台扫描器.它的原意为Network Mapper(网络映射器),具有相当强大的扫描功能 ...

【Elasticsearch 7 探索之路】（四）Analyzer 分析

【Elasticsearch 7 探索之路】（四）Analyzer 分析的更多相关文章

随机推荐

热门专题