这篇文章主要来介绍下什么是 Analysis ，什么是分词器，以及 ElasticSearch 自带的分词器是怎么工作的，最后会介绍下中文分词是怎么做的。

首先来说下什么是 Analysis：

什么是 Analysis？

顾名思义，文本分析就是把全文本转换成一系列单词（term/token）的过程，也叫分词。在 ES 中，Analysis 是通过分词器（Analyzer） 来实现的，可使用 ES 内置的分析器或者按需定制化分析器。

举一个分词简单的例子：比如你输入 Mastering Elasticsearch，会自动帮你分成两个单词，一个是 mastering，另一个是 elasticsearch，可以看出单词也被转化成了小写的。

再简单了解了 Analysis 与 Analyzer 之后，让我们来看下分词器的组成：

分词器的组成

分词器是专门处理分词的组件，分词器由以下三部分组成：

Character Filters：针对原始文本处理，比如去除 html 标签
Tokenizer：按照规则切分为单词，比如按照空格切分
Token Filters：将切分的单词进行加工，比如大写转小写，删除 stopwords，增加同义语

同时 Analyzer 三个部分也是有顺序的，从图中可以看出，从上到下依次经过 Character Filters，Tokenizer 以及 Token Filters，这个顺序比较好理解，一个文本进来肯定要先对文本数据进行处理，再去分词，最后对分词的结果进行过滤。

其中，ES 内置了许多分词器：

Standard Analyzer - 默认分词器，按词切分，小写处理
Simple Analyzer - 按照非字母切分（符号被过滤），小写处理
Stop Analyzer - 小写处理，停用词过滤（the ，a，is）
Whitespace Analyzer - 按照空格切分，不转小写
Keyword Analyzer - 不分词，直接将输入当做输出
Pattern Analyzer - 正则表达式，默认 \W+
Language - 提供了 30 多种常见语言的分词器
Customer Analyzer - 自定义分词器

接下来会对以上分词器进行讲解，在讲解之前先来看下很有用的 API：_analyzer API：

Analyzer API

它可以通过以下三种方式来查看分词器是怎么样工作的：

直接指定 Analyzer 进行测试

GET _analyze

{

    "analyzer": "standard",

    "text" : "Mastering Elasticsearch , elasticsearch in Action"

}

指定索引的字段进行测试

POST books/_analyze

{

    "field": "title",

    "text": "Mastering Elasticesearch"

}

自定义分词进行测试

POST /_analyze

{

    "tokenizer": "standard",

    "filter": ["lowercase"],

    "text": "Mastering Elasticesearch"

}

再了解了 Analyzer API 后，让我们一起看下 ES 内置的分词器：

ES 分词器

首先来介绍下 Stamdard Analyzer 分词器：

Stamdard Analyzer

它是 ES 默认的分词器，它会对输入的文本按词的方式进行切分，切分好以后会进行转小写处理，默认的 stopwords 是关闭的。

下面使用 Kibana 看一下它是怎么样进行工作的，在 Kibana 的开发工具（Dev Tools）中指定 Analyzer 为 standard，并输入文本 In 2020, Java is the best language in the world.，然后我们运行一下：

GET _analyze

{

  "analyzer": "standard",

  "text": "In 2020, Java is the best language in the world."

}

运行结果如下：

{

  "tokens" : [

    {

      "token" : "in",

      "start_offset" : 0,

      "end_offset" : 2,

      "type" : "<ALPHANUM>",

      "position" : 0

    },

    {

      "token" : "2020",

      "start_offset" : 3,

      "end_offset" : 7,

      "type" : "<NUM>",

      "position" : 1

    },

    {

      "token" : "java",

      "start_offset" : 9,

      "end_offset" : 13,

      "type" : "<ALPHANUM>",

      "position" : 2

    },

    {

      "token" : "is",

      "start_offset" : 14,

      "end_offset" : 16,

      "type" : "<ALPHANUM>",

      "position" : 3

    },

    {

      "token" : "the",

      "start_offset" : 17,

      "end_offset" : 20,

      "type" : "<ALPHANUM>",

      "position" : 4

    },

    {

      "token" : "best",

      "start_offset" : 21,

      "end_offset" : 25,

      "type" : "<ALPHANUM>",

      "position" : 5

    },

    {

      "token" : "language",

      "start_offset" : 26,

      "end_offset" : 34,

      "type" : "<ALPHANUM>",

      "position" : 6

    },

    {

      "token" : "in",

      "start_offset" : 35,

      "end_offset" : 37,

      "type" : "<ALPHANUM>",

      "position" : 7

    },

    {

      "token" : "the",

      "start_offset" : 38,

      "end_offset" : 41,

      "type" : "<ALPHANUM>",

      "position" : 8

    },

    {

      "token" : "world",

      "start_offset" : 42,

      "end_offset" : 47,

      "type" : "<ALPHANUM>",

      "position" : 9

    }

  ]

}

可以看出是按照空格、非字母的方式对输入的文本进行了转换，比如对 Java 做了转小写，对一些停用词也没有去掉，比如 in。

其中 token 为分词结果；start_offset 为起始偏移；end_offset 为结束偏移；position 为分词位置。

下面来看下 Simple Analyzer 分词器：

Simple Analyzer

它只包括了 Lower Case 的 Tokenizer，它会按照非字母切分，非字母的会被去除，最后对切分好的做转小写处理，然后接着用刚才的输入文本，分词器换成 simple 来进行分词，运行结果如下：

{

  "tokens" : [

    {

      "token" : "in",

      "start_offset" : 0,

      "end_offset" : 2,

      "type" : "word",

      "position" : 0

    },

    {

      "token" : "java",

      "start_offset" : 9,

      "end_offset" : 13,

      "type" : "word",

      "position" : 1

    },

    {

      "token" : "is",

      "start_offset" : 14,

      "end_offset" : 16,

      "type" : "word",

      "position" : 2

    },

    {

      "token" : "the",

      "start_offset" : 17,

      "end_offset" : 20,

      "type" : "word",

      "position" : 3

    },

    {

      "token" : "best",

      "start_offset" : 21,

      "end_offset" : 25,

      "type" : "word",

      "position" : 4

    },

    {

      "token" : "language",

      "start_offset" : 26,

      "end_offset" : 34,

      "type" : "word",

      "position" : 5

    },

    {

      "token" : "in",

      "start_offset" : 35,

      "end_offset" : 37,

      "type" : "word",

      "position" : 6

    },

    {

      "token" : "the",

      "start_offset" : 38,

      "end_offset" : 41,

      "type" : "word",

      "position" : 7

    },

    {

      "token" : "world",

      "start_offset" : 42,

      "end_offset" : 47,

      "type" : "word",

      "position" : 8

    }

  ]

}

从结果中可以看出，数字 2020 被去除掉了，说明非字母的的确会被去除，所有的词也都做了小写转换。

现在，我们来看下 Whitespace Analyzer 分词器：

Whitespace Analyzer

它非常简单，根据名称也可以看出是按照空格进行切分的，下面我们来看下它是怎么样工作的：

{

  "tokens" : [

    {

      "token" : "In",

      "start_offset" : 0,

      "end_offset" : 2,

      "type" : "word",

      "position" : 0

    },

    {

      "token" : "2020,",

      "start_offset" : 3,

      "end_offset" : 8,

      "type" : "word",

      "position" : 1

    },

    {

      "token" : "Java",

      "start_offset" : 9,

      "end_offset" : 13,

      "type" : "word",

      "position" : 2

    },

    {

      "token" : "is",

      "start_offset" : 14,

      "end_offset" : 16,

      "type" : "word",

      "position" : 3

    },

    {

      "token" : "the",

      "start_offset" : 17,

      "end_offset" : 20,

      "type" : "word",

      "position" : 4

    },

    {

      "token" : "best",

      "start_offset" : 21,

      "end_offset" : 25,

      "type" : "word",

      "position" : 5

    },

    {

      "token" : "language",

      "start_offset" : 26,

      "end_offset" : 34,

      "type" : "word",

      "position" : 6

    },

    {

      "token" : "in",

      "start_offset" : 35,

      "end_offset" : 37,

      "type" : "word",

      "position" : 7

    },

    {

      "token" : "the",

      "start_offset" : 38,

      "end_offset" : 41,

      "type" : "word",

      "position" : 8

    },

    {

      "token" : "world.",

      "start_offset" : 42,

      "end_offset" : 48,

      "type" : "word",

      "position" : 9

    }

  ]

}

可以看出，只是按照空格进行切分，2020 数字还是在的，Java 的首字母还是大写的，, 还是保留的。

接下来看 Stop Analyzer 分词器：

Stop Analyzer

它由 Lowe Case 的 Tokenizer 和 Stop 的 Token Filters 组成的，相较于刚才提到的 Simple Analyzer，多了 stop 过滤，stop 就是会把 the，a，is 等修饰词去除，同样让我们看下运行结果：

{

  "tokens" : [

    {

      "token" : "java",

      "start_offset" : 9,

      "end_offset" : 13,

      "type" : "word",

      "position" : 1

    },

    {

      "token" : "best",

      "start_offset" : 21,

      "end_offset" : 25,

      "type" : "word",

      "position" : 4

    },

    {

      "token" : "language",

      "start_offset" : 26,

      "end_offset" : 34,

      "type" : "word",

      "position" : 5

    },

    {

      "token" : "world",

      "start_offset" : 42,

      "end_offset" : 47,

      "type" : "word",

      "position" : 8

    }

  ]

}

可以看到 in is the 等词都被 stop filter过滤掉了。

接下来看下 Keyword Analyzer：

Keyword Analyzer

它其实不做分词处理，只是将输入作为 Term 输出，我们来看下运行结果：

{

  "tokens" : [

    {

      "token" : "In 2020, Java is the best language in the world.",

      "start_offset" : 0,

      "end_offset" : 48,

      "type" : "word",

      "position" : 0

    }

  ]

}

我们可以看到，没有对输入文本进行分词，而是直接作为 Term 输出了。

接下来看下 Pattern Analyzer：

Pattern Analyzer

它可以通过正则表达式的方式进行分词，默认是用 \W+ 进行分割的，也就是非字母的符合进行切分的，由于运行结果和 Stamdard Analyzer 一样，就不展示了。

Language Analyzer

ES 为不同国家语言的输入提供了 Language Analyzer 分词器，在里面可以指定不同的语言，我们用 english 进行分词看下：

{

  "tokens" : [

    {

      "token" : "2020",

      "start_offset" : 3,

      "end_offset" : 7,

      "type" : "<NUM>",

      "position" : 1

    },

    {

      "token" : "java",

      "start_offset" : 9,

      "end_offset" : 13,

      "type" : "<ALPHANUM>",

      "position" : 2

    },

    {

      "token" : "best",

      "start_offset" : 21,

      "end_offset" : 25,

      "type" : "<ALPHANUM>",

      "position" : 5

    },

    {

      "token" : "languag",

      "start_offset" : 26,

      "end_offset" : 34,

      "type" : "<ALPHANUM>",

      "position" : 6

    },

    {

      "token" : "world",

      "start_offset" : 42,

      "end_offset" : 47,

      "type" : "<ALPHANUM>",

      "position" : 9

    }

  ]

}

可以看出 language 被改成了 languag，同时它也是有 stop 过滤器的，比如 in,is 等词也被去除了。

最后，让我们看下中文分词：

中文分词

中文分词有特定的难点，不像英文，单词有自然的空格作为分隔，在中文句子中，不能简单地切分成一个个的字，而是需要分成有含义的词，但是在不同的上下文，是有不同的理解的。

比如以下例子：

在这些，企业中，国有，企业，有十个/在这些，企业，中国，有企业，有十个

各国，有，企业，相继，倒闭/各，国有，企业，相继，倒闭

羽毛球，拍卖，完了/羽毛球拍，卖，完了

那么，让我们来看下 ICU Analyzer 分词器，它提供了 Unicode 的支持，更好的支持亚洲语言！

我们先用 standard 来分词，以便于和 ICU 进行对比。

GET _analyze

{

  "analyzer": "standard",

  "text": "各国有企业相继倒闭"

}

运行结果就不展示了，分词是一个字一个字切分的，明显效果不是很好，接下来用 ICU 进行分词，分词结果如下：

{

  "tokens" : [

    {

      "token" : "各国",

      "start_offset" : 0,

      "end_offset" : 2,

      "type" : "<IDEOGRAPHIC>",

      "position" : 0

    },

    {

      "token" : "有",

      "start_offset" : 2,

      "end_offset" : 3,

      "type" : "<IDEOGRAPHIC>",

      "position" : 1

    },

    {

      "token" : "企业",

      "start_offset" : 3,

      "end_offset" : 5,

      "type" : "<IDEOGRAPHIC>",

      "position" : 2

    },

    {

      "token" : "相继",

      "start_offset" : 5,

      "end_offset" : 7,

      "type" : "<IDEOGRAPHIC>",

      "position" : 3

    },

    {

      "token" : "倒闭",

      "start_offset" : 7,

      "end_offset" : 9,

      "type" : "<IDEOGRAPHIC>",

      "position" : 4

    }

  ]

}

可以看到分成了各国，有，企业，相继，倒闭，显然比刚才的效果好了很多。

还有许多中文分词器，在这里列举几个：

IK：

支持自定义词库，支持热更新分词字典
https://github.com/medcl/elasticsearch-analysis-ik

jieba：

Python 中最流行的分词系统，支持分词和词性标注
支持繁体分词、自定义词典、并行分词等
https://github.com/sing1ee/elasticsearch-jieba-plugin

THULAC：

THU Lexucal Analyzer for Chinese, 清华大学自然语言处理和社会人文计算实验室的一套中文分词器
https://github.com/thunlp/THULAC-Java

大家可以自己安装下，看下它中文分词效果。

总结

本文主要介绍了 ElasticSearch 自带的分词器，学习了使用 _analyzer API 去查看它的分词情况，最后还介绍下中文分词是怎么做的。

参考文献

Elasticsearch顶尖高手系列

Elasticsearch核心技术与实战

https://www.elastic.co/guide/en/elasticsearch/reference/7.1/indices-analyze.html

https://www.elastic.co/guide/en/elasticsearch/reference/current/analyzer-anatomy.html

ElasticSearch 分词器，了解一下的更多相关文章

Elasticsearch——分词器对String的作用
更多内容参考:Elasticsearch学习总结关于String类型--分词与不分词在Elasticsearch中String是最基本的数据类型,如果不是数字或者标准格式的日期等这种很明显的类型, ...
elasticsearch分词器Jcseg安装手册
Jcseg是什么? Jcseg是基于mmseg算法的一个轻量级中文分词器,同时集成了关键字提取,关键短语提取,关键句子提取和文章自动摘要等功能,并且提供了一个基于Jetty的web服务器,方便各大语言 ...
Elasticsearch 分词器
无论是内置的分析器(analyzer),还是自定义的分析器(analyzer),都由三种构件块组成的:character filters , tokenizers , token filters. 内 ...
ElasticSearch分词器
什么是分词器? 分词器,是将用户输入的一段文本,分析成符合逻辑的一种工具.到目前为止呢,分词器没有办法做到完全的符合人们的要求.和我们有关的分词器有英文的和中文的.英文的分词器过程:输入文本-关键词切 ...
elasticsearch分词器ik
1. 下载和es配套的版本 git clone https://github.com/medcl/elasticsearch-analysis-ik 2. 编译 cd elasticsearch-an ...
Elasticsearch(10) --- 内置分词器、中文分词器
Elasticsearch(10) --- 内置分词器.中文分词器这篇博客主要讲:分词器概念.ES内置分词器.ES中文分词器. 一.分词器概念 1.Analysis 和 Analyzer Analy ...
elasticsearch教程--中文分词器作用和使用
概述本文都是基于elasticsearch安装教程中的elasticsearch安装目录(/opt/environment/elasticsearch-6.4.0)为范例环境准备 ·全新最小 ...
使用Docker 安装Elasticsearch、Elasticsearch-head、IK分词器和使用
原文:使用Docker 安装Elasticsearch.Elasticsearch-head.IK分词器和使用 Elasticsearch的安装一.elasticsearch的安装 1.镜像拉取 ...
如何在Elasticsearch中安装中文分词器(IK+pinyin)
如果直接使用Elasticsearch的朋友在处理中文内容的搜索时,肯定会遇到很尴尬的问题--中文词语被分成了一个一个的汉字,当用Kibana作图的时候,按照term来分组,结果一个汉字被分成了一组. ...

随机推荐

oracle 1day
1.主流数据库: 2.项目选择数据库的原则: 3.oracle 常用用户sys (sysdba系统管理员),system(sysoper系统操作员),scott(密码tiger) sys login: ...
Docker的介绍与安装教程
基于Windows系统下docker的介绍与安装教程以及更换docker镜像源教程目录基于Windows系统下docker的介绍与安装教程以及更换docker镜像源教程 Docker的核心概念 D ...
win32之临界区
线程安全问题每个线程都有自己的栈,而局部变量是存储在栈中的,这就意味着每个线程都有一份自己的"局部变量",如果线程仅仅使用 "局部变量" 那么就不存在线程安 ...
JUC---03Lock(一)ReentrantLock
1.什么是锁在以前实现多线程的同步操作时,都是添加synchronized关键字或者synchronized代码块:而锁实现提供了比使用同步方法和语句可以获得的更广泛的锁操作.它们允许更灵活的结构, ...
.net npoi读word内容+目录
最近在做读npoi文档存入搜索引擎,实现快速查询word文档中内容并展示,效果希望带有目录导航. 网上有很多例子都是读写操作,很肤浅没有具体读到想要的东西所以自己就写了个demo,也有微软提供的off ...
【tensorflow】VMware Ubuntu+Tensorflow配置和使用
本文主要是记录配置tf环境和虚拟机时遇到的问题和方法,方便日后再查找(补前三年欠下的技术债) 宿主机环境:win10 64位宿主机python: anaconda+python3.6 宿主机tens ...
Django之实现分页显示内容
关注公众号"轻松学编程"了解更多.- 分页 1.作用数据加载优化 2.前端引入bootstrap样式: {# 引入bootstrap样式的cdn资源 #} <link ...
Java_包装类
包装类在实际应用中, 经常需要把基本数据类型转化为对象以便操作. 因此, Java在设计类时, 为每个基本数据类型设计了一个对应的类进行包装, 这样八个和基本数据类型对应的类统称为包装类(Wrapp ...
一个名为不安全的类Unsafe
最近为了更加深入了解NIO的实现原理,学习NIO的源码时,遇到了一个问题.即在WindowsSelectorImpl中的 pollWrapper属性,当我点进去查看它的PollArrayWrapper ...
懂了！国际算法体系对称算法DES原理
概念加密领域主要有国际算法和国密算法两种体系.国密算法是国家密码局认定的国产密码算法.国际算法是由美国安全局发布的算法.由于国密算法安全性高等一系列原因.国内的银行和支付机构都推荐使用国密算法. 从 ...

ElasticSearch 分词器，了解一下