1,$TF-IDF$算法

  $TF$是指归一化后的词频,$IDF$是指逆文档频率。给定一个文档集合$D$,有$d_1, d_2, d_3, ......, d_n \in D$。文档集合总共包含$m$个词(注:一般在计算$TF-IDF$时会去除如“的”这一类的停用词),有$w_1, w_2, w_3, ......, w_m \in W$。我们现在以计算词$w_i$在文档$d_j$中的$TF-IDF$指为例。$TF$的计算公式为:

    $ TF = \frac{freq(i, j)} {max_{len}(j)} $

  在这里$freq(i, j)$ 为$w_i$在$d_j$中出现的频率,$max_{len}(j)$为$d_j$长度。

  $TF$只能时描述词在文档中的频率,但假设现在有个词为”我们“,这个词可能在文档集$D$中每篇文档中都会出现,并且有较高的频率。那么这一类词就不具有很好的区分文档的能力,为了降低这种通用词的作用,引入了$IDF$。

  $IDF$的表达式如下:

    $IDF = \log (\frac {len(D)} {n(i)})$

  在这里$len(D)$表示文档集合$D$中文档的总数,$n(i)$表示含有$w_i$这个词的文档的数量。

  得到$TF$和$IDF$之后,我们将这两个值相乘得到$TF-IDF$的值:

    $TF-IDF = TF * IDF$ 

  $TF$可以计算在一篇文档中词出现的频率,而$IDF$可以降低一些通用词的作用。因此对于一篇文档我们可以用文档中每个词的$TF-IDF$组成的向量来表示该文档,再根据余弦相似度这类的方法来计算文档之间的相关性。

2,$BM25$算法

  $BM25$算法通常用来做搜索相关性评分的,也是ES中的搜索算法,通常用来计算$query$和文本集合$D$中每篇文本之间的相关性。我们用$Q$表示$query$,在这里$Q$一般是一个句子。在这里我们要对$Q$进行语素解析(一般是分词),在这里以分词为例,我们对$Q$进行分词,得到$q_1, q_2,......, q_t$这样一个词序列。给定文本$d \in D$,现在以计算$Q$和$d$之间的分数(相关性),其表达式如下:

    $Score(Q, d) = \sum_{i = 1}^t w_i * R(q_i, d)$

    上面式子中$w_i$表示$q_i$的权重,$R(q_i, d)$为$q_i$和$d$的相关性,$Score(Q, d)$就是每个语素$q_i$和$d$的相关性的加权和。

  $w_i$的计算方法有很多,一般是用$IDF$来表示的,但这里的$IDF$计算和上面的有所不同,具体的表达式如下:

    $w_i = IDF(q_i) = \log \frac {N - n(q_i) + 0.5} {n(q_i) + 0.5}$

  上面式子中$N$表示文本集合中文本的总数量,$n(q_i)$表示包含$q_i$这个词的文本的数量,$0.5$主要是做平滑处理。

  $R(q_i, d)$的计算公式如下:

    $R(q_i, d) = \frac {f_i * (k_1 + 1)} {f_i + K} * \frac {qf_i * (k_2 + 1)} {qf_i + k_2}$

  其中

    $K = k_1 * (1 - b + b * \frac {dl} {avg dl})$

  上面式子中$f_i$为$q_i$在文本$d$中出现的频率,$qf_i$为$q_i$在$Q$中出现的频率,$k_1, k_2, b$都是可调节的参数,$dl, avg dl$分别为文本$d$的长度和文本集$D$中所有文本的平均长度。

  一般$qf_i = 1$,取$k_2 = 0$,则可以去除后一项,将上面式子改写成:

    $R(q_i, d) = \frac {f_i * (k_1 + 1)} {f_i + K}$

  通常设置$k_1 = 2, b = 0.75$。参数$b$的作用主要是调节文本长度对相关性的影响。

  

文本相似度 — TF-IDF和BM25算法的更多相关文章

  1. 信息检索中的TF/IDF概念与算法的解释

    https://blog.csdn.net/class_brick/article/details/79135909 概念 TF-IDF(term frequency–inverse document ...

  2. 基于TF/IDF的聚类算法原理

        一.TF/IDF描述单个term与特定document的相关性TF(Term Frequency): 表示一个term与某个document的相关性. 公式为这个term在document中出 ...

  3. Okapi BM25算法

    引言 Okapi BM25,一般简称 BM25 算法,在 20 世纪 70 年代到 80 年代,由英国一批信息检索领域的计算机科学家发明.这里的 BM 是"最佳匹配"(Best M ...

  4. 文本相似度-BM25算法

    BM25 is a bag-of-words retrieval function that ranks a set of documents based on the query terms app ...

  5. .NET下文本相似度算法余弦定理和SimHash浅析及应用

    余弦相似性 原理:首先我们先把两段文本分词,列出来所有单词,其次我们计算每个词语的词频,最后把词语转换为向量,这样我们就只需要计算两个向量的相似程度.   我们简单表述如下   文本1:我/爱/北京/ ...

  6. 文本相似度算法——空间向量模型的余弦算法和TF-IDF

    1.信息检索中的重要发明TF-IDF TF-IDF是一种统计方法,TF-IDF的主要思想是,如果某个词或短语在一篇文章中出现的频率TF高,并且在其他文章中很少出现,则认为此词或者短语具有很好的类别区分 ...

  7. Elasticsearch由浅入深(十)搜索引擎:相关度评分 TF&IDF算法、doc value正排索引、解密query、fetch phrase原理、Bouncing Results问题、基于scoll技术滚动搜索大量数据

    相关度评分 TF&IDF算法 Elasticsearch的相关度评分(relevance score)算法采用的是term frequency/inverse document frequen ...

  8. 文本分类学习(三) 特征权重(TF/IDF)和特征提取

    上一篇中,主要说的就是词袋模型.回顾一下,在进行文本分类之前,我们需要把待分类文本先用词袋模型进行文本表示.首先是将训练集中的所有单词经过去停用词之后组合成一个词袋,或者叫做字典,实际上一个维度很大的 ...

  9. 55.TF/IDF算法

    主要知识点: TF/IDF算法介绍 查看es计算_source的过程及各词条的分数 查看一个document是如何被匹配到的         一.算法介绍 relevance score算法,简单来说 ...

随机推荐

  1. Windows提示 错误: RPC 服务器不可用 解决方法。

    试验环境: 本地主机:win10  ip:192.168.0.10 远程主机: win2008 R2   ip:192.168.1.128 我想要通过systeminfo去获取远程主机的系统信息,但是 ...

  2. 「工具」Aquarelo - 来自意大利的色阶管理工具

    Aquarelo是一款小而美的色阶管理工具,由意大利团队开发,包含三个核心功能,可用于色彩管理.色彩搭配等场景. ## 相关参数 * 操作系统:macOS* 工具官网:[Aquarelo for Ma ...

  3. Java提取URL某个参数的值

    Java提取Url中某个参数的值. public static String getParam(String url, String name) { String params = url.subst ...

  4. MySQL中的自适应哈希索引

    众所周知,InnoDB使用的索引结构是B+树,但其实它还支持另一种索引:自适应哈希索引. 哈希表是数组+链表的形式.通过哈希函数计算每个节点数据中键所对应的哈希桶位置,如果出现哈希冲突,就使用拉链法来 ...

  5. #Java学习之路——基础阶段二(第六篇)

    我的学习阶段是跟着CZBK黑马的双源课程,学习目标以及博客是为了审查自己的学习情况,毕竟看一遍,敲一遍,和自己归纳总结一遍有着很大的区别,在此期间我会参杂Java疯狂讲义(第四版)里面的内容. 前言: ...

  6. Eclipse中使用Maven搭建SSM框架

    Eclipse中不使用Maven搭建SSM框架:https://www.cnblogs.com/xuyiqing/p/9569459.html IDEA中使用Maven搭建SSM框架:https:// ...

  7. 以写作为例说下IT人如何培养挣钱DNA

    洛克菲勒说:“如果把我剥得一文不名丢在沙漠的中央,只要一行驼队经过——我就可以重建整个王朝.”这话反过来可以这样说,方法不对路,也不肯干的人,哪怕给一笔财富(比如人生小目标一个亿),最好的结果是跑赢C ...

  8. java线程通信与协作小结 多线程中篇(十六)

      在锁与监视器中我们对Object中的方法进行了简单介绍 以监视器原理为核心,三个方法:wait,notify.notifyAll,可以完成线程之间的通信 当然,不会像“语言”似的,有多种多样的沟通 ...

  9. Css-移动端适配总结

    前言 工作以后,大部分的业务工作都是基于移动端H5的,开发过程中学习了很多东西,遇到过许多问题,诸如rem\em\css px\device px等,本文纯属个人的归纳总结,如有问题,请指出亲喷~ P ...

  10. JS 数组、对象的深拷贝

    博客地址:https://ainyi.com/72 JavaScript 程序中,对于简单的数字.字符串可以通过 = 赋值拷贝 但是对于数组.对象.对象数组的拷贝,就有浅拷贝和深拷贝之分 浅拷贝就是当 ...