简介

  • 全称: Term Frequency-inverse document frequency(文本频率与逆文档频率指数)

  • 目的: 表征一个token(可以是一个字或者一个词)的重要程度

  • 是ElasticSearch的评分算法

  • TF - 如果该token出现的频率很高, 且不是常用连接词或语气词, 那么该词的重要程度就更高。

  • 如果该词是常用连接词或语气词, 那该词即使出现很多次也不是很重要。为了处理该种情况, 出现了逆文档频率指数(idf)。

  • 逆文档评率指数(idf)公式: log(所有的文档条数/有这个词的文档条数) => 这个词尽可能的只在某几条文档中出现过, 那样才更有区分性。

  • 举个小栗子:

    (a, b, c, d, e) 五个词, 所有词汇总数是5,若词d出现了1次, 那么其tf=1/5
    若文档总数为4条, d的idf=log(4/1), 实际操作中会加入平滑因子, 防止统计数为0出现。
    该词d的权重为 tf * idf = 1/5 * log(4 / 1)
    • 对每个词都做一下这样的计算,最后得到的是一个样品数量 * 唯一token总数维度的矩阵,在例子中样本数量为3,唯一token总数为5,那么我们会得到一个3*5的矩阵,如果这一条文档中没有这个词就直接赋值0就可以了。

使用python调numpy库实现

#!/usr/bin/env python
# encoding: utf-8 import numpy as np class TFIDF(object):
"""TFIDF简单实现"""
def __init__(self, corpus):
self.word_id = {}
self.vocabulary_count = {}
self.corpus = corpus
self.smooth_idf = 0.01 def fit_transform(self, corpus):
pass def get_vocabulary_frequency(self):
"""
计算文本特征的出现次数, 返回self.vocabulary_count
""" # 统计各词出现个数
id = 0
for single_corpus in self.corpus:
# 判断单个corpus是否为list类型
if isinstance(single_corpus, list):
pass
# 判断是否为string类型
if isinstance(single_corpus, str):
# 去除换行符, 再按空格分开, 返回的应该是一个list
single_corpus = single_corpus.strip("\n").split(" ")
for word in single_corpus:
# 如果该词不在词汇统计表的key中
if word not in self.vocabulary_count:
# 将该词放入到词汇统计表及词汇编码表中
self.vocabulary_count[word] = 1
self.word_id[word] = id
id += 1
else:
# 如果已经在了, 词频统计加一就ok
self.vocabulary_count[word] += 1 # 生成corpus长度 X 词频统计表长度的全零矩阵
X = np.zeros((len(self.corpus), len(self.vocabulary_count)))
for i in range(len(self.corpus)):
# 如果是string类型, 就去换行符并分割
if isinstance(self.corpus[i], str):
single_corpus = self.corpus[i].strip("\n").split(" ")
else:
single_corpus = self.corpus[i]
# 遍历单个single_corpus
for j in range(len(single_corpus)):
# 获取特征值和特征id, 并将他们放入矩阵对应的位置上
feature = single_corpus[j]
feature_id = self.word_id[feature]
X[i, feature_id] = self.vocabulary_count[feature]
return X.astype(int) # 需要转为int def get_tf_tdf(self):
"""
计算idf并生成最后的TFIDF矩阵
"""
X = self.get_vocabulary_frequency()
num_samples, n_features = X.shape
df = []
for i in range(n_features):
# 统计每个特征的非0的数量,也就是逆文档频率指数的分式中的分母,是为了计算idf
# bincount: 传入一个数组, 返回对应索引出现的次数的数组(大致可以这么理解)
df.append(num_samples - np.bincount(X[:,i])[0])
df = np.array(df)
# 是否需要添加平滑因子
df += int(self.smooth_idf)
num_samples += int(self.smooth_idf)
idf = np.log(num_samples / df) + 1 # 核心公式
return X*idf/len(self.vocabulary_count) if __name__ == '__main__':
corpus = [["此", "生", "不", "换"],["此", "情", "此", "景"],["不", "蔓", "不", "枝"]]
test = TFIDF(corpus)
print(test.get_tf_tdf())

TFIDF介绍的更多相关文章

  1. TF-IDF介绍

    TF-IDF是什么 TF-IDF是一种统计方法,用以评估一个词对于一篇文章或语料库中一篇文章的重要性.字词的重要性随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降. T ...

  2. Python TF-IDF计算100份文档关键词权重

    上一篇博文中,我们使用结巴分词对文档进行分词处理,但分词所得结果并不是每个词语都是有意义的(即该词对文档的内容贡献少),那么如何来判断词语对文档的重要度呢,这里介绍一种方法:TF-IDF. 一,TF- ...

  3. NLP入门(二)探究TF-IDF的原理

    TF-IDF介绍   TF-IDF是NLP中一种常用的统计方法,用以评估一个字词对于一个文件集或一个语料库中的其中一份文件的重要程度,通常用于提取文本的特征,即关键词.字词的重要性随着它在文件中出现的 ...

  4. TF-IDF基本原理

    1.TF-IDF介绍 TF/IDF(term frequency–inverse document frequency)用以评估字词 对于一个文件集其中一份文件的重要程度.字词的重要性随着它在文件中出 ...

  5. skearn自学路径

    sklearn学习总结(超全面) 关于sklearn,监督学习几种模型的对比 sklearn之样本生成make_classification,make_circles和make_moons pytho ...

  6. TF-IDF算法介绍及实现

    目录 1.TF-IDF算法介绍 (1)TF是词频(Term Frequency) (2) IDF是逆向文件频率(Inverse Document Frequency) (3)TF-IDF实际上是:TF ...

  7. 特征值提取之 -- TF-IDF值的简单介绍

    首先引用百度百科的话: "TF-IDF是一种统计方法,用以评估一字词对于一个文件集或一个语料库中的其中一份文件的重要程度.字词的重要性随着它在文件中出现的次数成正比增加,但同时会随着它在语料 ...

  8. ES搜索排序,文档相关度评分介绍——TF-IDF—term frequency, inverse document frequency, and field-length norm—are calculated and stored at index time.

    Theory Behind Relevance Scoring Lucene (and thus Elasticsearch) uses the Boolean model to find match ...

  9. DBoW2库介绍

    DBoW2库是University of Zaragoza里的Lopez等人开发的开源软件库. 由于在SLAM回环检测上的优异表现(特别是ORB-SLAM2),DBoW2库受到了广大SLAM爱好者的关 ...

随机推荐

  1. 2019 深信服 下棋(DFS+回溯)

    链接:https://www.nowcoder.com/questionTerminal/a0feb0696e2043a5b3b0779fa861b64a?f=discussion来源:牛客网 8x8 ...

  2. java list 清空列表所有元素

    Java list 清空列表所有元素 List<String> list = new ArrayList<String>(3);list.add("hello&quo ...

  3. checkbox全选/取消全选

    //checkbox全选/取消全选 $(function() { $("#checkAll").click(function() { if(this.checked){ $(&qu ...

  4. vue-cli 手脚架mock虚拟数据的运用,特别是坑!!!

    1.现在基本的趋势就是前后分离,前后分离就意味着当后台接口还没完成之前,前端是没有接口可以拿来调用的 ,那么mock虚拟数据就很好的解决了这一问题,前端可以直接模拟真实的数据AJAX请求! 运用 步骤 ...

  5. ls命令与cd命令

    ls命令用于显示文件目录列表,当使用ls命令时,默认显示的只有非隐藏文件或文件夹(隐藏文件在linux中前面有 ' . ' ),当不加参数时,显示当前目录. 1.ls命令语法 ls [参数][目标文件 ...

  6. Linux centos7 linux任务计划cron、chkconfig工具、systemd管理服务、unit介绍、 target介绍

    一.linux任务计划cron crontab -u  -e -l -r 格式;分 时 日 月 周 user command 文件/var/spool/corn/username 分范围0-59,时范 ...

  7. 一个基础又很重要的知识点:JDBC原理(基本案例和面试知识点)

    JDBC全称又叫做Java DataBase Connectivity,就是Java数据库连接,说白了就是用Java语言来操作数据库.这篇文章主要是对JDBC的原理进行讲解.不会专注于其使用.主要是理 ...

  8. docker原理学习-环境搭建

    1. mac下用VMware虚拟机安装ubunt16.04 2. ubuntu安装并启动ssh服务 3. 用mac终端ssh到虚拟机中 ssh didiyu@ip 输入登陆密码

  9. rendering path定义了什么?有哪些?有什么作用?有什么限制?

    rendering path 定义了光照在一个shader pass中处理的对象与顺序,如逐像素处理,逐顶点处理,向前处理,后向 deferred用于处理不透明物体,会先把它们根据深度检测,过滤后的内 ...

  10. 移动硬盘在MAC找不着了

    原因: 移动硬盘,还没有推出的时候,我就直接拔了,导致文件被损坏了. 在MAC系统下,试了很多命令,一不小心加载上了. 但是只读模式,此时我想应该是有损坏了,系统也提示要重新格式化,这个代价太大了,里 ...