TfidfVectorizer、CountVectorizer 和 TfidfTransformer 是 sklearn 中处理自然语言常用的工具。TfidfVectorizer 相当于 CountVectorizer + TfidfTransformer。

下面先说 CountVectorizer。

CountVectorizer

CountVectorizer 的作用是将文本文档转换为计数的稀疏矩阵。下面举一个具体的例子来说明(代码来自于官方文档)。

from sklearn.feature_extraction.text import CountVectorizer

# 定义一个 list，其中每个元素是一个文档(一个句子)

corpus = [

    'This is the first document.',

    'This document is the second document.',

    'And this is the third one.',

    'Is this the first document?',

]

vectorizer = CountVectorizer()

# 将文本数据转换为计数的稀疏矩阵

X = vectorizer.fit_transform(corpus)

# 查看每个单词的位置

print(vectorizer.get_feature_names())

#输出为 ['and', 'document', 'first', 'is', 'one', 'second', 'the', 'third', 'this']

# 由于 X 存储为稀疏矩阵，需要转换为 array 才能查看

print(X.toarray())

# 输出为

# [[0 1 1 1 0 0 1 0 1]

#  [0 2 0 1 0 1 1 0 1]

#  [1 0 0 1 1 0 1 1 1]

#  [0 1 1 1 0 0 1 0 1]]

其中 vectorizer.get_feature_names()包含了数据中出现的所有单词去重后的集合，相当于一个词典。当然你也可以给 CountVectorizer 提供一个单独的词典，否则 CountVectorizer 会自己从数据中学习到词典。

X.toarray()是查看文档转化后的计数矩阵。比如矩阵的第一行[0 1 1 1 0 0 1 0 1]对应于文档中的第一句This is the first document.，表示词典中对应位置的单词出现的次数。

This is the first document转为为计数矩阵后如下：

and	document	first	is	one	second	the	third	this
0	1	1	1	0	0	1	0	1

其他句子也是类似的规则，这里不再赘述。

原来文档元素个数是 4，每个元素是一个句子，长度不固定。X.toarray()的维度是 (4,9)，

可以看到转化之后的计数矩阵的元素是 4，每个元素的长度固定为 9，这里的 9 就是字典的长度。

TfidfTransformer

使用计算 tf-idf。tf 表示词频率，而 tf-idf 表示词频率乘以逆文档频率。这是信息检索中常用的一种术语权重方案，在文档分类中也得到了很好的应用。如果你还不了解 tf-idf，请阅读阮一峰老师的这篇文章。

使用 TfidfTransformer 如下，输出的 tf-idf 矩阵维度也是 (4,9)

from sklearn.feature_extraction.text import TfidfTransformer

transform = TfidfTransformer()

Y = transform.fit_transform(X)    # 这里的输入是上面文档的计数矩阵

print(Y.toarray())                # 输出转换为tf-idf后的 Y 矩阵

输出为：

[[0.         0.46979139 0.58028582 0.38408524 0.         0.

  0.38408524 0.         0.38408524]

 [0.         0.6876236  0.         0.28108867 0.         0.53864762

  0.28108867 0.         0.28108867]

 [0.51184851 0.         0.         0.26710379 0.51184851 0.

  0.26710379 0.51184851 0.26710379]

 [0.         0.46979139 0.58028582 0.38408524 0.         0.

  0.38408524 0.         0.38408524]]

TfidfVectorizer

TfidfVectorizer 相当于 CountVectorizer 和 TfidfTransformer 的结合使用。上面代码先调用了 CountVectorizer，然后调用了 TfidfTransformer。使用 TfidfVectorizer 可以简化代码如下：

# 把每个设备的 app 列表转换为字符串，以空格分隔

apps=deviceid_packages['apps'].apply(lambda x:' '.join(x)).tolist()

vectorizer=CountVectorizer()

transformer=TfidfTransformer()

# 原来的 app 列表 转换为计数的稀疏矩阵。

cntTf = vectorizer.fit_transform(apps)

# 得到 tf-idf 矩阵

tfidf=transformer.fit_transform(cntTf)

# 得到所有的 APP 列表，相当于词典

word=vectorizer.get_feature_names()

如果你觉得这篇文章对你有帮助，不妨点个赞，让我有更多动力写出好文章。

我的文章会首发在公众号上，欢迎扫码关注我的公众号张贤同学。

TfidfVectorizer、CountVectorizer 和 TfidfTransformer 的简单教程的更多相关文章

文本数据预处理：sklearn 中 CountVectorizer、TfidfTransformer 和 TfidfVectorizer
文本数据预处理的第一步通常是进行分词,分词后会进行向量化的操作.在介绍向量化之前,我们先来了解下词袋模型. 1.词袋模型(Bag of words,简称 BoW ) 词袋模型假设我们不考虑文本中词与词 ...
Git和Github简单教程
原文链接:Git和Github简单教程网络上关于Git和GitHub的教程不少,但是这些教程有的命令太少不够用,有的命令太多,使得初期学习的时候需要额外花不少时间在一些当前用不到的命令上. 这篇文章 ...
FusionCharts简单教程(三)-----如何自定义图表上的工具提示
最近有蛮多人总是问我这个FusionCharts制表的问题,帮助他们解决之后,在昨晚发现以前整理的笔记中有这个简单教程,而且以前也发表了几篇这个博文,所以就将其全部上传上来供别人参考.如有不正确之处望 ...
FusionCharts简单教程(八)-----使用网格组件
有时候我们会觉得使用图像不够直接,对于数据的显示没有表格那样直接明了.所以这里就介绍如何使用网格组件.将网格与图像结合起来.网格组件能够将FusionCharts中的单序列数据以列表的 ...
Qt Quick 简单教程
上一篇<Qt Quick 之 Hello World 图文详解>我们已经分别在电脑和 Android 手机上运行了第一个 Qt Quick 示例—— HelloQtQuickApp ,这篇 ...
Git和Github简单教程(收藏)
原文链接:Git和Github简单教程目录: 零.Git是什么一.Git的主要功能:版本控制二.概览三.Git for Windows软件安装四.本地Git的使用五.Github与Git的 ...
mysql安装简单教程(自动安装/配置安装)
mysql安装简单教程(自动安装/配置安装) 1.1前言: 由于特殊原因,在最近2-3个月里mysql真是安装了无数遍,每次安装都要上网找教程,每个教程基本都不一样,因此还是自己写下来比较好,毕竟自己 ...
平衡树简单教程及模板（splay, 替罪羊树, 非旋treap）
原文链接https://www.cnblogs.com/zhouzhendong/p/Balanced-Binary-Tree.html 注意是简单教程,不是入门教程. splay 1. 旋转: 假设 ...
LayaAir引擎开发HTML5最简单教程(面向JS开发者)
LayaAir引擎开发HTML5最简单教程(面向JS开发者) 一.总结一句话总结:开发游戏还是得用游戏引擎来开发,其实很简单啦切记:开发游戏还是得用游戏引擎来开发,其实很简单,引擎很多东西都帮你做 ...

随机推荐

利用updatexml()报错注入mysql
基本介绍一下updatexml() updatexml(XML_document, XPath_string, new_value) XML_document是文档对象的名称 XPath_string ...
Bug--Tomcat Error start child
添加Quartz之后报错下面的Cause by: More than one fragment with the name [spring_web] was found. This is not l ...
Numpy修改数组中的元素值
import numpy as np x = np.arange(8) # [0 1 2 3 4 5 6 7] # 在数组尾部追加一个元素 np.append(x,10) # array([ 0, 1 ...
FPAG_Microblaze_PWM_定时器
由于Xilinx底层库的定时器没有PWM例程,调试过程中费了不少劲.生产PWM需要两个定时器同时工作,一个控制频率,一个控制占空比,位数可通过硬件设置. #include "xtmrctr_ ...
PHP printf() 函数
实例输出格式化的字符串: <?php高佣联盟 www.cgewang.com$number = 9;$str = "Beijing";printf("There ...
JDK8的Optional用法
参考资料:https://www.baeldung.com/java-optional https://mp.weixin.qq.com/s/P2kb4fswb4MHfb0Vut_kZg 1. 描述 ...
如何在 Android 安卓手机上运行 Node.js 应用｜如何在安卓手机配置node开发环境
最近在学习js,由于没法随身携带笔记本电脑,在手机翻阅<JavaScript高级程序设计>时,时常想调试一下书中的代码.于是就有了,能否在手机上配置一个js开发环境.考虑到手机上的Chro ...
“随手记”开发记录day02
今天完成了向瑜- 布局: 1.修改日期(√) 2.选择分类(√) 3.输入金额(√) 赵常恒- 1.登录,注册页面布局(√) 刘志霄- 1.个人信息页面规划(√)
用 Python 可以实现侧脸转正脸？我也要试一下！
作者 | 李秋键责编 | Carol 封图 | CSDN 下载自视觉中国很多人学习python,不知道从何学起.很多人学习python,掌握了基本语法过后,不知道在哪里寻找案例上手.很多已经做案例 ...
webMvcConfigurer的详情
摘要 Spring的WebMvcConfigurer接口提供了很多方法让我们来定制SpringMVC的配置.而且Spring还提供了WebMvcConfigurerAdap ...

TfidfVectorizer、CountVectorizer 和 TfidfTransformer 的简单教程

CountVectorizer

TfidfTransformer

TfidfVectorizer

TfidfVectorizer、CountVectorizer 和 TfidfTransformer 的简单教程的更多相关文章

随机推荐

热门专题