sklearn.feature_extraction.DictVectorizer

sklearn.feature_extraction.DictVectorizer：将字典组成的列表转换成向量。(将特征与值的映射字典组成的列表转换成向量)

1. 特征矩阵行代表数据，列代表特征，0表示该数据没有该特征

from sklearn.feature_extraction import DictVectorizer

# 设置sparse=False获得numpy ndarray形式的结果

v = DictVectorizer(sparse=False)

D = [{'foo':1, 'bar':2}, {'foo':3, 'baz':1}]

# 对字典列表D进行转换，转换成特征矩阵

X = v.fit_transform(D)

# 特征矩阵行代表数据，列代表特征，0表示该数据没有该特征

print(X)

[[ 2.  0.  1.]

 [ 0.  1.  3.]]

2. get_feature_names()获取特征列名

# 获取特征列名

print(v.get_feature_names())

['bar', 'baz', 'foo']

3. inverse_transform将特征矩阵还原成原始数据

# inverse_transform将特征矩阵还原成原始数据

# inverse:相反的

print(v.inverse_transform(X) == D)

True

4. 直接进行转换，不先进行拟合的话，无法识别新的特征

# 直接进行转换，不先进行拟合的话，无法识别新的特征。即没有fit。

print(v.transform([{'foo':4, 'unseen_feature':3}]))

[[ 0.  0.  4.]]

5. 配合特征选择

from sklearn.feature_selection import SelectKBest, chi2

# 使用卡方统计筛选出最好的2个特征

support = SelectKBest(chi2, k=2).fit(X, [0,1])

# 进行筛选，筛选的结果会自动覆盖原有特征矩阵

print(v.restrict(support.get_support()))

print(v.get_feature_names())

DictVectorizer(dtype=<class 'numpy.float64'>, separator='=', sort=True,

               sparse=False)

['bar', 'foo']

来自：https://www.cnblogs.com/hufulinblog/p/10591339.html

sklearn.feature_extraction.DictVectorizer的更多相关文章

特征抽取: sklearn.feature_extraction.DictVectorizer
sklearn.featture_extraction.DictVectorizer: 将特征与值的映射字典组成的列表转换成向量. DictVectorizer通过使用scikit-learn的est ...
特征抽取: sklearn.feature_extraction.FeatureHasher
sklearn.feature_extraction.FeatureHasher(n_features=1048576, input_type="dict", dtype=< ...
sklearn.feature_extraction.text 的TfidfVectorizer函数
TfidfVectorizer函数主要用于,将文档(句子)等通过 tf-idf值来进行表示,也就是用一个tf-idf值的矩阵来表示文档(句子也可). from sklearn.feature_extr ...
sklearn.feature_extraction.text.CountVectorizer 学习
CountVectorizer: CountVectorizer可以将文本文档集合转换为token计数矩阵.(token可以理解成词) 此实现通过使用scipy.sparse.csr_matrix产生 ...
《机学一》特征工程1 ——文本处理：sklearn抽取、jieba中文分词、TF和IDF抽取
零.机器学习整个实现过程: 一.机器学习数据组成特征值: 目标值: 二.特征工程和文本特征提取 1.概要: 1.特征工程是什么 2.特征工程的意义:直接影响预测结果 3.scikit-learn库 ...
利用sklearn进行字典&文本的特征提取
写在前面这篇博客主要内容: 应用DictVectorizer实现对类别特征进行数值化.离散化应用CountVectorizer实现对文本特征进行数值化特征提取API sklearn.featur ...
Sklearn 与 TensorFlow 机器学习实战—一个完整的机器学习项目
本章中,你会假装作为被一家地产公司刚刚雇佣的数据科学家,完整地学习一个案例项目.下面是主要步骤: 项目概述. 获取数据. 发现并可视化数据,发现规律. 为机器学习算法准备数据. 选择模型,进行训练. ...
[占位-未完成]scikit-learn一般实例之十一:异构数据源的特征联合
[占位-未完成]scikit-learn一般实例之十一:异构数据源的特征联合 Datasets can often contain components of that require differe ...
AI学习---特征工程【特征抽取、特征预处理、特征降维】
学习框架特征工程(Feature Engineering) 数据和特征决定了机器学习的上限,而模型和算法只是逼近这个上限而已什么是特征工程: 帮助我们使得算法性能更好发挥性能而已 sklearn主 ...

随机推荐

jquery 知识整理
大纲一.jQuery简介二.jQuery 和Dom关系及jQuery版本 1.jQuery版本 2.jQuery和Dom转换三.jQuery 选择器 1.1.基本 1.2.层级 2.基本筛选器 3 ...
wordcloud：让你的词语变成黑云
介绍对文本中出现频率较高的关键词给予视觉化的显示使用 import jieba import codecs import wordcloud file = r"C:\Users\Admi ...
linux 查看cpu核心数
1.查看CPU个数 cat /proc/cpuinfo |grep "physical id"|sort|uniq|wc -l 2.查看每个物理CPU含有的核心个数 cat /pr ...
A Neural Probabilistic Language Model (2003)论文要点
论文链接:http://www.jmlr.org/papers/volume3/bengio03a/bengio03a.pdf 解决n-gram语言模型(比如tri-gram以上)的组合爆炸问题,引入 ...
lightinthebox头部分类菜单下拉导航，使鼠标移到See All Categories就显示下拉菜单
lightinthebox头部分类菜单下拉导航,使鼠标移到See All Categories就显示下拉菜单打开includes\templates\lightinthebox\common\tpl ...
JS转为number的四种方法
// 1.Number() var num1 = Number(true); console.log(num1); var num2 = Number(" ") console.l ...
springboot+elasticsearch 报错
错误1: .d.e.r.s.AbstractElasticsearchRepository : failed to load elasticsearch nodes : org.elasticsear ...
Zookeeper服务注册与发现原理浅析
了解Zookeeper的我们都知道,Zookeeper是一种分布式协调服务,在分布式应用中,主要用来实现分布式服务的注册与发现以及分布式锁,本文我们简单介绍一下Zookeeper是如何实现服务的注册与 ...
[Linux系统] (1)常用操作(CentOS 7.x)
一.Linux系统配置 1.修改主机名 [/etc/hostname] vi /etc/hostname 在其中将旧名字修改为新主机名,保存,重启生效. 2.本地DNS映射 [/etc/hosts] ...
Travis CI Could not find or load main class org.gradle.wrapper.GradleWrapperMain 错误
问题在 Travis CI 编译的时候出现 Error: Could not find or load main class org.gradle.wrapper.GradleWrapperMain ...

sklearn.feature_extraction.DictVectorizer

sklearn.feature_extraction.DictVectorizer的更多相关文章

随机推荐

热门专题