一、概念

CountVectorizer 旨在通过计数来将一个文档转换为向量。当不存在先验字典时，Countvectorizer作为Estimator提取词汇进行训练，并生成一个CountVectorizerModel用于存储相应的词汇向量空间。该模型产生文档关于词语的稀疏表示，其表示可以传递给其他算法，例如LDA（ Latent Dirichlet Allocation 隐含狄利克雷分布）。

在CountVectorizerModel的训练过程中，CountVectorizer将根据语料库中的词频排序从高到低进行选择，词汇表的最大含量由vocabsize超参数来指定，超参数minDF则指定词汇表中的词语至少要在多少个不同文档中出现。

二、代码实现

2.1、构造文档集合

import java.util.Arrays;

import java.util.List;

import org.apache.spark.ml.feature.CountVectorizer;

import org.apache.spark.ml.feature.CountVectorizerModel;

import org.apache.spark.sql.Dataset;

import org.apache.spark.sql.Row;

import org.apache.spark.sql.RowFactory;

import org.apache.spark.sql.SparkSession;

import org.apache.spark.sql.types.ArrayType;

import org.apache.spark.sql.types.DataTypes;

import org.apache.spark.sql.types.Metadata;

import org.apache.spark.sql.types.StructField;

import org.apache.spark.sql.types.StructType;

 //获取spark

SparkSession spark = SparkSession.builder().appName("CountVectorizerModel").master("local").getOrCreate();

//获取数据 DataFrame

List<Row> rawData = Arrays.asList(RowFactory.create(0, new String[] {"a", "b", "c"}),

                        RowFactory.create(1, new String[] {"a", "b", "b", "c", "a"}));

StructType schema = new StructType(new StructField[] {

        new StructField("id",DataTypes.IntegerType,false,Metadata.empty()),

        new StructField("words",new ArrayType(DataTypes.StringType,true),false,Metadata.empty())

});

Dataset<Row> data = spark.createDataFrame(rawData, schema);

data.show(false);

输出结果：

+---+---------------+

|id |words          |

+---+---------------+

|0  |[a, b, c]      |

|1  |[a, b, b, c, a]|

+---+---------------+

2.2、设定参数，训练模型

通过CountVectorizer设定超参数，训练一个CountVectorizerModel，这里设定词汇表的最大量为3，设定词汇表中的词至少要在2个文档中出现过，以过滤那些偶然出现的词汇。

CountVectorizerModel cvModel = new  CountVectorizer().setInputCol("words")

                                                        .setOutputCol("features")

                                                        .setVocabSize(3)

                                                        .setMinDF(2)

                                                        .fit(data);

String[] vocabulary =  cvModel.vocabulary();

在训练结束后，可以通过CountVectorizerModel的vocabulary成员获得到模型的词汇表。

2.3、获取文档向量

使用这一模型对DataFrame进行变换，可以得到文档的向量化表示：

cvModel.transform(data).show(false);

输出结果：

+---+---------------+-------------------------+

|id |words          |features                  |

+---+---------------+-------------------------+

|0  |[a, b, c]       |(3,[0,1,2],[1.0,1.0,1.0])|

|1  |[a, b, b, c,  a]|(3,[0,1,2],[2.0,2.0,1.0])|

+---+---------------+-------------------------+

和其他Transformer不同，CountVectorizerModel可以通过指定一个先验词汇表来直接生成，如以下例子，直接指定词汇表的成员是“a”，“b”两个个词：

CountVectorizerModel cvm = new CountVectorizerModel(new String[] {"a", "b"}).setInputCol("words")

                                                                            .setOutputCol("features");

cvm.transform(data).show(false);

输出结果：

+---+---------------+-------------------+

|id |words          |features           |

+---+---------------+-------------------+

|0  |[a, b, c]      |(2,[0,1],[1.0,1.0])|

|1  |[a, b, b, c, a]|(2,[0,1],[2.0,2.0])|

+---+---------------+-------------------+

spark机器学习从0到1特征抽取–CountVectorizer（十三）的更多相关文章

spark机器学习从0到1特征抽取–Word2Vec（十四）
一.概念 Word2vec是一个Estimator,它采用一系列代表文档的词语来训练word2vecmodel.该模型将每个词语映射到一个固定大小的向量.word2vecmodel使用文档中每个词 ...
spark机器学习从0到1介绍入门之(一）
一.什么是机器学习机器学习(Machine Learning, ML)是一门多领域交叉学科,涉及概率论.统计学.逼近论.凸分析.算法复杂度理论等多门学科.专门研究计算机怎样模拟或实现人类的学习行 ...
spark机器学习从0到1特征提取 TF-IDF(十二）
一.概念 “词频-逆向文件频率”(TF-IDF)是一种在文本挖掘中广泛使用的特征向量化方法,它可以体现一个文档中词语在语料库中的重要程度. 词语由t表示,文档由d表示,语料库由D表示.词频TF ...
spark机器学习从0到1特征变换-标签和索引的转化（十六）
一.原理在机器学习处理过程中,为了方便相关算法的实现,经常需要把标签数据(一般是字符串)转化成整数索引,或是在计算结束后将整数索引还原为相应的标签. Spark ML 包中提供了几个相关的转换器 ...
spark机器学习从0到1特征选择-卡方选择器（十五）
一.公式卡方检验的基本公式,也就是χ2的计算公式,即观察值和理论值之间的偏差卡方检验公式其中:A 为观察值,E为理论值,k为观察值的个数,最后一个式子实际上就是具体计算的方法了 n 为总 ...
spark机器学习从0到1机器学习工作流 (十一）
一.概念一个典型的机器学习过程从数据收集开始,要经历多个步骤,才能得到需要的输出.这非常类似于流水线式工作,即通常会包含源数据ETL(抽取.转化.加载),数据预处理,指标提取,模型训练与交叉 ...
spark机器学习从0到1奇异值分解-SVD (七）
降维(Dimensionality Reduction) 是机器学习中的一种重要的特征处理手段,它可以减少计算过程中考虑到的随机变量(即特征)的个数,其被广泛应用于各种机器学习问题中,用于消除噪声 ...
spark机器学习从0到1决策树(六）
一.概念决策树及其集合是分类和回归的机器学习任务的流行方法. 决策树被广泛使用,因为它们易于解释,处理分类特征,扩展到多类分类设置,不需要特征缩放,并且能够捕获非线性和特征交互. 诸如随机森林和 ...
spark机器学习从0到1基本数据类型之(二）
MLlib支持存储在单个机器上的局部向量和矩阵,以及由一个或多个RDD支持的分布式矩阵. 局部向量和局部矩阵是用作公共接口的简单数据模型. 底层线性代数操作由Breeze提供. 在监督学习中使 ...

随机推荐

C# 基础知识系列- 14 IO篇之入门IO
0. 前言在之前的章节中,大致介绍了C#中的一些基本概念.这篇我们将介绍一下C#的I/O操作,这将也是一个小连续剧.这是第一集,我们先来简单了解一下C#中的I/O框架. 1. 什么是I/O I/O ...
详解数组分段和最大值最小问题（最小m段和问题）
数组分段和最大值最小问题(最小m段和问题) 问题描述给定n个整数组成的序列,现在要求将序列分割为m段,每段子序列中的数在原序列中连续排列.如何分割才能使这m段子序列的和的最大值达到最小? 清洁工:假 ...
serialize和json_encode 区别
(1)serialize主要用于php的序列化,存储到文件或者数据库中,json_encode 也是序列化,但是主要用于与其他语言比如js进行交互使用,对于传输来说,json有许多优点. (2)在显 ...
前端日期时间处理建议使用Momen
使用方法下载: http://momentjs.cn/downloads/moment.js 多语言版本:http://momentjs.cn/downloads/moment-with-local ...
centos 7 安装更新php5.6
epel remi 什么的把我弄晕了不深研这东西了,直接按步骤操作更新了. # yum install epel-release # rpm -ivh http://rpms.famillecol ...
python学习03字符串基本操作
'''字符串可以用单引号,双引号,三引号表示 '''#1.读取str1='I am a student!'#每一个字符对应一个下标,可以利用下标的方式来读取字符串对应的值——索引print(str1[ ...
2019-2020-1 20199329《Linux内核原理与分析》第三周作业
<Linux内核原理与分析>第三周作业一.上周问题总结: 第二周头脑风暴完成较慢虚拟机libc配置错误书本知识使用不够熟练二.本周学习内容: 1.实验楼环境虚拟一个x86的CPU硬 ...
曹工力荐：调试 jdk 中 rt.jar 包部分的源码（可自由增加注释，修改代码并debug）
背景大家知道,jdk安装的目录下,一般会有个src.zip包,这个包基本对应了rt.jar这个包.rt.jar这个包里面,就放了jdk中,jdk采用java实现的那部分类库代码,比如java.lan ...
【集群实战】Rsync数据同步工具
1. Rsync介绍 1.1 什么是Rsync? Rsync是一款开源的,快速的,多功能的,可实现全量及增量的本地或远程数据同步备份的优秀工具.Rsync软件适用于unix/linux/windows ...
ajax学习摘抄笔记
2019独角兽企业重金招聘Python工程师标准>>> AJAX = Asynchronous JavaScript and XML(异步的 JavaScript 和 XML). A ...

spark机器学习从0到1特征抽取–CountVectorizer（十三）

一、概念

二、代码实现

2.1、构造文档集合

2.2、设定参数，训练模型

2.3、获取文档向量

spark机器学习从0到1特征抽取–CountVectorizer（十三）的更多相关文章

随机推荐

热门专题