Spark Java API 之 CountVectorizer

由于在Spark中文本处理与分析的一些机器学习算法的输入并不是文本数据，而是数值型向量。因此，需要进行转换。而将文本数据转换成数值型的向量有很多种方法，CountVectorizer是其中之一。

A CountVectorizer converts a collection of text documents into a vector representing the word count of text documents.

在构建向量时，有两个重要的参数：VocabSize和MinDF。前者表示词典的大小，后者表示当文档中某个Term出现的次数小于MinDF时，则不计入词典（该Term不属于词典中的单词）。

比如说现在有两篇文档：【"w1", "w2", "w4", "w5", "w2"】，【"w1", "w2", "w3"】

CountVectorizer cv = new CountVectorizer().setInputCol("text").setOutputCol("feature")

                .setVocabSize(3).setMinDF(2);

根据上面代码中的参数设置，词典大小为3，即一共可以有三个Term。由于在所有的文档中，"w1"出现2次，"w2"出现2次，因此计入词典。而"w3"、"w4"、"w5"只出现一次，不属于词典中的单词(Term)。如下图所示：词典中只有两个Term

When the dictionary is not defined CountVectorizer iterates over the dataset twice to prepare

the dictionary based on frequency and size.

CountVectorizer 首先扫描Dataset（文本数据）生成词典，然后再次扫描生成向量模型（CountVectorizerModel）

在构造Dataset 时，需要指定模式。用模式来解释Dataset中每一行的数据。

        StructType schema = new StructType(new StructField[]{

                new StructField("text", new ArrayType(DataTypes.StringType, true), false, Metadata.empty())

        });

A field inside a StructType. param: name The name of this field. param: dataType The data type of this field. param: nullable Indicates if values of this field can be null values. param: metadata The metadata of this field. The metadata should be preserved during transformation if the content of the column is not modified

第一个参数是：名称；第二个参数是dataType 数据类型；第三个参数是标识该字段的值是否可以为空；第四个参数为字段的元数据信息。

整个示例代码：

import org.apache.spark.ml.feature.CountVectorizer;

import org.apache.spark.ml.feature.CountVectorizerModel;

import org.apache.spark.sql.Dataset;

import org.apache.spark.sql.Row;

import org.apache.spark.sql.RowFactory;

import org.apache.spark.sql.SparkSession;

import org.apache.spark.sql.types.*;

import java.util.Arrays;

import java.util.List;

public class CounterVectorExample {

    public static void main(String[] args) {

        SparkSession spark = SparkSession.builder().appName("CountVectorizer").master("spark://172.25.129.170:7077").getOrCreate();

        List<Row> data = Arrays.asList(

//                RowFactory.create(Arrays.asList("a", "b", "c")),

//                RowFactory.create(Arrays.asList("a", "b", "b", "c", "a")),

//                RowFactory.create(Arrays.asList("a", "b", "a", "b"))

                RowFactory.create(Arrays.asList("w1", "w2", "w3")),

                RowFactory.create(Arrays.asList("w1", "w2", "w4", "w5", "w2"))

        );

        StructType schema = new StructType(new StructField[]{

                new StructField("text", new ArrayType(DataTypes.StringType, true), false, Metadata.empty())

        });

        Dataset<Row> df = spark.createDataFrame(data, schema);

        CountVectorizer cv = new CountVectorizer().setInputCol("text").setOutputCol("feature")

                .setVocabSize(3).setMinDF(2);

        CountVectorizerModel cvModel = cv.fit(df);

        //prior dictionary

        CountVectorizerModel cvm = new CountVectorizerModel(new String[]{"a", "b", "c"}).setInputCol("text")

                .setOutputCol("feature");

//        cvm.

        cvModel.transform(df).show(false);

        spark.stop();

    }

}

输出结果默认是以稀疏向量表示：

A sparse vector represented by an index array and a value array.

param: size size of the vector. param: indices index array, assume to be strictly increasing. param: values value array, must have the same length as the index array.

第一个字段代表：向量长度，由于这里词典中只有2个Term，因此转换出来的向量长度为2；第二个字段：索引下标；第三个字段：索引位置处相应的向量元素值。由上图中位置0处的Term是 w2，位置1处的Term是w1，因此，输出：

当然，我们也可以预先定义词典：在构造CountVectorizerModel的时候指定词典：【"w1", "w2", "w3"】

        //prior dictionary

        CountVectorizerModel cvm = new CountVectorizerModel(new String[]{"w1", "w2", "w3"}).setInputCol("text").setOutputCol("feature");

        cvm.transform(df).show(false);

对于文本：[w1,w2,w3]，每个Term都在词典中，且出现了一次，因此稀疏特征向量表示为：(3,[0,1,2],[1.0,1.0,1.0])。其中，3代表向量的长度为3维向量；[0,1,2]表示向量的索引；[1.0,1.0,1.0]表示，在相应的索引处，每个元素值为1.0（即各个Term只出现了一次）。而对于文本[w1, w2, w4, w5, w2]，因为w4和w5不在词典中，w1出现一次，w2出现2次，故其特征如下：

可以看出：对于CountVectorizerModel，向量长度就是词典的大小。

系列文章：

spark JAVA 开发环境搭建及远程调试

原文：https://www.cnblogs.com/hapjin/p/9899164.html

Spark Java API 之 CountVectorizer的更多相关文章

Spark Java API 计算 Levenshtein 距离
Spark Java API 计算 Levenshtein 距离在上一篇文章中,完成了Spark开发环境的搭建,最终的目标是对用户昵称信息做聚类分析,找出违规的昵称.聚类分析需要一个距离,用来衡量两 ...
在 IntelliJ IDEA 中配置 Spark(Java API) 运行环境
1. 新建Maven项目初始Maven项目完成后,初始的配置(pom.xml)如下: 2. 配置Maven 向项目里新建Spark Core库 <?xml version="1.0& ...
spark (java API) 在Intellij IDEA中开发并运行
概述:Spark 程序开发,调试和运行,intellij idea开发Spark java程序. 分两部分,第一部分基于intellij idea开发Spark实例程序并在intellij IDEA中 ...
spark java API 实现二次排序
package com.spark.sort; import java.io.Serializable; import scala.math.Ordered; public class SecondS ...
spark java api数据分析实战
1 spark关键包  <dependency> <groupId>fakepath</groupId> <artifac ...
【Spark Java API】broadcast、accumulator
转载自:http://www.jianshu.com/p/082ef79c63c1 broadcast 官方文档描述: Broadcast a read-only variable to the cl ...
Spark基础与Java Api介绍
原创文章,转载请注明: 转载自http://www.cnblogs.com/tovin/p/3832405.html 一.Spark简介 1.什么是Spark 发源于AMPLab实验室的分布式内存计 ...
利用SparkLauncher 类以JAVA API 编程的方式提交Spark job
一.环境说明和使用软件的版本说明: hadoop-version:hadoop-2.9.0.tar.gz spark-version:spark-2.2.0-bin-hadoop2.7.tgz jav ...
Spark：java api实现word count统计
方案一:使用reduceByKey 数据word.txt 张三李四王五李四王五李四王五李四王五王五李四李四李四李四李四代码: import org.apache.spar ...

随机推荐

SAP PS 模块，项目、WBS与网络作业概念
项目定义项目定义是项目的唯一标识.通过项目定义,决定了包含于其中的所有WBS元素的组织结构.计划方法.预算方式以及结算方法等信息.而项目定义中的数据,则主要来源于“项目参数文件”,所以创建项目定义时 ...
关于vue-router中点击浏览器前进后退地址栏路由变了但是页面没跳转
情景: 在进行正常页面跳转操作后(页面A跳转到页面B),点击浏览器的左上角的‘后退’按钮,点击后,可以看到url地址已经发生了变化(url由页面B变为页面A),hash值也已经是上一页的路由,但是浏览 ...
ElasticSearch（九）：elasticsearch-head插件安装
安装node 安装elasticsearch-head需要node.js的支持. 下载最新的node.js,下载地址:https://nodejs.org/en/download/ 将下载后的安装包放 ...
Java MultipartFile 使用记录
private void file(String path,MultipartFile file){ String separator = "/"; String originFi ...
MAX
Max的用法1(Min类似) Matlab中max函数在矩阵中求函数大小的实例如下: C = max(A)返回一个数组各不同维中的最大元素.如果A是一个向量,max(A)返回A中的最大元素.如果A是一 ...
python错误和调试
在程序运行过程中,总会遇到各种各样的错误. 有的错误是程序编写有问题造成的,比如本来应该输出整数结果输出了字符串,这种错误我们通常称之为bug,bug是必须修复的. 有的错误是用户输入造成的,比如让用 ...
在Bootstrap开发框架中使用bootstrap-datepicker插件
在基于Boostrap的Web开发中,往往需要录入日期内容,基于Boostrap的插件中,关于日期的录入可以使用bootstrap-datepicker这个非常不错的插件,以替代默认的type=dat ...
linux下开启、关闭、重启mysql服务命令
一. 启动1.使用 service 启动:service mysql start2.使用 mysqld 脚本启动:/etc/inint.d/mysql start3.使用 safe_mysqld 启动 ...
循环语句--do...while
do...while循环格式: 执行流程执行顺序:①③④>②③④>②③④…②不满足为止. ①负责完成循环变量初始化. ②负责判断是否满足循环条件,不满足则跳出循环. ③具体执行的语句 ...
让linux启动更快的方法
导读进行 Linux 内核与固件开发的时候,往往需要多次的重启,会浪费大把的时间. 在所有我拥有或使用过的电脑中,启动最快的那台是 20 世纪 80 年代的电脑.在你把手从电源键移到键盘上的时候,B ...

Spark Java API 之 CountVectorizer

Spark Java API 之 CountVectorizer

Spark Java API 之 CountVectorizer的更多相关文章

随机推荐

热门专题