spark MLlib DataType ML中的数据类型

package ML.DataType;

import org.apache.spark.SparkConf;

import org.apache.spark.api.java.JavaRDD;

import org.apache.spark.api.java.JavaSparkContext;

import org.apache.spark.mllib.linalg.*;

import org.apache.spark.mllib.linalg.distributed.*;

import org.apache.spark.mllib.regression.LabeledPoint;

import org.apache.spark.mllib.util.MLUtils;

import java.util.Arrays;

/**

 * TODO

 *

 * @ClassName: DataType

 * @author: DingH

 * @since: 2019/4/3 10:06

 */

public class DataType {

    public static void main(String[] args) {

        SparkConf conf = new SparkConf().setMaster("local").setAppName("Datatype");

        JavaSparkContext javaSparkContext = new JavaSparkContext(conf);

        /**

         * @Title: vectors.dense方法生成向量，sparse生成稀疏向量。第一个3是向量的大小，第二个列表是不为0的下表，第三个是对应的value.

         */

        Vector dense = Vectors.dense(1.0, 0.0, 3.0);

        Vector sparse = Vectors.sparse(3, new int[]{0, 2}, new double[]{1.0, 3.0});

        /**

         * @Title: 对向量进行标记，1.0为正，0.0为负

         */

        LabeledPoint labeledPoint = new LabeledPoint(1.0, dense);

        LabeledPoint labeledPoint1 = new LabeledPoint(0.0, sparse);

        /**

         * @Title: libSVM文件： lable1  index1:value1  index2:value2

         */

        JavaRDD<LabeledPoint> labeledPointJavaRDD = MLUtils.loadLibSVMFile(javaSparkContext.sc(), "/data...").toJavaRDD();

        /**

         * @Title: matricex.dense生成矩阵。3*2的矩阵  列式优先

         * [1.0 2.0

         * 3.0 4.0

         * 5.0 6.0]

         */

        Matrix dense1 = Matrices.dense(3, 2, new double[]{1.0, 3.0, 5.0, 2.0, 4.0, 6.0});

        /**

         * @Title: matricex.sparse生成稀疏矩阵。3*2的矩阵。第三个参数和第四个参数对应为不为0的元素。

         * [9 0

         * 0 6

         * 0 8]     第三个参数： 1-0=1，3-1=2，每列不为0的元素分别是1个和2个。   第四个参数，从头开始遍历行，不为0的行。

         */

        Matrix sparse1 = Matrices.sparse(3, 2, new int[]{0, 1, 3}, new int[]{0, 2, 1}, new double[]{9, 6, 8});

        /**

         * @Title: Rowmatrix

         */

        JavaRDD<Vector> parallelize = javaSparkContext.parallelize(Arrays.asList(

                Vectors.dense(1, 2, 3),

                Vectors.dense(2, 3, 4),

                Vectors.dense(3, 4, 5)

        ));

        RowMatrix rowMatrix = new RowMatrix(parallelize.rdd());

        long l = rowMatrix.numRows();

        long l1 = rowMatrix.numCols();

        QRDecomposition<RowMatrix, Matrix> rowMatrixMatrixQRDecomposition = rowMatrix.tallSkinnyQR(true);

        /**

         * @Title: IndexedRowMatrix

         */

        JavaRDD<IndexedRow> parallelize1 = javaSparkContext.parallelize(Arrays.asList(

                new IndexedRow(1, dense),

                new IndexedRow(2, dense),

                new IndexedRow(3, dense)

        ));

        IndexedRowMatrix indexedRowMatrix = new IndexedRowMatrix(parallelize1.rdd());

        long l2 = indexedRowMatrix.numCols();

        long l3 = indexedRowMatrix.numRows();

        RowMatrix rowMatrix1 = indexedRowMatrix.toRowMatrix();

        /**

         * @Title: CoordinateMatrix

         */

        JavaRDD<MatrixEntry> parallelize2 = javaSparkContext.parallelize(Arrays.asList(

                new MatrixEntry(0, 1, 3),

                new MatrixEntry(1, 3, 1),

                new MatrixEntry(2, 1, 1)

        ));

        CoordinateMatrix coordinateMatrix = new CoordinateMatrix(parallelize2.rdd());

        long l4 = coordinateMatrix.numCols();

        long l5 = coordinateMatrix.numRows();

        IndexedRowMatrix indexedRowMatrix1 = coordinateMatrix.toIndexedRowMatrix();

        /**

         * @Title: BlocakMatrix 。   toBlockMatrix可以设置参数，规定row,col的大小，默认1024*1024

         */

        BlockMatrix cache = indexedRowMatrix.toBlockMatrix().cache();

        BlockMatrix cache1 = coordinateMatrix.toBlockMatrix().cache();

        cache.validate();

        BlockMatrix multiply = cache.transpose().multiply(cache);

    }

}

spark MLlib DataType ML中的数据类型的更多相关文章

spark mllib和ml类里面的区别
mllib是老的api,里面的模型都是基于RDD的,模型使用的时候api也是有变化的(model这里是naiveBayes), (1:在模型训练的时候是naiveBayes.run(data: RDD ...
Spark MLlib数据类型
MLlib支持几种数据类型:本地向量(local vectors),和存储在一个简单机器中的矩阵(matrices),以及由一个或多个RDDs组成的分布式矩阵. 1,本地向量(Local Ve ...
在Java Web中使用Spark MLlib训练的模型
PMML是一种通用的配置文件,只要遵循标准的配置文件,就可以在Spark中训练机器学习模型,然后再web接口端去使用.目前应用最广的就是基于Jpmml来加载模型在javaweb中应用,这样就可以实现跨 ...
Spark的MLlib和ML库的区别
机器学习库(MLlib)指南 MLlib是Spark的机器学习(ML)库.其目标是使实际的机器学习可扩展和容易.在高层次上,它提供了如下工具: ML算法:通用学习算法,如分类,回归,聚类和协同过滤特 ...
基于spark Mllib(ML)聚类实战
写在前面的话:由于spark2.0.0之后ML中才包括LDA,GaussianMixture 模型,这里k-means用的是ML模块做测试,LDA,GaussianMixture 则用的是ML ...
Spark Mllib里的Mllib基本数据类型（图文详解）
不多说,直接上干货! Spark Mllib基本数据类型,根据不同的作用和应用场景,分为四种不同的类型 1.Local vector : 本地向量集,主要向spark提供一组可进行操作的数据集合 2 ...
转载：Databricks孟祥瑞：ALS 在 Spark MLlib 中的实现
Databricks孟祥瑞:ALS 在 Spark MLlib 中的实现发表于2015-05-07 21:58| 10255次阅读| 来源<程序员>电子刊| 9 条评论| 作者孟祥瑞大 ...
Spark MLlib中KMeans聚类算法的解析和应用
聚类算法是机器学习中的一种无监督学习算法,它在数据科学领域应用场景很广泛,比如基于用户购买行为.兴趣等来构建推荐系统. 核心思想可以理解为,在给定的数据集中(数据集中的每个元素有可被观察的n个属性), ...
Apache Spark源码走读之23 -- Spark MLLib中拟牛顿法L-BFGS的源码实现
欢迎转载,转载请注明出处,徽沪一郎. 概要本文就拟牛顿法L-BFGS的由来做一个简要的回顾,然后就其在spark mllib中的实现进行源码走读. 拟牛顿法数学原理代码实现 L-BFGS算法中使 ...

随机推荐

【BZOJ5502】[GXOI/GZOI2019]与或和（单调栈）
[BZOJ5502][GXOI/GZOI2019]与或和(单调栈) 题面 BZOJ 洛谷题解看到位运算就直接拆位,于是问题变成了求有多少个全\(0\)子矩阵和有多少个全\(1\)子矩阵. 这两个操 ...
GiBbook实用配置以及插件
GitBook可以在您的计算机上用于构建本地书籍,,可以本地预览安装gitbook 环境要求: 安装GitBook,您的系统需要安装NodeJS(推荐v4.0.0及以上版本) NodeJS下载地址 ...
python5 数字类型字符串类型列表类型
数字类型 # 了了解:py2中小整数用int存放,大整数用long # 1.整型 num = -1000000000000000000000000000000000000000000000000 ...
utf8mb4的大小写敏感性测试及其修改方法
utf8mb4的大小写敏感性测试及其修改方法 utf8mb4_ unicode_ ci 与 utf8mb4_ general_ ci 如何选择字符除了需要存储,还需要排序或比较大小,涉及到与编码字符集 ...
idea中的一些快捷键，未完待续......
1.快速查看注释的渲染效果在keymap中查找“Quick Documentation”并设置自己喜欢的快捷键即可 2.全局搜索在keymap中查找“Replace in Path”并设置自己喜欢 ...
Slow ReadProcessor&Error Slow BlockReceiver错误日志分析(转)
1.总结 "Slow ReadProcessor" 和"Slow BlockReceiver"往往是因为集群负载比较高或者某些节点不健康导致的,本文主要是帮助你 ...
分布式监控系统开发【day37】:填充表配置项目（三）
一.注册站点初始化数据库 1.目录结构 2.初始化数据库 python3 manage.py makemigrations python3 manage.py migrate #django2.0之前 ...
SQLMAP注入教程-11种常见SQLMAP使用方法详解
sqlmap也是渗透中常用的一个注入工具,其实在注入工具方面,一个sqlmap就足够用了,只要你用的熟,秒杀各种工具,只是一个便捷性问题,sql注入另一方面就是手工党了,这个就另当别论了.今天把我一直 ...
第十三节: EF的三种模式(三) 之来自数据库的CodeFirst模式
一. 简介 [来自数据库的Code First模式]实质上并不是CodeFirst模式,而是DBFirst模式的轻量级版本,在该模式中取消了edmx模型和T4模板,直接生成了EF上下文和相应的类,该模 ...
Mocha
Mocha https://mochajs.org/#installation Mocha is a feature-rich JavaScript test framework running on ...

spark MLlib DataType ML中的数据类型

spark MLlib DataType ML中的数据类型的更多相关文章

随机推荐

热门专题