Spark中ml和mllib的区别

转载自：https://vimsky.com/article/3403.html

Spark中ml和mllib的主要区别和联系如下：

ml和mllib都是Spark中的机器学习库，目前常用的机器学习功能2个库都能满足需求。
spark官方推荐使用ml, 因为ml功能更全面更灵活，未来会主要支持ml，mllib很有可能会被废弃(据说可能是在spark3.0中deprecated）。
ml主要操作的是DataFrame, 而mllib操作的是RDD，也就是说二者面向的数据集不一样。相比于mllib在RDD提供的基础操作，ml在DataFrame上的抽象级别更高，数据和操作耦合度更低。
- DataFrame和RDD什么关系？DataFrame是Dataset的子集，也就是Dataset[Row], 而DataSet是对RDD的封装，对SQL之类的操作做了很多优化。
相比于mllib在RDD提供的基础操作，ml在DataFrame上的抽象级别更高，数据和操作耦合度更低。
ml中的操作可以使用pipeline, 跟sklearn一样，可以把很多操作(算法/特征提取/特征转换)以管道的形式串起来，然后让数据在这个管道中流动。大家可以脑补一下Linux管道在做任务组合时有多么方便。
ml中无论是什么模型，都提供了统一的算法操作接口，比如模型训练都是fit；不像mllib中不同模型会有各种各样的trainXXX。
mllib在spark2.0之后进入维护状态, 这个状态通常只修复BUG不增加新功能。

以上就是ml和mllib的主要异同点。下面是ml和mllib逻辑回归的例子，可以对比看一下，虽然都是模型训练和预测，但是画风很不一样。

mllib中逻辑回归的例子

    sparse_data = [

    LabeledPoint(0.0, SparseVector(, {: 0.0})),

    LabeledPoint(1.0, SparseVector(, {: 1.0})),

    LabeledPoint(0.0, SparseVector(, {: 1.0})),

    LabeledPoint(1.0, SparseVector(, {: 2.0}))

    ]

     lrm = LogisticRegressionWithSGD.train(sc.parallelize(sparse_data), iterations=)

     lrm.predict(array([0.0, 1.0]))

     lrm.predict(array([1.0, 0.0]))

     lrm.predict(SparseVector(, {: 1.0}))

     lrm.predict(SparseVector(, {: 1.0}))

     import os, tempfile

     path = tempfile.mkdtemp()

     lrm.save(sc, path)

     sameModel = LogisticRegressionModel.load(sc, path)

     sameModel.predict(array([0.0, 1.0]))

     sameModel.predict(SparseVector(, {: 1.0}))

     from shutil import rmtree

     try:

   rmtree(path)

except:

   pass

     multi_class_data = [

    LabeledPoint(0.0, [0.0, 1.0, 0.0]),

    LabeledPoint(1.0, [1.0, 0.0, 0.0]),

    LabeledPoint(2.0, [0.0, 0.0, 1.0])

    ]

     data = sc.parallelize(multi_class_data)

     mcm = LogisticRegressionWithLBFGS.train(data, iterations=, numClasses=)

     mcm.predict([0.0, 0.5, 0.0])

     mcm.predict([0.8, 0.0, 0.0])

     mcm.predict([0.0, 0.0, 0.3])

ml中的逻辑回归的例子

 from pyspark.sql import Row

 from pyspark.ml.linalg import Vectors

 bdf = sc.parallelize([

        Row(label=1.0, weight=2.0, features=Vectors.dense(1.0)),

        Row(label=0.0, weight=2.0, features=Vectors.sparse(, [], []))]).toDF()

 blor = LogisticRegression(maxIter=, regParam=0.01, weightCol="weight")

 blorModel = blor.fit(bdf)

 blorModel.coefficients

DenseVector([5.5   ])

 blorModel.intercept

-2.68

 mdf = sc.parallelize([

        Row(label=1.0, weight=2.0, features=Vectors.dense(1.0)),

        Row(label=0.0, weight=2.0, features=Vectors.sparse(, [], [])),

        Row(label=2.0, weight=2.0, features=Vectors.dense(3.0))]).toDF()

 mlor = LogisticRegression(maxIter=, regParam=0.01, weightCol="weight",

        family="multinomial")

 mlorModel = mlor.fit(mdf)

 print(mlorModel.coefficientMatrix)

DenseMatrix([[-2.3   ],

             [ 0.2   ],

             [ 2.1    ]])

 mlorModel.interceptVector

DenseVector([2.0   , 0.8   , -2.8   ])

 test0 = sc.parallelize([Row(features=Vectors.dense(-1.0))]).toDF()

 result = blorModel.transform(test0).head()

 result.prediction

0.0

 result.probability

DenseVector([0.99   , 0.00   ])

 result.rawPrediction

DenseVector([8.22   , -8.22   ])

 test1 = sc.parallelize([Row(features=Vectors.sparse(, [], [1.0]))]).toDF()

 blorModel.transform(test1).head().prediction

1.0

 blor.setParams("vector")

Traceback (most recent call last):

TypeError: Method setParams forces keyword arguments.

 lr_path = temp_path + "/lr"

 blor.save(lr_path)

 lr2 = LogisticRegression.load(lr_path)

 lr2.getMaxIter()

 model_path = temp_path + "/lr_model"

 blorModel.save(model_path)

 model2 = LogisticRegressionModel.load(model_path)

 blorModel.coefficients[] == model2.coefficients[]

True

 blorModel.intercept == model2.intercept

True

Spark中ml和mllib的区别的更多相关文章

spark：ML和MLlib的区别
ML和MLlib的区别如下: ML是升级版的MLlib,最新的Spark版本优先支持ML. ML支持DataFrame数据结构和Pipelines,而MLlib仅支持RDD数据结构. ML明确区分了分 ...
Spark机器学习中ml和mllib中矩阵、向量
1:Spark ML与Spark MLLIB区别? Spark MLlib是面向RDD数据抽象的编程工具类库,现在已经逐渐不再被Spark团队支持,逐渐转向Spark ML库,Spark ML是面向D ...
spark的ML和MLLib两个包区别和联系？
原文链接:https://www.zhihu.com/question/35225203/answer/123986969 1. 技术角度上,面向的数据集类型不一样:ML的API是面向Dataset的 ...
spark中map与flatMap的区别
作为spark初学者对,一直对map与flatMap两个函数比较难以理解,这几天看了和写了不少例子,终于把它们搞清楚了两者的区别主要在于action后得到的值例子: import org.apac ...
Spark中cache和persist的区别
cache和persist都是用于将一个RDD进行缓存的,这样在之后使用的过程中就不需要重新计算了,可以大大节省程序运行时间. cache和persist的区别基于Spark 1.6.1 的源码,可 ...
Spark中repartition和partitionBy的区别
repartition 和 partitionBy 都是对数据进行重新分区,默认都是使用 HashPartitioner,区别在于partitionBy 只能用于 PairRDD,但是当它们同时都用于 ...
Spark中groupBy groupByKey reduceByKey的区别
groupBy 和SQL中groupby一样,只是后面必须结合聚合函数使用才可以. 例如: hour.filter($"version".isin(version: _*)).gr ...
spark中map与mapPartitions区别
在spark中,map与mapPartitions两个函数都是比较常用,这里使用代码来解释一下两者区别 import org.apache.spark.{SparkConf, SparkContext ...
大数据学习day19-----spark02-------0 零碎知识点（分区，分区和分区器的区别） 1. RDD的使用（RDD的概念，特点，创建rdd的方式以及常见rdd的算子） 2.Spark中的一些重要概念
0. 零碎概念 (1) 这个有点疑惑,有可能是错误的. (2) 此处就算地址写错了也不会报错,因为此操作只是读取数据的操作(元数据),表示从此地址读取数据但并没有进行读取数据的操作 (3)分区(有时间 ...

随机推荐

【转】Internet与Intranet区别
提起Internet,大家都知道它是一个蓬勃发展的国际互联网. 而Intranet则是近两年才发展起来的新事物,通常被称作企业内部网. Internet是一组全球范围内信息资源的名字.这些资源非常巨大 ...
Java精选笔记_Servlet事件监听器
Servlet事件监听器概述在程序开发中,经常需要对某些事件进行监听,如监听鼠标点击事件.监听键盘按下事件等,此时就需要使用事件监听器. 事件监听器用于对程序中发生的事件进行监听,在监听的过程中会 ...
php导出excel（xls或xlsx）（解决长数字显示问题）
1)demo $titles = array('订单号','商品结算码','合同号','供应商名称','专柜','商品名称','商品货号','商品单价','商品总价','供应商结算金额','商品数量' ...
m4a文件在iOS上的流媒体播放
Date: 2016-03-23 Title: m4a文件在iOS上的流媒体播放 Tags: m4a, mp4, iOS, Android URL: m4a-streaming-play-on-mob ...
安卓教程：提取APK程序里图片资源的方法
有些APK程序里的图标.图片很漂亮,在使用程序时你可能会想,如果能把这些漂亮的图标.图片提取出来就好了,其实这是可以办到的,请看教程. 本教程以“电影超人”的APK安装包为例,其它APK程序的提取方法 ...
什么是SQL注入式攻击和如何防范？
什么是SQL注入式攻击? 所谓SQL注入式攻击,就是攻击者把SQL命令插入到Web表单的输入域或页面请求的查询字符串,欺骗服务器执行恶意的SQL命令.在某些表单中,用户输入的内容直接用来构造(或者影响 ...
IOS实例方法和类方法的区别
类方法和实例方法实例方法是— 类开头是+ 实例方法是用实例对象访问,类方法的对象是类而不是实例,通常创建对象或者工具类. 在实例方法里,根据继承原理发送消息给self和super其实都是发送给s ...
Suricata规则配置
Suricata 规则配置 IDS/IPS/WAF IPS.IDS和WAF分别是入侵防御系统和入侵检测系统以及WEB应用防火墙的简称,很多人说这些玩意不就是盒子吗已经过时了,其实不是,SIEM其实是有 ...
ios 去除UITextField中的空格
NSString *qName =[userNameText.text stringByTrimmingCharactersInSet:[NSCharacterSet whitespaceAndNew ...
mysql日期处在某两个时间段之间的between比较
where SYSDATE() between '2018-08-28 09:21:48' and '2018-08-28 09:25:48' sysdate()等于2018-08-28 09:23: ...

Spark中ml和mllib的区别

Spark中ml和mllib的主要区别和联系如下：

mllib中逻辑回归的例子

ml中的逻辑回归的例子

Spark中ml和mllib的区别的更多相关文章

随机推荐

热门专题