写这个系列是因为最近公司在搞技术分享,学习Spark,我的任务是讲PySpark的应用,因为我主要用Python,结合Spark,就讲PySpark了。然而我在学习的过程中发现,PySpark很鸡肋(至少现在我觉得我不会拿PySpark做开发)。为什么呢?原因如下:

  1.PySpark支持的算法太少了。我们看一下PySpark支持的算法:(参考官方文档)

  前面两个pyspark.sql和pyspark.streaming是对sql和streaming的支持。主要是读取数据,和streaming处理这种方式(当然这是spark的优势,要是这也不支持真是见鬼了)。pyspark.ml和pyspark.mllib分别是ml的api和mllib的api,ml的算法真心少啊,而且支持的功能很有限,譬如Lr(逻辑回归)和GBT目前只支持二分类,不支持多分类。mllib相对好点,支持的算法也多点,虽然昨天发的博文讲mlllib的时候说过有的算法不支持分布式,所以才会有限,但是我在想,如果我需要用到A算法,而Ml和Mllib的包里面都没有,这样是不是意味着要自己开发分布式算法呢?代价有点大诶,感觉写这个的时间不如多找找有用的特征,然后上LR,这样效果说不定更好。因为目前还没有在实际中用过,所以以上只是我的想法。下面把ml和mllib的所有api列出来,这样看的更清楚。

  

图一 pyspark.ml的api

图二 pyspark.mllib的api

  从上面两张图可以看到,mllib的功能比ml强大的不是一点半点啊,那ml这个包的存在还有什么意义呢?不懂(如果有了解的欢迎留言)。虽然有这么多疑问,但是我还是跟大家讲了,用的数据依然是iris(其实我真心想换个数据集啊 == ,下次换)。上代码:

 from pyspark.sql import SQLContext
sqlContext = SQLContext(sc)
df = sqlContext.read.format('com.databricks.spark.csv').options(header='true', inferschema='true').load('iris.csv')
# Displays the content of the DataFrame to stdout
df.show() from pyspark.ml.feature import StringIndexer
indexer = StringIndexer(inputCol="Species", outputCol="labelindex")
indexed = indexer.fit(df).transform(df)
indexed.show() from pyspark.sql import Row
from pyspark.mllib.linalg import Vectors
from pyspark.ml.classification import NaiveBayes # Load and parse the data
def parseRow(row):
return Row(label=row["labelindex"],
features=Vectors.dense([row["Sepal.Length"],
row["Sepal.Width"],
row["Petal.Length"],
row["Petal.Width"]])) ## Must convert to dataframe after mapping
parsedData = indexed.map(parseRow).toDF()
labeled = StringIndexer(inputCol="label", outputCol="labelpoint")
data = labeled.fit(parsedData).transform(parsedData)
data.show() ## 训练模型
#Naive Bayes
nb = NaiveBayes(smoothing=1.0, modelType="multinomial")
model_NB = nb.fit(data)
predict_data= model_NB.transform(data)
traing_err = predict_data.filter(predict_data['label'] != predict_data['prediction']).count()
total = predict_data.count()
nb_scores = float(traing_err)/total
print traing_err, total, nb_scores
#7 150 0.0466666666667 #Logistic Regression###########################################################
# Logistic regression. Currently, this class only supports binary classification.
from pyspark.ml.classification import LogisticRegression
lr = LogisticRegression(maxIter=5, regParam=0.01)
model_lr = lr.fit(data)
predict_data= model_lr.transform(data)
traing_err = predict_data.filter(predict_data['label'] != predict_data['prediction']).count()
total = predict_data.count()
lr_scores = float(traing_err)/total
print traing_err, total, float(traing_err)/total #Decision Tree
from pyspark.ml.classification import DecisionTreeClassifier
dt = DecisionTreeClassifier(maxDepth=2,labelCol = 'labelpoint')
model_DT= dt.fit(data)
predict_data= model_DT.transform(data)
traing_err = predict_data.filter(predict_data['label'] != predict_data['prediction']).count()
total = predict_data.count()
dt_scores = float(traing_err)/total
print traing_err, total, float(traing_err)/total #GBT###########################################################
## GBT. Currently, this class only supports binary classification.
from pyspark.ml.classification import GBTClassifier
gbt = GBTClassifier(maxIter=5, maxDepth=2,labelCol="labelpoint")
model_gbt = gbt.fit(data)
predict_data= model_gbt.transform(data)
traing_err = predict_data.filter(predict_data['label'] != predict_data['prediction']).count()
total = predict_data.count()
dt_scores = float(traing_err)/total
print traing_err, total, float(traing_err)/total #Random Forest
from pyspark.ml.classification import RandomForestClassifier
rf = RandomForestClassifier(numTrees=3, maxDepth=2, labelCol="labelpoint", seed=42)
model_rf= rf.fit(data)
predict_data= model_rf.transform(data)
traing_err = predict_data.filter(predict_data['label'] != predict_data['prediction']).count()
total = predict_data.count()
dt_scores = float(traing_err)/total
print traing_err, total, float(traing_err)/total #MultilayerPerceptronClassifier###########################################################
# Classifier trainer based on the Multilayer Perceptron. Each layer has sigmoid activation function, output layer has softmax.
# Number of inputs has to be equal to the size of feature vectors. Number of outputs has to be equal to the total number of labels.
from pyspark.ml.classification import MultilayerPerceptronClassifier
mlp = MultilayerPerceptronClassifier(maxIter=100, layers=[150, 5, 150], blockSize=1, seed=11)
model_mlp= mlp.fit(parsedData)
predict_data= model_mlp.transform(parsedData)
traing_err = predict_data.filter(predict_data['label'] != predict_data['prediction']).count()
total = predict_data.count()
dt_scores = float(traing_err)/total
print traing_err, total, float(traing_err)/total

  

  因为数据集和上次讲pyspark聚类应用的数据是一样的,就不一步步的展示了,但是我这个程序里只有NaiveBayes的效果还行,0.94的正确率,其他的像DecisionTree等,效果真心差,可能参数还需要调。先掌握怎么用再来调参,官方文档里关于参数的解释也非常详细,可以看看。下一次讲回归,我决定不只写pyspark.ml的应用了,因为实在是图样图naive,想弄清楚pyspark的机器学习算法是怎么运行的,跟普通的算法运行有什么区别,优势等,再写个pyspark.mllib,看相同的算法在ml和mllib的包里运行效果有什么差异,如果有,是为什么,去看源码怎么写的。此外,我真的想弄清楚这货在实际生产中到底有用吗,毕竟还是要落实生产的,我之前想,如果python的sklearn能够在spark上应用就好了,后来在databricks里面找到了一个包好像是准备把sklearn弄到spark上来,当然算法肯定要重新写,不过还没有发布,期待发布的时候。此外,我在知乎上也看到过有人提问说“spark上能用skearn吗?”(大概是这意思,应该很好搜),里面有个回答好像说可以,不过不是直接用(等我找到了把链接放出来)。其实换一种想法,不用spark也行,直接用mapreduce编程序,但是mapreduce慢啊(此处不严谨,因为并没有测试过两者的性能差异,待补充),在我使用spark的短暂时间内,我个人认为spark的优势在于数据处理快,它不需要像mapreduce一样把数据切分成这么多块计算然后再reduce合并,而是直接将数据导入的时候就指定分区,运行机制不同,尤其是spark streaming的功能,还是很快的,所以这是spark的优势(鄙人拙见,如有错误欢迎指出)。而spark的劣势也比较明显,因为它对设备的要求太高了(吃内存啊能不高吗!),这也是它快的原因,你把数据都放在内存里,取的时间比放在磁盘里当然要快,不过实际上在存储数据或者输出结果的时候还是会选择(memory+disk)的方式,保险嘛。前段时间看的alluxio也是占了内存的优势。恩,说了很多废话。下周争取研究的深一点,不然在公司里讲都没人听 = =。

【原】Spark之机器学习(Python版)(二)——分类的更多相关文章

  1. 【原】Spark之机器学习(Python版)(一)——聚类

      kmeans聚类相信大家都已经很熟悉了.在Python里我们用kmeans通常调用Sklearn包(当然自己写也很简单).那么在Spark里能不能也直接使用sklean包呢?目前来说直接使用有点困 ...

  2. Spark之机器学习(Python版)(一)——聚类

    https://www.cnblogs.com/charlotte77/p/5437611.html

  3. Spark 多项式逻辑回归__二分类

    package Spark_MLlib import org.apache.spark.ml.Pipeline import org.apache.spark.ml.classification.{L ...

  4. Spark入门(Python版)

    Hadoop是对大数据集进行分布式计算的标准工具,这也是为什么当你穿过机场时能看到”大数据(Big Data)”广告的原因.它已经成为大数据的操作系统,提供了包括工具和技巧在内的丰富生态系统,允许使用 ...

  5. (一)Spark简介-Java&Python版Spark

    Spark简介 视频教程: 1.优酷 2.YouTube 简介: Spark是加州大学伯克利分校AMP实验室,开发的通用内存并行计算框架.Spark在2013年6月进入Apache成为孵化项目,8个月 ...

  6. Spark入门:Spark运行架构(Python版)

    此文为个人学习笔记如需系统学习请访问http://dblab.xmu.edu.cn/blog/1709-2/ 基本概念 *  RDD:是弹性分布式数据集(Resilient Distributed ...

  7. Alink漫谈(八) : 二分类评估 AUC、K-S、PRC、Precision、Recall、LiftChart 如何实现

    Alink漫谈(八) : 二分类评估 AUC.K-S.PRC.Precision.Recall.LiftChart 如何实现 目录 Alink漫谈(八) : 二分类评估 AUC.K-S.PRC.Pre ...

  8. 【原】Learning Spark (Python版) 学习笔记(三)----工作原理、调优与Spark SQL

    周末的任务是更新Learning Spark系列第三篇,以为自己写不完了,但为了改正拖延症,还是得完成给自己定的任务啊 = =.这三章主要讲Spark的运行过程(本地+集群),性能调优以及Spark ...

  9. 【Todo】【转载】Spark学习 & 机器学习(实战部分)-监督学习、分类与回归

    理论原理部分可以看这一篇:http://www.cnblogs.com/charlesblc/p/6109551.html 这里是实战部分.参考了 http://www.cnblogs.com/shi ...

随机推荐

  1. PHP用单例模式实现一个数据库类

    使用单例模式的出发点: 1.php的应用主要在于数据库应用, 所以一个应用中会存在大量的数据库操作, 使用单例模式, 则可以避免大量的new 操作消耗的资源. 2.如果系统中需要有一个类来全局控制某些 ...

  2. 代码的坏味道(5)——数据泥团(Data Clumps)

    坏味道--数据泥团(Data Clumps) 特征 有时,代码的不同部分包含相同的变量组(例如用于连接到数据库的参数).这些绑在一起出现的数据应该拥有自己的对象. 问题原因 通常,数据泥团的出现时因为 ...

  3. 利用Vue.js实现拼图游戏

    之前写过一篇<基于Vue.js的表格分页组件>的文章,主要介绍了Vue组件的编写方法,有兴趣的可以访问这里进行阅读:http://www.cnblogs.com/luozhihao/p/5 ...

  4. python之最强王者(7)——元组(tuple)

    1.序列(sequence): 说明:在前面的字符串列表中其实我们已经用到了序列,之所以放到这篇来讲主要是为了承上启下,方便理解和记忆. python的数据访问模型:直接存取 ,序列 ,映射 对非容器 ...

  5. Mysql性能优化一

    下一篇:Mysql性能优化二 mysql的性能优化无法一蹴而就,必须一步一步慢慢来,从各个方面进行优化,最终性能就会有大的提升. Mysql数据库的优化技术 对mysql优化是一个综合性的技术,主要包 ...

  6. AngularJs最简单解决跨域问题案例

    AngularJs最简单解决跨域问题案例 2016-05-20 09:18 82人阅读 评论(0) 收藏 举报  分类: javascript(1)  作者:白狼 出处:http://www.mank ...

  7. [deviceone开发]-底部弹出选择

    一.简介 个人上传的第一个示例源码,两天空闲时间写的,一点简单组件,写的挺乱还没啥注释,仅供新手学习. 底部弹出选择,可滑动选择选项,如果停留在选项中间,可自动校正位置,加了一点简单的动画效果,需要的 ...

  8. Windows下Python中pip安装Pillow报错总结(转载)

    遇到的俩种错误1.ValueError: zlib is required unless explicitly disabled using --disable-zlib, aborting 问题原因 ...

  9. iOS平台UDID方案比较

    苹果在iOS6中禁用了[UIDevice uniqueIdentifier],在iOS7中又把mac地址的获取给堵上了.没办法,毕竟人家是老大,说不让你用,你也没办法.在这边总结一下现有的一部分UDI ...

  10. Android之RecyclerView的原生Bug-Inconsistency detected. Invalid view holder adapter positionViewHolder{a1bbfa3 position=2 id=-1, oldPos=-1, pLpos:-1 no parent}

    今天在运行自己编写的App时,突然发现App在运行时闪退,然后就查看了Android Studio的Log,发现了这个错误,上网查了一下,才知道是RecyclerView的原生Bug,在数据更新时会出 ...