Spark线性回归实现优化

 import org.apache.log4j.{Level, Logger}

 import org.apache.spark.ml.feature.VectorAssembler

 import org.apache.spark.ml.regression.LinearRegression

 import org.apache.spark.sql.SparkSession

 /**

   * 线性回归

   * Created by zhen on 2018/11/12.

   */

 object LinearRegression {

   Logger.getLogger("org").setLevel(Level.WARN) // 设置日志级别

   def main(args: Array[String]) {

     val spark = SparkSession

       .builder()

       .appName("LinearRegression")

       .master("local[2]")

       .getOrCreate()

     val train_data = spark.sparkContext.textFile("E:/BDS/newsparkml/src/train.txt") // 加载数据

     val train_map_data = train_data.map{ row =>

         val split = row.split(",")

         (split(0).toDouble,split(1).toDouble,split(2).toDouble,split(3).toDouble,

           split(4).toDouble,split(5).toDouble,split(6).toDouble,split(7).toDouble)

       }

     val df = spark.sqlContext.createDataFrame(train_map_data)

     val colArray = Array("Population","Income","Illiteracy","LifeExp","HSGrad","Frost","Area")

     val train_df = df.toDF(colArray(0),colArray(1),colArray(2),colArray(3),"Murder",colArray(4),colArray(5),colArray(6))

     val assembler = new VectorAssembler()

       .setInputCols(colArray)

       .setOutputCol("features")

     val vectDF = assembler.transform(train_df)

     val weights = Array(0.8,0.2) //设置训练集和测试集的比例

     val split_data = vectDF.randomSplit(weights) // 拆分训练集和测试集

     // 创建模型对象

     val linearRegression = new LinearRegression()

       .setFeaturesCol("features")

       .setLabelCol("Murder")

       .setFitIntercept(true)

       .setMaxIter(10)

       .setRegParam(0.3)// 正则化

       .setElasticNetParam(0.8)

     // 训练模型

     val lrModel = linearRegression.fit(split_data(0))

     // 查看模型参数

     //lrModel.extractParamMap()

     println(s"Cofficients:${lrModel.coefficients} Intercept:${lrModel.intercept}")

     //模型评估

     val trainingSummary = lrModel.summary

     println(s"objectiveHistoryList:${trainingSummary.objectiveHistory.toList}")

     println(s"r2:${trainingSummary.r2}")

     // 预测

     val predictions = lrModel.transform(split_data(1))

     val predict_result = predictions.selectExpr("features","Murder","round(prediction,1) as prediction") // 保存一位小数

     println("训练集数据------------------------------真实值--预测值")

     predict_result.foreach(println(_))

   }

 }

结果：

Spark线性回归实现优化的更多相关文章

Spark读Hbase优化 --手动划分region提高并行数
一. Hbase的region 我们先简单介绍下Hbase的架构和Hbase的region: 从物理集群的角度看,Hbase集群中,由一个Hmaster管理多个HRegionServer,其中每个HR ...
[转] - Spark排错与优化
Spark排错与优化 http://blog.csdn.net/lsshlsw/article/details/49155087 一. 运维 1. Master挂掉,standby重启也失效 Mast ...
SparkSQL的一些用法建议和Spark的性能优化
1.写在前面 Spark是专为大规模数据处理而设计的快速通用的计算引擎,在计算能力上优于MapReduce,被誉为第二代大数据计算框架引擎.Spark采用的是内存计算方式.Spark的四大核心是Spa ...
spark 集群优化
只有满怀自信的人,能在任何地方都怀有自信,沉浸在生活中,并认识自己的意志. 前言最近公司有一个生产的小集群,专门用于运行spark作业.但是偶尔会因为nn或dn压力过大而导致作业checkpoint ...
Spark排错与优化
一. 运维 1. Master挂掉,standby重启也失效 Master默认使用512M内存,当集群中运行的任务特别多时,就会挂掉,原因是master会读取每个task的event log日志去生成 ...
spark新能优化之序列化
概叙: 在任何分布式系统中,序列化都是扮演着一个重要的角色的.如果使用的序列化技术,在执行序列化操作的时候很慢,或者是序列化后的数据还是很大,那么会让分布式应用程序的性能下降很多.所以,进行Spark ...
[看图说话] 基于Spark UI性能优化与调试——初级篇
Spark有几种部署的模式,单机版.集群版等等,平时单机版在数据量不大的时候可以跟传统的java程序一样进行断电调试.但是在集群上调试就比较麻烦了...远程断点不太方便,只能通过Log的形式,进行分析 ...
[Spark] - SparkCore程序优化总结
http://spark.apache.org/docs/1.6.1/tuning.html1) 代码优化 a. 对于多次使用的RDD,进行数据持久化操作(eg: cache.persist) b. ...
spark 线性回归算法（scala）
构建Maven项目,托管jar包数据格式 //0.fp_nid,1.nsr_id,2.gf_id,2.hydm,3.djzclx_dm,4.kydjrq,5.xgrq,6.je,7.se,8.jsh ...

随机推荐

Python常用模块time & datetime &random 模块
时间模块前言在Python中,与时间处理有关的模块就包括:time,datetime 一.在Python中,通常有这几种方式来表示时间: 时间戳格式化的时间字符串元组(struct_time)共 ...
关于loading
在开发中,不可避免的会需要loading的出现,来提高用户体验, 自己在查找中,总结了两条: 1.window.onload的时候显示loading,首先loading图片是一直存在的,window. ...
c/c++本地时间获取
在记录程序日志时,需要记录时间.如下: #include <iostream> #include <time.h> #include <windows.h> usi ...
在Kubernetes中部署GlusterFS+Heketi
目录简介 Gluster-Kubernetes 部署环境准备下载相关文件部署glusterfs 部署heketi server端配置heketi client 简介在上一篇<独立部署 ...
Oracle 基本知识回顾
1.查找数据库所用的字符集编码:SELECT USERENV('language') FROM DUAL;2.将一个表中的字段,插入到这个表:INSERT INTO TABLE SELECT * FR ...
error: device unauthorized —— android studio 链接不上虚拟机
问题原因: 以前用Eclipse开发的时候在环境变量里配置了ANDRIOD_SDK_HOME. 解决方法: 将电脑环境变量中的ANDRIOD_SDK_HOME删除,重新运行adb devices,手机 ...
SpringBoot各类扩展点详解
一.前言上篇文章我们深入分析了SpringBoot的一站式启动流程.然后我们知道SpringBoot的主要功能都是依靠它内部很多的扩展点来完成的,那毋容置疑,这些扩展点是我们应该深入了解的,那么本次 ...
从零开始学 Web 之 Ajax（一）服务器相关概念
大家好,这里是「从零开始学 Web 系列教程」,并在下列地址同步更新...... github:https://github.com/Daotin/Web 微信公众号:Web前端之巅博客园:ht ...
经济学人使用Golang构建微服务历程回顾
关键点经济学人内容分发系统需要更大的灵活性,将内容传递给日益多样化的数字渠道.为了实现这一灵活性目标并保持高水平的性能和可靠性,平台从一个单体结构过渡到微服务体系结构. 用Go编写的服务是新系统的一 ...
Python 判断文件/目录是否存在
使用 os 模块判断文件是否存在 os.path.isfile(path) 判断目录是否存在 os.path.isdir(path) 判断路径是否存在 # 使用 path 模块 os.path.ex ...

Spark线性回归实现优化

Spark线性回归实现优化的更多相关文章

随机推荐

热门专题