Spark MLlib机器学习（一）—

决策树模型，适用于分类、回归。
简单地理解决策树呢，就是通过不断地设置新的条件标准对当前的数据进行划分，最后以实现把原始的杂乱的所有数据分类。

就像下面这个图，如果输入是一大堆追求一个妹子的汉子，妹子内心里有个筛子，最后菇凉也就决定了和谁约（举栗而已哦，不代表什么～大家理解原理重要～～）

训练数据：

0,32 帅 收入中等 不是公务员

1,25 帅 收入中等 是公务员

0,25 帅 收入中等 不是公务员

1,29 帅 收入中等 是公务员

1,24 帅 收入高 不是公务员

0,31 帅 收入高 不是公务员

0,35 帅 收入中等 是公务员

0,30 不帅 收入中等 不是公务员

0,31 帅 收入高 不是公务员

1,30 帅 收入中等 是公务员

1,21 帅 收入高 不是公务员

0,21 帅 收入中等 不是公务员

1,21 帅 收入中等 是公务员

0,29 不帅 收入中等 是公务员

0,29 帅 收入底 是公务员

0,29 不帅 收入底 是公务员

1,30 帅 收入高 不是公务员

测试数据：

0,32 帅 收入中等 不是公务员

1,27 帅 收入高 是公务员

1,29 帅 收入高 不是公务员

1,25 帅 收入中等 是公务员

0,23 不帅 收入中等 是公务员

代码实现：

package com.test;

import java.util.Arrays;

import java.util.HashMap;

import java.util.Map;

import org.apache.spark.SparkConf;

import org.apache.spark.api.java.JavaPairRDD;

import org.apache.spark.api.java.JavaRDD;

import org.apache.spark.api.java.JavaSparkContext;

import org.apache.spark.api.java.function.Function;

import org.apache.spark.api.java.function.PairFunction;

import org.apache.spark.api.java.function.VoidFunction;

import org.apache.spark.mllib.feature.HashingTF;

import org.apache.spark.mllib.linalg.Vector;

import org.apache.spark.mllib.linalg.Vectors;

import org.apache.spark.mllib.regression.LabeledPoint;

import org.apache.spark.mllib.tree.DecisionTree;

import org.apache.spark.mllib.tree.model.DecisionTreeModel;

import org.apache.spark.sql.SparkSession;

import scala.Tuple2;

public class DecisionTreeTest2 {

	public static void main(String[] args) {

		//SparkConf conf = new SparkConf().setMaster("local").setAppName("DecisionTreeTest").config("spark.sql.warehouse.dir","file:///D://test").getOrCreate() ;

		SparkSession spark = SparkSession.builder().master("local[5]")

				.appName("DecisionTreeTest")

				.config("spark.sql.warehouse.dir", "/user/hive/warehouse/").enableHiveSupport()

				.getOrCreate();

		JavaSparkContext jsc = new JavaSparkContext(spark.sparkContext());

		JavaRDD<String> lines = jsc.textFile("C://tree3.txt");

		final HashingTF tf = new HashingTF(10000);

		JavaRDD<LabeledPoint> transdata = lines.map(new Function<String, LabeledPoint>() {

			private static final long serialVersionUID = 1L;

			@Override

			public LabeledPoint call(String str) throws Exception {

				String[] t1 = str.split(",");

				String[] t2 = t1[1].split(" ");

				LabeledPoint lab = new LabeledPoint(Double.parseDouble(t1[0]),tf.transform(Arrays.asList(t2)));

				return lab;

			}

		});

		// 设置决策树参数，训练模型

		Integer numClasses = 3;

		Map<Integer, Integer> categoricalFeaturesInfo = new HashMap<Integer, Integer>();

		String impurity = "gini";

		Integer maxDepth = 5;

		Integer maxBins = 32;

		final DecisionTreeModel tree_model = DecisionTree.trainClassifier(transdata, numClasses,

				categoricalFeaturesInfo, impurity, maxDepth, maxBins);

		System.out.println("决策树模型：");

		System.out.println(tree_model.toDebugString());

		// 保存模型

		tree_model.save(jsc.sc(), "C://DecisionTreeModel");

		// 未处理数据，带入模型处理

		JavaRDD<String> testLines = jsc.textFile("C://tree4.txt");

		JavaPairRDD<String, String> res = testLines.mapToPair(new PairFunction<String, String, String>() {

			private static final long serialVersionUID = 1L;

			@Override

			public Tuple2<String, String> call(String line) throws Exception {

				String[] t2 = line.split(",")[1].split(" ");

				Vector v = tf.transform(Arrays.asList(t2));

				double res = tree_model.predict(v);

				return new Tuple2<String, String>(line, Double.toString(res));

			}

		}).cache();

		// 打印结果

		res.foreach(new VoidFunction<Tuple2<String, String>>() {

			private static final long serialVersionUID = 1L;

			@Override

			public void call(Tuple2<String, String> a) throws Exception {

				System.out.println(a._1 + " : " + a._2);

			}

		});

		// 将结果保存在本地

		res.saveAsTextFile("C://res");

	}

}

测试结果：

0,32 帅 收入中等 不是公务员 : 0.0

1,27 帅 收入高 是公务员 : 1.0

1,29 帅 收入高 不是公务员 : 1.0

1,25 帅 收入中等 是公务员 : 1.0

0,23 不帅 收入中等 是公务员 : 0.0

Spark MLlib机器学习（一）——决策树的更多相关文章

Spark MLlib 机器学习
本章导读机器学习(machine learning, ML)是一门涉及概率论.统计学.逼近论.凸分析.算法复杂度理论等多领域的交叉学科.ML专注于研究计算机模拟或实现人类的学习行为,以获取新知识.新 ...
《Spark MLlib机器学习实践》内容简介、目录
http://product.dangdang.com/23829918.html Spark作为新兴的.应用范围最为广泛的大数据处理开源框架引起了广泛的关注,它吸引了大量程序设计和开发人员进行相 ...
Spark MLlib机器学习
前言 Spark MLlib是Spark对常用的机器学习算法的实现库,同时包括相关的测试和数据生成器.
《Spark MLlib 机器学习实战》1——读后总结
1 概念 2 安装 3 RDD RDD包含两种基本的类型:Transformation和Action.RDD的执行是延迟执行,只有Action算子才会触发任务的执行. 宽依赖和窄依赖用于切分任务,如果 ...
Spark Mllib里如何采用保序回归做回归分析（图文详解）
不多说,直接上干货! 相比于决策树,保序回归的应用范围没有决策树算法那么广泛. 特别在数据处理较为庞大的时候,采用保序回归做回归分析,可以极大地节省资源,从而提高计算效率. 保序回归的思想,是对数据进 ...
Spark Mllib里如何生成KMeans的训练样本数据、生成线性回归的训练样本数据、生成逻辑回归的训练样本数据和其他数据生成
不多说,直接上干货! 具体,见 Spark Mllib机器学习(算法.源码及实战详解)的第2章 Spark数据操作
Spark Mllib里的卡方检验
不多说,直接上干货! import org.apache.spark.mllib.stat.Statistics 具体,见 Spark Mllib机器学习实战的第4章 Mllib基本数据类型和Mlli ...
Spark Mllib里的分层抽样（使用map作为分层抽样的数据标记）
不多说,直接上干货! 具体,见 Spark Mllib机器学习实战的第4章 Mllib基本数据类型和Mllib数理统计
Spark Mllib里的如何对单个数据集用斯皮尔曼计算相关系数
不多说,直接上干货! import org.apache.spark.mllib.stat.Statistics 具体,见 Spark Mllib机器学习实战的第4章 Mllib基本数据类型和Mlli ...

随机推荐

React 之React.createContext
使用Context,可以跨越组件进行数据传递 import React from 'react'; import ReactDOM from 'react-dom'; const ThemeConte ...
C++ STL bitset总结
基础用法 C++ Reference 神犇博客余下的就是例题了 [BZOJ3687]简单题考虑$DP$,设$f[i][j]$表示前$i$个元素的算数和为$j$的子集个数,有: \[ ...
Oracle Or子句
Oracle Or子句作者:初生不惑 Oracle基础评论:0 条 Oracle技术QQ群:175248146 在本教程中,我们来学习如何使用Oracle OR运算符来组合两个或更多的布尔表达式. ...
LDAP常见错误码
LDAP_SUCCESS = 0 //成功 LDAP_OPERATIONS_ERROR = 1 //操作错误 LDAP_PROTOCOL_ERROR = 2 //协议错误 LDAP_TIME_LIMI ...
170826-关于spring的知识点及练习
1.Spring作用: 1.生态体系庞大,全能型选手![springmvc是其一个子模块,jdbcTemplate能直接操作数据库!] 2.将其他组件粘合在一起 3.IOC容器和AOP[Aspect ...
[洛谷P3940]:分组（贪心+并查集）
题目传送门题目描述小$C$在了解了她所需要的信息之后,让兔子们调整到了恰当的位置.小$C$准备给兔子们分成若干个小组来喂恰当的胡萝卜给兔子们吃.此时,$n$只兔子按一定顺序排成一排,第$i$只兔子 ...
[BZOJ3236]:[Ahoi2013]作业（莫队+分块）
题目传送门题目描述此时已是凌晨两点,刚刚做了$Codeforces$的小$A$掏出了英语试卷.英语作业其实不算多,一个小时刚好可以做完.然后是一个小时可与做完的数学作业,接下来是分别都是一个小时可 ...
手把手教你搞定个推iOS推送SDK集成
以下是一位开发者在集成个推iOS推送SDK过程中的真实经历. 作者:Ezreallp 一次偶然的机会,公司的项目要用到推送,我自己本来就很懒,不愿意去弄整套APNS的流程,刚好之前跟朋友聊起过他们的产 ...
mui.ajax中文乱码
估计这是个bug: //mui 的 ajax 中文乱码 var url = 'http://api.juheapi.com/japi/toh?key=1f26c107d8864bdfb98202bc3 ...
微信小程序 form 组件
表单组件:将组件内用户输入的 <switch> <input> <checkbox> <slider> <radio> <picker ...

Spark MLlib机器学习（一）——决策树

Spark MLlib机器学习（一）——决策树的更多相关文章

随机推荐

热门专题