Spark机器学习1·编程入门(scala/java/python)

Spark安装目录

/Users/erichan/Garden/spark-1.4.0-bin-hadoop2.6

基本测试

./bin/run-example org.apache.spark.examples.SparkPi

MASTER=local[20] ./bin/run-example org.apache.spark.examples.SparkPi

scala

import org.apache.spark.SparkContext

import org.apache.spark.SparkContext._

/**

 * A simple Spark app in Scala

 */

object ScalaApp {

  def main(args: Array[String]) {

    val sc = new SparkContext("local[2]", "First Spark App")

    val data = sc.textFile("data/UserPurchaseHistory.csv")

      .map(line => line.split(","))

      .map(purchaseRecord => (purchaseRecord(0), purchaseRecord(1), purchaseRecord(2)))

    val numPurchases = data.count()

    val uniqueUsers = data.map { case (user, product, price) => user }.distinct().count()

    val totalRevenue = data.map { case (user, product, price) => price.toDouble }.sum()

    val productsByPopularity = data

      .map { case (user, product, price) => (product, 1) }

      .reduceByKey(_ + _)

      .collect()

      .sortBy(-_._2)

    val mostPopular = productsByPopularity(0)

    println("Total purchases: " + numPurchases)

    println("Unique users: " + uniqueUsers)

    println("Total revenue: " + totalRevenue)

    println("Most popular product: %s with %d purchases".format(mostPopular._1, mostPopular._2))

    sc.stop()

  }

}

build.sbt

name := "scala-spark-app"

version := "1.0"

scalaVersion := "2.11.6"

libraryDependencies += "org.apache.spark" %% "spark-core" % "1.4.0"

erichan:scala-spark-app/ $ sbt run

java 8

import org.apache.spark.api.java.JavaRDD;

import org.apache.spark.api.java.JavaSparkContext;

import org.apache.spark.api.java.function.PairFunction;

import scala.Tuple2;

import java.util.List;

public class JavaApp {

    public static void main(String[] args) {

        JavaSparkContext sc = new JavaSparkContext("local[2]", "First Spark App");

        JavaRDD<String[]> data = sc.textFile("data/UserPurchaseHistory.csv").map(s -> s.split(","));

        long numPurchases = data.count();

        long uniqueUsers = data.map(strings -> strings[0]).distinct().count();

        double totalRevenue = data.mapToDouble(strings -> Double.parseDouble(strings[2])).sum();

        List<Tuple2<String, Integer>> pairs = data.mapToPair(

                new PairFunction<String[], String, Integer>() {

                    @Override

                    public Tuple2<String, Integer> call(String[] strings) throws Exception {

                        return new Tuple2(strings[1], 1);

                    }

                }

        ).reduceByKey((i1, i2) -> i1 + i2).collect();

        pairs.sort((o1, o2) -> -(o1._2() - o2._2()));

        String mostPopular = pairs.get(0)._1();

        int purchases = pairs.get(0)._2();

        System.out.println("Total purchases: " + numPurchases);

        System.out.println("Unique users: " + uniqueUsers);

        System.out.println("Total revenue: " + totalRevenue);

        System.out.println(String.format("Most popular product: %s with %d purchases", mostPopular, purchases));

        sc.stop();

    }

}

Maven pom.xml

<?xml version="1.0" encoding="UTF-8"?>

<project xmlns="http://maven.apache.org/POM/4.0.0"

         xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"

         xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">

    <modelVersion>4.0.0</modelVersion>

    <groupId>java-spark-app</groupId>

    <artifactId>java-spark-app</artifactId>

    <version>1.0</version>

    <dependencies>

        <dependency>

            <groupId>org.apache.spark</groupId>

            <artifactId>spark-core_2.11</artifactId>

            <version>1.4.0</version>

        </dependency>

    </dependencies>

    <build>

        <plugins>

            <plugin>

                <groupId>org.apache.maven.plugins</groupId>

                <artifactId>maven-compiler-plugin</artifactId>

                <version>3.1</version>

                <configuration>

                    <source>1.8</source>

                    <target>1.8</target>

                </configuration>

            </plugin>

        </plugins>

    </build>

</project>

python

from pyspark import SparkContext

sc = SparkContext("local[2]", "First Spark App")

data = sc.textFile("data/UserPurchaseHistory.csv").map(lambda line: line.split(",")).map(lambda record: (record[0], record[1], record[2]))

numPurchases = data.count()

uniqueUsers = data.map(lambda record: record[0]).distinct().count()

totalRevenue = data.map(lambda record: float(record[2])).sum()

products = data.map(lambda record: (record[1], 1.0)).reduceByKey(lambda a, b: a + b).collect()

mostPopular = sorted(products, key=lambda x: x[1], reverse=True)[0]

print "Total purchases: %d" % numPurchases

print "Unique users: %d" % uniqueUsers

print "Total revenue: %2.2f" % totalRevenue

print "Most popular product: %s with %d purchases" % (mostPopular[0], mostPopular[1])

sc.stop()

cd /Users/erichan/Garden/spark-1.4.0-bin-hadoop2.6/bin

./spark-submit pythonapp.py

Spark机器学习1·编程入门(scala/java/python)的更多相关文章

梯度迭代树（GBDT）算法原理及Spark MLlib调用实例（Scala/Java/python）
梯度迭代树(GBDT)算法原理及Spark MLlib调用实例(Scala/Java/python) http://blog.csdn.net/liulingyuan6/article/details ...
三种文本特征提取（TF-IDF/Word2Vec/CountVectorizer）及Spark MLlib调用实例（Scala/Java/python）
https://blog.csdn.net/liulingyuan6/article/details/53390949
Spark机器学习MLlib系列１（for python）－－数据类型，向量，分布式矩阵，API
Spark机器学习MLlib系列1(for python)--数据类型,向量,分布式矩阵,API 关键词:Local vector,Labeled point,Local matrix,Distrib ...
Spark机器学习7·降维模型(scala&python)
PCA(主成分分析法,Principal Components Analysis) SVD(奇异值分解法,Singular Value Decomposition) http://vis-www.cs ...
3000字编程入门--附带Java学习路线及视频
Title: 编程入门 GitHub: BenCoper Reference: 尚硅谷-2019 Study: 文字版+视频+实战(第一个自学的网站) Explain: 文末附带Java学习视频以及项 ...
问题 1014: [编程入门]阶乘求和python)：（本地测试正确；但提交不对！！？？）求教
问题 1014: [编程入门]阶乘求和时间限制: 1Sec 内存限制: 128MB 提交: 27629 解决: 5450 题目描述求Sn=1!+2!+3!+4!+5!+…+n!之值,其中n是一个数 ...
spark Using MLLib in Scala/Java/Python
Using MLLib in ScalaFollowing code snippets can be executed in spark-shell. Binary ClassificationThe ...
朴素贝叶斯算法原理及Spark MLlib实例(Scala/Java/Python)
朴素贝叶斯算法介绍: 朴素贝叶斯法是基于贝叶斯定理与特征条件独立假设的分类方法. 朴素贝叶斯的思想基础是这样的:对于给出的待分类项,求解在此项出现的条件下各个类别出现的概率,在没有其它可用信息下,我 ...
编程入门视频【 Python、PHP、ThinkPHP、Laravel、Mysql、微信小程序】
免费分享 Python.PHP.ThinkPHP.Laravel.Mysql.微信小程序等学习视频点击进入搜刮免费分享 Python.PHP.ThinkPHP.Laravel.Mysql.微信小程 ...

随机推荐

ISP图像调试工程师
汉邦高科任职要求: 1. 电子工程.图像与信号处理.计算机等相关专业,本科及以上学历: 2. 在数字图像处理.视频压缩等方面具有扎实的理论背景知识: 3. 熟悉Sony.Panasonic.Apti ...
学习笔记：Vue+Node+Mongodb 构建简单商城系统（二）
前面几个月工作有点忙,导致构建简单商城系统的计划搁置近三个月.现在终于有时间重新回过头来继续本计划.本篇主要记录自己在阿里云服务器上搭建node运行环境的整个过程,以及对其中遇到的一些问题的思考. 一 ...
关于mariadb远程连接授权的设置
1.首先配置允许访问的用户,采用授权的方式给用户权限 1 GRANT ALL PRIVILEGES ON *.* TO 'root'@'%'IDENTIFIED BY '123456' WITH GR ...
python uwsgi 部署以及优化
这篇文章其实两个月之前就应该面世了,但是最近琐事.烦心事太多就一直懒得动笔,拖到现在才写一.uwsgi.wsgi.fastcgi区别和联系参见之前的文章 http://www.cnblogs.co ...
Castle.MVC框架介绍
Castle.MVC目前还在Castle的Sandbox中,只是在源代码管理中有,还没有向外发布版本,这里介绍多时Web的MVC,和Castle的MonoRail相比较,这个MVC可以Asp.Net的 ...
【BZOJ4385】[POI2015]Wilcze doły 单调栈+双指针法
[BZOJ4385][POI2015]Wilcze doły Description 给定一个长度为n的序列,你有一次机会选中一段连续的长度不超过d的区间,将里面所有数字全部修改为0.请找到最长的一段 ...
170209、mysql索引的建立
用到索引最普通的情况,是为出现在where子句的字段建一个索引.为方便讲述,我们先建立一个如下的表. Code代码如下: CREATE TABLE mytable ( id serial primar ...
Java获取任意时间、时间字符串
/* * 获取时间字符串*/public String getCurrentTime() { SimpleDateFormat sdf = new SimpleDateFormat("yyy ...
ORACLE_SID的查找
SID是System IDentifier的缩写,而ORACLE_SID就是Oracle System Identifier的缩写,在Oracle系统中,ORACLE_SID以环境变量的形式出现,在特 ...
ArcGIS Silverlight 设置token
背景 arcgis for server采用多种安全认证方式.常用的就是就是采用token机制.所以对服务设置了安全,则前端需要提供相对应的token凭证.通常来说设置token有以下两种情形: 一是 ...

Spark机器学习1·编程入门(scala/java/python)

Spark安装目录

scala

build.sbt

java 8

Maven pom.xml

python

Spark机器学习1·编程入门(scala/java/python)的更多相关文章

随机推荐

热门专题