Spark算子---实战应用

Spark算子实战应用

数据集 ：http://grouplens.org/datasets/movielens/ MovieLens 1M Datase

相关数据文件：

users.dat ---UserID::Gender::Age::Occupation::Zip-code

movies.dat --- MovieID::Title::Genres

ratings.dat ---UserID::MovieID::Rating::Timestamp

SogouQ.mini

完成以下业务需求：

1. 年龄段在“18-24”的男性年轻人，最喜欢看哪10部

2.得分最高的10部电影；看过电影最多的前10个人；女性看多最多的10部电影；男性看过最多的10部电影

3.利用数据集SogouQ2012.mini.tar.gz 将数据按照访问次数进行排序，求访问量前10的网站

scala实现代码如下：

package hw3

import org.apache.spark._

import scala.collection.immutable.HashSet

import org.apache.spark.rdd.RDD

/**

 * @author BIGDATA

 */

object spark_hw3{

  var sc:SparkContext=null

  def main(args: Array[String]): Unit = {

    val conf=new SparkConf().setAppName("MovieDemo")

              .setMaster("local")

    sc=new SparkContext(conf)
　　//准备数据

     val rating=sc.textFile("C:\\Users\\BIGDATA\\Desktop\\文件\\BigData\\Spark\\3.SparkCore_2\\data\\data\\ratings.dat")

              .map(_.split("::")).map {x => (x(0),x(1),x(2))}
　　//年龄段在“18-24”的男性年轻人，最喜欢看哪10部

    top10LookeMovie

　　//得分最高的10部电影

    val topKScoreMostMovie = rating.map{x =>

      (x._2, (x._3.toInt, 1))

    }.reduceByKey { (v1, v2) =>

      (v1._1 + v2._1, v1._2 + v2._2)

    }.map { x =>

      (x._2._1.toDouble / x._2._2.toDouble, x._1)

    }.sortByKey(false).

        take(10).

        foreach(println)

    
　　　//女性看最多的10部电影

    top10FaleLookMovie

　　//男性看最多的10部电影

    top10MaleLookMovie


　　//看过电影最多的前10个人

    val topKmostPerson = rating.map{ x =>

      (x._1, 1)

    }.reduceByKey(_ + _).

        map(x =>(x._2, x._1)).

        sortByKey(false).

        take(10).

        foreach(println)

     val brower = sc.textFile("C:\\Users\\BIGDATA\\Desktop\\文件\\BigData\\Spark\\3.SparkCore_2\\SogouQ2012.mini\\SogouQ.mini")

     val brs=brower.map(_.split("\t")).map { x =>

          x(5)

    }.cache

    //访问量前10的网站

     val topKBrower = brs.flatMap(_.split(" ")).map((_, 1)).reduceByKey(_+_)

    .sortBy(_._2, false)

    .take(10)

    .foreach(println)

  }

  /**

    * @param sc SparkContext对象

    * @return 返回用户信息

    */

  def getUsers(sc:SparkContext):RDD[Array[String]]={

    val scobj=sc

    val users=scobj.textFile("C:\\Users\\BIGDATA\\Desktop\\文件\\BigData\\Spark\\3.SparkCore_2\\data\\data\\users.dat")

                  .map(_.split("::"))

    users

  }

  /**

    * @param sc

    * @return 返回电影信息

    */

  def getMovies(sc:SparkContext):RDD[Array[String]]={

    val scobj=sc

    val movies=scobj.textFile("C:\\Users\\BIGDATA\\Desktop\\文件\\BigData\\Spark\\3.SparkCore_2\\data\\data\\movies.dat")

                .map(_.split("::"))

    movies

  }

  /**

    *

    * @param sc

    * @return 电影评分信息

    */

  def getRatings(sc:SparkContext):RDD[Array[String]]={

    val scobj=sc

    val ratings=scobj.textFile("C:\\Users\\BIGDATA\\Desktop\\文件\\BigData\\Spark\\3.SparkCore_2\\data\\data\\ratings.dat")

              .map(_.split("::"))

    ratings

  }

  def top10LookeMovie: Unit ={

    //获取年龄段在“18-24”的男性年轻人的userid

    val users=getUsers(sc)

    val userList=users.filter(x=>x(1).equals("M") && x(2).toInt>=18 && x(2).toInt<=24)

      .map(x=>x(0)).collect()

    //注意：HashSet()后面要带小括号

    val userSet=HashSet() ++ userList

    //创建广播变量

    val broadcastUserSet=sc.broadcast(userSet)

    //统计出１８－２４岁男性喜欢看的前１０名电影的movieid和次数

    val ratings=getRatings(sc)

    val topNMovies=ratings.map(x=>(x(0),x(1))) //ratings中所有的(userid,movieid)

      //从rating数据过滤出“18-24”的男性年轻人的观影信息

      .filter(x=>broadcastUserSet.value.contains(x._1))

      .map(x=>(x._2,1))

      .reduceByKey(_+_) //(movieid,次数)

      .sortBy(_._2,false)

      .take(10) //(movieid,次数)

    val movies=getMovies(sc)

    //获取所有电影的(movieid,title)

    val movieTitle=movies.map(x=>(x(0),x(1))).collect().toMap

    topNMovies.map(x=>(movieTitle.getOrElse(x._1,null),x._2))

      .foreach(x=>println(x._1+"  "+x._2))

  }

  /**

    * 女性看过最多的10部电影

    */

  def top10FaleLookMovie: Unit ={

    val users = getUsers(sc)

    //获取所有女性的userid

    val faleUserId = users.filter(x => x(1).equals("F"))

      .map(x => x(0)).collect()

    val faleUserSet = HashSet() ++ faleUserId

    //创建广播变量，里面存储所有女性的userid

    val broadcastFaleSet = sc.broadcast(faleUserSet)

    val ratings = getRatings(sc)

    //统计出女性看过最多的１０部电影的(movieid,观看次数)

    val top10moiveid = ratings.map(x => (x(0), x(1))) //(userid,movieid)

      //过滤出女性观影数据

      .filter(x => broadcastFaleSet.value.contains(x._1))

      .map(x => (x._2, 1)) //(movieid,1)

      .reduceByKey(_ + _)

      .sortBy(_._2, false)

      .take(10)

    val top10movieRDD=sc.parallelize(top10moiveid) //(movieid,次数)

    val movies=getMovies(sc)

    val allmoviesRDD=movies.map(x=>(x(0),x(1))) //(movieid,title)

    //对两个ＲＤＤ进行join操作，取二者的共同匹配项

    allmoviesRDD.join(top10movieRDD) //(movieid,(title,次数))

      .map(x=>(x._1,x._2._1,x._2._2))

      .foreach(x=>println(x._1+"  "+x._2+"  "+x._3))

  }

  /**

    * 男性看过最多的10部电影

    */

  def top10MaleLookMovie: Unit ={

    val users = getUsers(sc)

    //获取所有男性的userid

    val faleUserId = users.filter(x => x(1).equals("M"))

      .map(x => x(0)).collect()

    val faleUserSet = HashSet() ++ faleUserId

    //创建广播变量，里面存储所有男性的userid

    val broadcastFaleSet = sc.broadcast(faleUserSet)

    val ratings = getRatings(sc)

    //统计出男性看过最多的１０部电影的(movieid,观看次数)

    val top10moiveid = ratings.map(x => (x(0), x(1))) //(userid,movieid)

      //过滤出男性观影数据

      .filter(x => broadcastFaleSet.value.contains(x._1))

      .map(x => (x._2, 1)) //(movieid,1)

      .reduceByKey(_ + _)

      .sortBy(_._2, false)

      .take(10)

    val top10movieRDD=sc.parallelize(top10moiveid) //(movieid,次数)

    val movies=getMovies(sc)

    val allmoviesRDD=movies.map(x=>(x(0),x(1))) //(movieid,title)

    //对两个ＲＤＤ进行join操作，取二者的共同匹配项

    allmoviesRDD.join(top10movieRDD) //(movieid,(title,次数))

      .map(x=>(x._1,x._2._1,x._2._2))

      .foreach(x=>println(x._1+"  "+x._2+"  "+x._3))

  }

}

Spark算子---实战应用的更多相关文章

Spark入门实战系列--1.Spark及其生态圈简介
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .简介 1.1 Spark简介年6月进入Apache成为孵化项目,8个月后成为Apache ...
Spark入门实战系列--3.Spark编程模型（上）--编程模型及SparkShell实战
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .Spark编程模型 1.1 术语定义 l应用程序(Application): 基于Spar ...
倾情大奉送--Spark入门实战系列
这一两年Spark技术很火,自己也凑热闹,反复的试验.研究,有痛苦万分也有欣喜若狂,抽空把这些整理成文章共享给大家.这个系列基本上围绕了Spark生态圈进行介绍,从Spark的简介.编译.部署,再到编 ...
Spark入门实战系列--10.分布式内存文件系统Tachyon介绍及安装部署
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .Tachyon介绍 1.1 Tachyon简介随着实时计算的需求日益增多,分布式内存计算 ...
Spark入门实战系列--2.Spark编译与部署（上）--基础环境搭建
[注] 1.该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取: 2.Spark编译与部署将以CentOS 64位操作系统为基础,主要是考虑到实际应用 ...
Spark入门实战系列--2.Spark编译与部署（中）--Hadoop编译安装
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .编译Hadooop 1.1 搭建环境 1.1.1 安装并设置maven 1. 下载mave ...
Spark入门实战系列--2.Spark编译与部署（下）--Spark编译安装
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .编译Spark .时间不一样,SBT是白天编译,Maven是深夜进行的,获取依赖包速度不同 ...
Spark入门实战系列--3.Spark编程模型（下）--IDEA搭建及实战
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 . 安装IntelliJ IDEA IDEA 全称 IntelliJ IDEA,是java语 ...
Spark入门实战系列--4.Spark运行架构
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 1. Spark运行架构 1.1 术语定义 lApplication:Spark Appli ...

随机推荐

Python 文件 next() 方法
描述 Python 3 中的文件对象不支持 next() 方法. Python 3 的内置函数 next() 通过迭代器调用 __next__() 方法返回下一项. 在循环中,next()方法会在 ...
安装 Vbundle 的笔记
Vbundle 挺好用的,能够很方便管理Vim的一些插件.虽然Vbundle的安装方法看的很简单,但是它的配置却让我弄了很久,现在记录如下,方便后面安装时再出现相同的问题: 我按照这里的官方提示的安装 ...
个人用户使用genymotion 模拟器
genymotion android模拟器速度快,比较好用.对公司使用的是要收费的,但是对个人使用还是免费的,所以个人用户还可以继续使用.使用方法 1.注册账号,填写用户名.邮箱.密码.公司类型(选g ...
windowns 2008(apache2.2.25 x86 openssl0.98y) 升级openssl1.0.1e(为了支持小程序接口TLS1.2)
原来只知道微信小程序,服务器接口必须支持 https, 所以在搭建环境的时候没有注意, 只是在原来已有的系统框架上,稳健升级,把apache2.2.25 X86_no_openssl升级为了apach ...
hdu Constructing Roads (最小生成树)
题目:http://acm.hdu.edu.cn/showproblem.php?pid=1102 /************************************************* ...
C++11 explicit的使用
C++中的explicit关键字只能用于修饰只有一个参数的类构造函数 , 它的作用是表明该构造函数是显示的, 而非隐式的,跟它相对应的另一个关键字是implicit, 意思是隐藏的,类构造函数默认情况 ...
Word中MathType公式与LaTeX公式的转换
1. 对Word文档中用MathType输入的公式,在word中,选中mathtype公式,按住“Alt+\”键,可以将MathType公式转换成Latex格式. 2. 同样,将Latex格式的公式代 ...
京东轮播图片的静态页面CSS3
效果图: index.html <!DOCTYPE html> <html> <head> <meta charset="utf-8"&g ...
【Android】OAuth验证和新浪微博的oauth实现
关于OAuth验证 OAuth是当下流行的授权方案,twitter,facebook,google等大型网站的开放平台都支持了oauth验证模式,国内的新浪微博.腾讯微博.163微博的开放平台也相继支 ...
【电子基础】液晶显示器原理·LCD驱动基础
LCD显示器概述 ——>液晶显示器,LCD为英文 Liquid Crystal Display的缩写,它是一种数字显示技术,可以通过液晶和彩色过滤光源,并在平面面板上产生图像. ——&g ...

Spark算子---实战应用

Spark算子---实战应用的更多相关文章

随机推荐

热门专题