Spark- 求最受欢迎的TopN课程

数据库操作工具类

package com.rz.mobile_tag.utils

import java.sql.{Connection, DriverManager, PreparedStatement}

object MySQLUtils {

  /**

    * 获取数据库连接

    * @return

    */

  def getConnection()={

    DriverManager.getConnection("jdbc:mysql://localhost:3306/bigdata?user=root&password=root")

  }

  /**

    * 释放数据库连接等资源

    * @param conn

    * @param pstmt

    */

  def release(conn:Connection, pstmt:PreparedStatement)={

    try {

      if (pstmt !=null){

        pstmt.close()

      }

    }catch {

      case e:Exception => e.printStackTrace()

    }finally {

      if (conn != null){

        conn.close()

      }

    }

  }

}

数据操作类：优化点（使用批量插入数据库，提交使用batch操作）

package com.rz.mobile_tag.dao

import java.sql.{Connection, PreparedStatement}

import com.rz.mobile_tag.bean.DayVideoAccessStat

import com.rz.mobile_tag.utils.MySQLUtils

import scala.collection.mutable.ListBuffer

object StatDao {

  /**

    * 批量保存DayVideoAccessStat到数据库

    * @param list

    */

  def insertDayVideoAccessTopN(list: ListBuffer[DayVideoAccessStat]): Unit = {

    var connection:Connection = null;

    var pstmt:PreparedStatement = null;

    try {

      connection = MySQLUtils.getConnection()

      connection.setAutoCommit(false) // 设置手动提交

      val sql ="insert into day_video_access_topn_stat(day,cms_id,times) value(?,?,?)"

      pstmt = connection.prepareStatement(sql)

      for (ele <- list){

        pstmt.setString(1, ele.day)

        pstmt.setLong(2,ele.cmsId)

        pstmt.setLong(3, ele.times)

        pstmt.addBatch()

      }

      pstmt.executeBatch() // 执行批量处理

      connection.commit() // 手工提交

    }catch {

      case e:Exception =>e.printStackTrace()

    }finally {

      MySQLUtils.release(connection, pstmt)

    }

  }

}

业务实现类

package com.rz.mobile_tag.log

import com.rz.mobile_tag.bean.DayVideoAccessStat

import com.rz.mobile_tag.dao.StatDao

import org.apache.spark.sql.{DataFrame, Dataset, Row, SparkSession}

import org.apache.spark.sql.functions._

import scala.collection.mutable.ListBuffer

object TopNStatJob {

  def main(args: Array[String]): Unit = {

    val spark = SparkSession.builder().appName(s"${this.getClass.getSimpleName}")

      .config("spark.sql.sources.partitionColumnTypeInference.enabled","false")

      .master("local[2]")

      .getOrCreate()

    val accessDF: DataFrame = spark.read.format("parquet").load(args(0))

    accessDF.printSchema()

    accessDF.show(false)

    // 最受欢迎的TopN课程

    videoAccessTopNStat(spark, accessDF)

    spark.stop()

  }

  /**

    * 最受欢迎的TopN课程

    * @param spark

    * @param accessDF

    */

  def videoAccessTopNStat(spark: SparkSession, accessDF: DataFrame) = {

//    import spark.implicits._

//    val videoAccesssTopNDF: Dataset[Row] = accessDF.filter($"day" === "20190506" && $"cmsType" === "video")

//      .groupBy("day", "cmsId")

//      .agg(count("cmsId")).as("times").orderBy($"times".desc)

//    videoAccesssTopNDF.show(false)

    accessDF.createOrReplaceTempView("access_logs")

    // 使用SQL方式进行统计

    val videoAccesssTopNDF: DataFrame = spark.sql("select day, cmsId, count(1) as times from access_logs" +

      " where day = '20190506' and cmsType = 'video' group by day, cmsId" +

      " order by times desc")

    //videoAccesssTopNDF.show(false)

    // 将统计数据写入到MySQL中

    try{

      videoAccesssTopNDF.foreachPartition(partitionOfRecords=>{

        val list = new ListBuffer[DayVideoAccessStat]

        partitionOfRecords.foreach(info =>{

          val day = info.getAs[String]("day")

          val cmsId = info.getAs[Long]("cmsId")

          val times = info.getAs[Long]("times")

          list.append(DayVideoAccessStat(day, cmsId, times))

        })

        StatDao.insertDayVideoAccessTopN(list)

      })

    }catch {

      case e:Exception => e.printStackTrace()

    }

  }

}

Spark- 求最受欢迎的TopN课程的更多相关文章

大数据学习day21-----spark04------1. 广播变量 2. RDD中的cache 3.RDD的checkpoint方法 4. 计算学科最受欢迎老师TopN
1. 广播变量 1.1 补充知识(来源:https://blog.csdn.net/huashetianzu/article/details/7821674) 之所以存在reduce side jo ...
Spark：求出分组内的TopN
制作测试数据源: c1 85 c2 77 c3 88 c1 22 c1 66 c3 95 c3 54 c2 91 c2 66 c1 54 c1 65 c2 41 c4 65 spark scala实现 ...
连通图 poj2186 最受欢迎的牛（求最受欢迎的牛的数量）
Popular Cows Time Limit: 2000MS Memory Limit: 65536K Total Submissions: 27531 Accepted: 11077 De ...
MapReduce显示最受欢迎的Top10课程（按照课程编号）
上篇博客已经说过,会将代码进行优化,并通过TreeMap进行排序实现,现在简单说明一下代码的思路. 项目以上传到github:https://github.com/yandashan/MapReduc ...
spark求相同key的最大值
需求: 求相同key的最大值 [("a", 3), ("a", 2), ("a", 5), ("b", 5), ...
Zeppelie连接jdbc的使用
1. 下载 wget http://apache.mirror.cdnetworks.com/zeppelin/zeppelin-0.8.1/zeppelin-0.8.1-bin-all.tgz 2. ...
大数据学习day29-----spark09-------1. 练习：统计店铺按月份的销售额和累计到该月的总销售额（SQL, DSL,RDD） 2. 分组topN的实现（row_number(), rank(), dense_rank()方法的区别）3. spark自定义函数-UDF
1. 练习数据: (1)需求1:统计有过连续3天以上销售的店铺有哪些,并且计算出连续三天以上的销售额第一步:将每天的金额求和(同一天可能会有多个订单) SELECT sid,dt,SUM(mone ...
一些推荐的spark/hadoop课程
为了分享给你们,也为自己. 感谢下面的老师们! 1.王家林DT大数据梦工厂的大数据IMF传奇行动课程总的目录是: 第一阶段:Linux和Java零基础企业级实战第二阶段:Hadoop和Hive零基 ...
[PY3]——求TopN/BtmN 和排序问题的解决
需求 K长的序列,求TopN K长的序列,求BtmN 排序问题解决 heap.nlargest().heap.nsmallest( ) sorted( )+切片 max( ).min( ) 总结和比 ...

随机推荐

linux权限的深入讨论
1. 怎样查看文件的权限 1) 掌握使用ls –l命令查看文件上所设定的权限. drwxr-xr-x. 2 root root 6 May 26 2017 binfmt.d 权限信 ...
华为nova3超级慢动作酷玩抖音，没有办法我就是这么强大！
华为nova3超级慢动作酷玩抖音,没有办法我就是这么强大! 在华为最新发布的nova 3手机上,抖音通过华为himedia SDK集成了60fps.超级慢动作等华为媒体开放能力,在加持这些能力后,抖音 ...
Python调用API接口的几种方式数据库脚本
Python调用API接口的几种方式 2018-01-08 gaoeb97nd... 转自 one_day_day... 修改微信分享: 相信做过自动化运维的同学都用过API接口来完成某些动作.AP ...
java面试的那些事
跳槽面临的第一个难关那就是面试吧.面试的好坏直接关乎着你年薪的多少.如何顺利完成面试的那些难题,今天我们就从java中复习一下.看看经常面试的知识点,为什么面试这些知识点, 如果你是初级的或刚毕业的j ...
更改Mysql 密码的4种方法（转）
原文:http://www.jb51.net/article/39454.htm 方法1: 用SET PASSWORD命令首先登录MySQL. 格式:mysql> set password f ...
【POJ-2524】Ubiquitous Religions（并查集）
并查集. #include<cstdio> #include<cstring> using namespace std; const int maxn = 55555; int ...
PHP手机号码正则表达式
php用正则表达式判断手机号码的写法:从文章中匹配出所有的手机号就可以preg_match_all(),如果要检查用户输入的手机号是否正确可这样来检查:preg_match(). 用正则匹配手机号码的 ...
【BZOJ2081】[Poi2010]Beads hash+调和级数
[BZOJ2081][Poi2010]Beads Description Zxl有一次决定制造一条项链,她以非常便宜的价格买了一长条鲜艳的珊瑚珠子,她现在也有一个机器,能把这条珠子切成很多块(子串), ...
九度OJ 1349：数字在排序数组中出现的次数（排序、查找）
时间限制:1 秒内存限制:32 兆特殊判题:否提交:2489 解决:742 题目描述: 统计一个数字在排序数组中出现的次数. 输入: 每个测试案例包括两行: 第一行有1个整数n,表示数组的大小. ...
Codeforces441C_Valera and Tubes(暴力)
Valera and Tubes time limit per test 1 second memory limit per test 256 megabytes input standard inp ...

Spark- 求最受欢迎的TopN课程

Spark- 求最受欢迎的TopN课程的更多相关文章

随机推荐

热门专题