使用spark dataSet 和rdd 解决某个用户在某个地点待了多长时间

现有如下数据文件需要处理
格式：CSV
位置：hdfs://myhdfs/input.csv
大小：100GB
字段：用户ID，位置ID，开始时间，停留时长(分钟）

4行样例：

UserA,LocationA,2018-01-01 08:00:00,60
UserA,LocationA,2018-01-01 09:00:00,60
UserA,LocationB,2018-01-01 10:00:00,60
UserA,LocationA,2018-01-01 11:00:00,60

解读：

样例数据中的数据含义是：
用户UserA，在LocationA位置，从8点开始，停留了60分钟
用户UserA，在LocationA位置，从9点开始，停留了60分钟
用户UserA，在LocationB位置，从10点开始，停留了60分钟
用户UserA，在LocationA位置，从11点开始，停留了60分钟

该样例期待输出：
UserA,LocationA,2018-01-01 08:00:00,120
UserA,LocationB,2018-01-01 10:00:00,60
UserA,LocationA,2018-01-01 11:00:00,60

处理逻辑：
1 对同一个用户，在同一个位置，连续的多条记录进行合并
2 合并原则：开始时间取最早时间，停留时长加和

要求：请使用Spark、MapReduce或其他分布式计算引擎处理

思路：按照按照用户ID和位置ID分组，分组之后按照时间列排序，由于数据之间的存在依赖关系，并且依赖关系比较连续，满足某种关系的数据要进行合并操作，因此使用sql部分的代码很难实现。在这使用的是将Dataset转化为RDD之后使用基于分区进行操作的方法处理数据。拿到相关的数据，按照时间顺序读取，判断，累加等进行处理。

 package com.zhf.streaming

 import java.text.SimpleDateFormat

 import org.apache.spark.Partitioner

 import org.apache.spark.rdd.RDD

 import org.apache.spark.sql.{Dataset, SparkSession}

 import scala.collection.mutable.ArrayBuffer

 case class ResultData(userID:String,locationID:String,startTime:String,endTime:String,stayTime:Long)

 object Test {

   def main(args: Array[String]): Unit = {

     val spark = SparkSession.builder().appName("test").master("local[*]").getOrCreate()

     import spark.implicits._

     import org.apache.spark.sql.functions._

     val info = spark.read

       .format("csv")

       .option("path", "src/data/user.csv")

       .load()

       .toDF("userID", "locationID", "startTimes", "stayMinutes")

       .as[(String, String, String, String)]

     val ds: Dataset[((String, String, String), ResultData)] = info.map {

       case (userID, locationID, startTimes, stayMinutes) =>

         //让起始时间+停留时间=结束时间

         val sd = new SimpleDateFormat("yyyy-MM-dd HH:mm:ss")

         val date = sd.parse(startTimes)

         val endTime = sd.format(date.getTime + (stayMinutes.trim.toInt * 60 * 1000))

         ((userID, locationID, startTimes), ResultData(userID, locationID, startTimes, endTime, stayMinutes.trim.toLong))

     }.as[((String, String, String), ResultData)]

     //按照用户ID和位置ID分组，分组之后按照时间列排序

     val newDS: RDD[((String, String, String), ResultData)] = ds.rdd.repartitionAndSortWithinPartitions(new Partitioner {

       override def numPartitions: Int = 4

       override def getPartition(key: Any): Int = key match {

         case (userID, locationID, _) => (userID.hashCode + locationID.hashCode) % numPartitions

         case _ => 0

       }

     })

     val result = newDS.mapPartitions(iter => {

       val listBuffer = iter.toBuffer

       val buffer = ArrayBuffer.empty[ResultData]

       var resultData: ResultData = null;

       //分区内只有一个元素的情况

       if (listBuffer.size == 1) {

         resultData = listBuffer(0)._2;

         buffer += resultData

       } else {

         //分区内有多个元素

         listBuffer.foreach {

           case ((userID, locationID, startTimes), currentData) =>

             //初始化赋值

             if (resultData == null) {

               resultData = ResultData(userID, locationID, startTimes, currentData.endTime, currentData.stayTime)

             } else {

               //如果当前行的起始时间与上一行的结束时间相同

               if (currentData.startTime == resultData.endTime) {

                 //合并 修改初始值

                 resultData = ResultData(currentData.userID, currentData.locationID, resultData.startTime, currentData.endTime, resultData.stayTime + currentData.stayTime)

               } else {

                 //不相同的情况下，将上一行结果添加到结果集，并修改初始值

                 buffer += resultData

                 resultData = currentData

               }

             }

         }

         //最后一个元素对象

         if (resultData != null) {

           buffer += resultData

         }

       }

       buffer.toIterator

     })

     result.collect()

       .sortBy(_.startTime)

       .foreach(println)

   }

 }

使用spark dataSet 和rdd 解决某个用户在某个地点待了多长时间的更多相关文章

解决使用Touch ID API在回调时界面“长时间卡住”的问题
Touch ID是iOS8上新公开的API,关于详细介绍和用法可以看CocoaChina的这两篇文章:上和下,在此篇文章中不再赘述. 我在app中需要的效果是如果touch id验证通过,则页面p ...
Spark SQL 之 RDD、DataFrame 和 Dataset 如何选择
引言 Apache Spark 2.2 以及以上版本提供的三种 API - RDD.DataFrame 和 Dataset,它们都可以实现很多相同的数据处理,它们之间的性能差异如何,在什么情况下该选用 ...
Spark计算模型-RDD介绍
在Spark集群背后,有一个非常重要的分布式数据架构,即弹性分布式数据集(Resilient Distributed DataSet,RDD),它是逻辑集中的实体,在集群中的多台集群上进行数据分区.通 ...
Spark学习之RDD编程总结
Spark 对数据的核心抽象——弹性分布式数据集(Resilient Distributed Dataset,简称 RDD).RDD 其实就是分布式的元素集合.在 Spark 中,对数据的所有操作不外 ...
使用Scala编写Spark程序求基站下移动用户停留时长TopN
使用Scala编写Spark程序求基站下移动用户停留时长TopN 1. 需求:根据手机基站日志计算停留时长的TopN 我们的手机之所以能够实现移动通信,是因为在全国各地有许许多多的基站,只要手机一开机 ...
Spark深入之RDD
目录 Part III. Low-Level APIs Resilient Distributed Datasets (RDDs) 1.介绍 2.RDD代码 3.KV RDD 4.RDD Join A ...
Spark学习之RDD
RDD概述什么是RDD RDD(Resilient Distributed Dataset)叫做弹性分布式数据集,是Spark中最基本的数据抽象,它代表一个不可变.可分区.里面的元素可并行计算的集合 ...
spark教程(三)-RDD认知与创建
RDD 介绍 spark 最重要的一个概念叫 RDD,Resilient Distributed Dataset,弹性分布式数据集,它是 spark 的最基本的数据(也是计算)抽象. 代码中是一个抽象 ...
Spark——DataFrames，RDD，DataSets、广播变量与累加器
Spark--DataFrames,RDD,DataSets 一.弹性数据集(RDD) 创建RDD 1.1RDD的宽依赖和窄依赖二.DataFrames 三.DataSets 四.什么时候使用Dat ...

随机推荐

webService 的使用
webService Web service是一个平台独立的,低耦合的,自包含的.基于可编程的web的应用程序,可使用开放的XML(标准通用标记语言下的一个子集)标准来描述.发布.发现.协调和配置这些 ...
C语言入门4-运算符和表达式
一. 分类 C语言一共有34种运算符,10种运算类型,本节我们要掌握的有( 7 种) 算术运算符(+.-.*./.%). 关系运算符(>.>=.==.!=.<.<=). ...
python List交集、并集、差集
工作中遇到了求两个集合的差集,但是集合集合中包含字典,所以使用difference方法会报错,看了一些别人的博客,整理了一下. 1. 获取两个list 的交集print list(set(a).int ...
java读写文件小心缓存数组
一般我们读写文件的时候都是这么写的,看着没问题哈. public static void main(String[] args) throws Exception { FileInputStr ...
css常用知识与用法
1 类选择器就是再某一个标签后面加上class =“” 然后再到前面去定义这个class 一定要记住前面加. 2 id选择器和类选择器是差不多的不过id选择器前面不加.而加# ...
maven-build-downloading
1. 场景描述 maven库用的是公司私服和阿里云结合的方式(maven多仓库配置),本项目maven依赖的有其他项目组的jar包(单点登录),但是天有不测风云,依赖单点登录的好几个jar包,在编译( ...
Python基础总结之异常、调试代码第十二天开始（新手可相互督促）
年薪20万的梦想,加油! 我们在写代码的时候,控制台经常会报错,因为某种错误,导致我们的程序停止,且不再运行下面的代码. 我们看一个错误的代码示例: def add_1(): #没有参数 print( ...
Pandas随机采样
实现对DataFrame对象随机采样 pandas是基于numpy建立起来的,所以numpy大部分函数可作用于DataFrame和Series数据结构. numpy.random.permutatio ...
夯实Java基础（十一）——内部类
1.内部类的概念内部类顾名思义:将一个类定义在另一个类里面或者一个方法里面,这样的类称为内部类.对于很多Java初学者来说,内部类学起来真的是一头雾水,根本理解不清楚是个什么东西,包括我自己(我太菜 ...
Keil5调试过程中遇到的一些警告和错误
最近用keil5调试代码出了一些警告与错误,整理如下: 1.warning: #1295-D: Deprecated declaration run_c - give arg types void r ...

使用spark dataSet 和rdd 解决 某个用户在某个地点待了多长时间

使用spark dataSet 和rdd 解决 某个用户在某个地点待了多长时间的更多相关文章

随机推荐

热门专题

使用spark dataSet 和rdd 解决某个用户在某个地点待了多长时间

使用spark dataSet 和rdd 解决某个用户在某个地点待了多长时间的更多相关文章