大数据入门第二十二天——spark（三）自定义分区、排序与查找

一、自定义分区

　　1.概述

　　　　默认的是Hash的分区策略，这点和Hadoop是类似的，具体的分区介绍，参见：https://blog.csdn.net/high2011/article/details/68491115

　　2.实现

package cn.itcast.spark.day3

import java.net.URL

import org.apache.spark.{HashPartitioner, Partitioner, SparkConf, SparkContext}

import scala.collection.mutable

/**

  * Created by root on 2016/5/18.

  */

object UrlCountPartition {

  def main(args: Array[String]) {

    val conf = new SparkConf().setAppName("UrlCountPartition").setMaster("local[2]")

    val sc = new SparkContext(conf)

    //rdd1将数据切分，元组中放的是（URL， 1）

    val rdd1 = sc.textFile("c://itcast.log").map(line => {

      val f = line.split("\t")

      (f(1), 1)

    })

    val rdd2 = rdd1.reduceByKey(_ + _)

    val rdd3 = rdd2.map(t => {

      val url = t._1

      val host = new URL(url).getHost

      (host, (url, t._2))

    })

    val ints = rdd3.map(_._1).distinct().collect()

    val hostParitioner = new HostParitioner(ints)

//    val rdd4 = rdd3.partitionBy(new HashPartitioner(ints.length))

    val rdd4 = rdd3.partitionBy(hostParitioner).mapPartitions(it => {

      it.toList.sortBy(_._2._2).reverse.take(2).iterator

    })

    rdd4.saveAsTextFile("c://out4")

    //println(rdd4.collect().toBuffer)

    sc.stop()

  }

}

/**

  * 决定了数据到哪个分区里面

  * @param ins

  */

class HostParitioner(ins: Array[String]) extends Partitioner {

  val parMap = new mutable.HashMap[String, Int]()

  var count = 0

  for(i <- ins){

    parMap += (i -> count)

    count += 1

  }

  override def numPartitions: Int = ins.length

  override def getPartition(key: Any): Int = {

    parMap.getOrElse(key.toString, 0)

  }

}

　　// 与Hadoop相通，不再赘述

二、自定义排序

　　基本上就是结合之前的隐式转换了：（这里使用样例类可以不用new就能得到实例，另外也可以用于模式匹配）

package cn.itcast.spark.day3

import org.apache.spark.{SparkConf, SparkContext}

object OrderContext {

  implicit val girlOrdering  = new Ordering[Girl] {

    override def compare(x: Girl, y: Girl): Int = {

      if(x.faceValue > y.faceValue) 1

      else if (x.faceValue == y.faceValue) {

        if(x.age > y.age) -1 else 1

      } else -1

    }

  }

}

/**

  * Created by root on 2016/5/18.

  */

//sort =>规则 先按faveValue，比较年龄

//name,faveValue,age

object CustomSort {

  def main(args: Array[String]) {

    val conf = new SparkConf().setAppName("CustomSort").setMaster("local[2]")

    val sc = new SparkContext(conf)

    val rdd1 = sc.parallelize(List(("yuihatano", 90, 28, 1), ("angelababy", 90, 27, 2),("JuJingYi", 95, 22, 3)))

    import OrderContext._

    val rdd2 = rdd1.sortBy(x => Girl(x._2, x._3), false)

    println(rdd2.collect().toBuffer)

    sc.stop()

  }

}

/**

  * 第一种方式

  * @param faceValue

  * @param age

case class Girl(val faceValue: Int, val age: Int) extends Ordered[Girl] with Serializable {

  override def compare(that: Girl): Int = {

    if(this.faceValue == that.faceValue) {

      that.age - this.age

    } else {

      this.faceValue -that.faceValue

    }

  }

}

  */

/**

  * 第二种，通过隐式转换完成排序

  * @param faceValue

  * @param age

  */

case class Girl(faceValue: Int, age: Int) extends Serializable

　　// 复习隐式转换，基本也无新内容

三、IP查找小练习

　　参考：https://www.cnblogs.com/wnbahmbb/p/6250099.html

大数据入门第二十二天——spark（三）自定义分区、排序与查找的更多相关文章

大数据入门第二十二天——spark（一）入门与安装
一.概述 1.什么是spark 从官网http://spark.apache.org/可以得知: Apache Spark™ is a fast and general engine for larg ...
大数据入门第二十二天——spark（二）RDD算子（1）
一.RDD概述 1.什么是RDD RDD(Resilient Distributed Dataset)叫做分布式数据集,是Spark中最基本的数据抽象,它代表一个不可变.可分区.里面的元素可并行计算的 ...
大数据入门第二十二天——spark（二）RDD算子（2）与spark其它特性
一.JdbcRDD与关系型数据库交互虽然略显鸡肋,但这里还是记录一下(点开JdbcRDD可以看到限制比较死,基本是鸡肋.但好在我们可以通过自定义的JdbcRDD来帮助我们完成与关系型数据库的交互.这 ...
大数据入门第二十五天——elasticsearch入门
一.概述推荐路神的ES权威指南翻译:https://es.xiaoleilu.com/010_Intro/00_README.html 官网:https://www.elastic.co/cn/pr ...
大数据入门第二十三天——SparkSQL（二）结合hive
一.SparkSQL结合hive 1.首先通过官网查看与hive匹配的版本这里可以看到是1.2.1 2.与hive结合 spark可以通过读取hive的元数据来兼容hive,读取hive的表数据,然 ...
大数据入门第二十五天——logstash入门
一.概述 1.logstash是什么根据官网介绍: Logstash 是开源的服务器端数据处理管道,能够同时从多个来源采集数据.转换数据,然后将数据发送到您最喜欢的 “存储库” 中.(我们的存储库 ...
大数据入门第二十四天——SparkStreaming（一）入门与示例
一.概述 1.什么是spark streaming Spark Streaming is an extension of the core Spark API that enables scalabl ...
大数据入门第二十三天——SparkSQL（一）入门与使用
一.概述 1.什么是sparkSQL 根据官网的解释: Spark SQL is a Spark module for structured data processing. 也就是说,sparkSQ ...
大数据入门第二天——基础部分之zookeeper（下）
一.集群自启动脚本 1.关闭zk [root@localhost bin]# jps Jps QuorumPeerMain [root@localhost bin]# //kill或者stop都是可以 ...

随机推荐

Android 借助Stetho在Chrome上调试Android网络、数据库、Sharedpreferences
Android 借助Stetho在Chrome上调试Android网络.数据库.Sharedpreferences 转载请标明出处:http://blog.csdn.net/zhaoyanjun6/a ...
EL表达式和标签
1.什么是EL expression language 表达式语言特点: 语言简单,使用方便 .${表达式}. 提供自动类型转换的功能如果返回结果为null时 String -- ”” Numbe ...
存储过程使用 in 添加多个参数的情况处理方式【转】
原文连接:http://www.jb51.net/article/41472.htm -->情景 ① 通过刚才的SQL递归方式,我们已经可以将一个组织机构和其全部下级单位查询出来:假设每个组织机 ...
单点登录SSO的实现原理（转）
单点登录SSO(Single Sign On)说得简单点就是在一个多系统共存的环境下,用户在一处登录后,就不用在其他系统中登录,也就是用户的一次登录能得到其他所有系统的信任.单点登录在大型网站里使用得 ...
利用windows的计划任务和eKing.CmdReadFileAndSendEmailOper（控制台小程序）实现远程登录服务器的邮件告警提醒
一.场景摘要: 1.windows计划任务中,有一个用户登录时候触发的事件 2.cmd命令:netstat -ano | find "3389" 可以看到当前远程登录的IP 3 ...
MySQL基础之 AUTO_INCREMENT
AUTO_INCREMENT AUTO_INCREMENT是mysql唯一扩展的完整性约束,当为数据库表中插入新纪录时,字段上的值会自动生成唯一的ID,再具体设置AUTO_INCREMENT约束时,一 ...
乘风破浪：LeetCode真题_033_Search in Rotated Sorted Array
乘风破浪:LeetCode真题_033_Search in Rotated Sorted Array 一.前言将传统的问题进行一些稍微的变形,这个时候我们可能无所适从了,因此还是实践出真知, ...
js将时间戳转换成日期格式-陈远波
var timestamp =1539598555000;//时间戳 //时间戳转换成time格式function timestampToTime(timestamp) { var date = ne ...
ajax知识点及正则表达式总结
一.JSON JSON是JavaScript Object Notation 的首字母缩写,单词的意思是javascript对象表示法,这里说的json指的是类似于javascript对象的一种数 ...
Ubuntu集群配置ntp服务
1.概述 NTP(Network Time Protocol)是用来使计算机时间同步化的一种协议,它可以使计算机对其服务器或时钟源(如石英钟,GPS等等)做同步化,它可以提供高精准度的时间校正(LAN ...