RDD实例

实例一：

teacher.log

http://bigdata.baidu.cn/zhangsan

http://bigdata.baidu.cn/zhangsan

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/wangwu

http://bigdata.baidu.cn/wangwu

http://javaee.baidu.cn/xiaoxu

http://javaee.baidu.cn/xiaoxu

http://javaee.baidu.cn/laoyang

http://javaee.baidu.cn/laoyang

http://javaee.baidu.cn/laoyang

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/wangwu

http://bigdata.baidu.cn/wangwu

http://javaee.baidu.cn/xiaoxu

http://javaee.baidu.cn/xiaoxu

http://javaee.baidu.cn/laoyang

http://javaee.baidu.cn/laoyang

http://javaee.baidu.cn/laoyang

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/lisi

http://bigdata.baidu.cn/wangwu

http://bigdata.baidu.cn/wangwu

http://javaee.baidu.cn/xiaoxu

http://javaee.baidu.cn/xiaoxu

http://javaee.baidu.cn/laoyang

http://javaee.baidu.cn/laoyang

http://javaee.baidu.cn/laoyang

http://php.baidu.cn/laoli

http://php.baidu.cn/laoliu

http://php.baidu.cn/laoli

http://php.baidu.cn/laoli

全局topn 组内topn

代码：

package dayo1

import java.net.URL

import org.apache.spark.rdd.RDD

import org.apache.spark.{SparkConf, SparkContext}

object teacher2 {

  def main(args: Array[String]): Unit = {

    val conf = new SparkConf ()

      .setAppName ( this.getClass.getSimpleName )

      .setMaster ( "local[1]" )

    val sc = new SparkContext ( conf )

    val lines = sc.textFile ( "E:\\teacher.log" )

    val overAll: RDD[((String, String), Int)] = lines.map ( tp => {

      val teacher: String = tp.split ( "/" ).last

      val host = new URL ( tp ).getHost

      val subject = host.substring ( , host.indexOf ( "." ) )

      ((teacher, subject), )

    } )

    //所有科目和老师的前三

    val topOverAll = overAll.reduceByKey ( _ + _ ).sortBy ( -_._2 ).take (  ).foreach ( println )

    //每个科目前两名的老师

    val topGroup = overAll.reduceByKey ( _ + _ ).groupBy ( _._1._2 ).mapValues ( _.toList.sortBy ( -_._2 ).take (  ) ).foreach ( println )

    sc.stop ()

  }

}

实例二：

去重

file1:

-- a

-- b

-- c

-- d

-- a

-- b

-- c

-- c

file2:

-- b

-- a

-- b

-- d

-- a

-- c

-- d

-- c

代码：

package dayo1

import org.apache.spark.{SparkConf, SparkContext}

object distinct {

  def main(args: Array[String]): Unit = {

    val cof = new SparkConf ()

      .setAppName ( this.getClass.getSimpleName )

      .setMaster ( "local[1]" )

    val sc = new SparkContext ( cof )

    val file1 = sc.textFile ( "E:\\file1.txt" )

    val file2 = sc.textFile ( "E:\\file2.txt" )

    val list = file1.union ( file2 ).distinct ().sortBy ( tp => tp )

    list.foreach ( println )

    sc.stop ()

  }

}

实例三：

temperature.txt

0067011990999991950051507004888888889999999N9++

0067011990999991950051512004888888889999999N9++

0067011990999991950051518004888888889999999N9-+

0067011990999991949032412004888888889999999N9++

0067011990999991950032418004888888880500001N9++

0067011990999991950051507004888888880500001N9++

需求：分析每年的最高温度

代码：

package dayo1

import org.apache.spark.{SparkConf, SparkContext}

/**

  * 0067011990999991950051507004888888889999999N9+00001+9999999999999999999999

  * 0067011990999991950051512004888888889999999N9+00221+9999999999999999999999

  * 0067011990999991950051518004888888889999999N9-00111+9999999999999999999999

  * 0067011990999991949032412004888888889999999N9+01111+9999999999999999999999

  * 0067011990999991950032418004888888880500001N9+00001+9999999999999999999999

  * 0067011990999991950051507004888888880500001N9+00781+9999999999999999999999

  *

  * 12345678911234567892123456789312345678941234567895123456789612345678971234

  * 需求：分析每年的最高温度

  * 数据说明：

  *

  *

  * 第15-19个字符是year 6-9

  *

  * 第45-50位是温度表示，+表示零上 -表示零下，且温度的值不能是9999，9999表示异常数据

  *

  * 第50位值只能是0、1、4、5、9几个数字

  */

object temperature {

  def main(args: Array[String]): Unit = {

    val cof = new SparkConf ()

      .setAppName ( this.getClass.getSimpleName )

      .setMaster ( "local[*]" )

    val sc = new SparkContext ( cof )

    val lines = sc.textFile ( "E:\\temperature.txt" )

    val yearAndTemp = lines.filter ( tp => {

      var temp =

      val query = tp.charAt (  ).toString //val query=tp.subString(50,51)

      if (tp.charAt (  ).equals ( "+" )) {

        temp = tp.substring ( ,  ).toInt

      } else {

        temp = tp.substring ( ,  ).toInt

      }

      temp !=  && query.matches ( "[01459]" )

    } ).map ( tp => {

      val year = tp.substring ( ,  )

      var temp =

      if (tp.charAt (  ).equals ( "+" )) {

        temp = tp.substring ( ,  ).toInt

      } else {

        temp = tp.substring ( ,  ).toInt

      }

      (year, temp)

    } )

    val res = yearAndTemp.reduceByKey ( (x, y) => if (x > y) x else y )

    res.foreach ( tp => println ( "year:" + tp._1 + "  temp:" + tp._2 ) )

    sc.stop ()

  }

}

RDD实例的更多相关文章

Spark RDD编程核心
一句话说,在Spark中对数据的操作其实就是对RDD的操作,而对RDD的操作不外乎创建.转换.调用求值. 什么是RDD RDD(Resilient Distributed Dataset),弹性分布式 ...
Spark RDD 操作
1. Spark RDD 创建操作 1.1 数据集合 parallelize 可以创建一个能够并行操作的RDD.其函数定义如下: ) scala> sc.defaultParallelism ...
spark streaming之三 rdd,job的动态生成以及动态调度
前面一篇讲到了,DAG静态模板的生成.那么spark streaming会在每一个batch时间一到,就会根据DAG所形成的逻辑以及物理依赖链(dependencies)动态生成RDD以及由这些RDD ...
spark 源码分析之一 -- RDD的四种依赖关系
RDD的四种依赖关系 RDD四种依赖关系,分别是 ShuffleDependency.PrunDependency.RangeDependency和OneToOneDependency四种依赖关系.如 ...
Spark入门实战系列--7.Spark Streaming（上）--实时流计算Spark Streaming原理介绍
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .Spark Streaming简介 1.1 概述 Spark Streaming 是Spa ...
Spark Streaming揭秘 Day15 No Receivers方式思考
Spark Streaming揭秘 Day15 No Receivers方式思考在前面也有比较多的篇幅介绍了Receiver在SparkStreaming中的应用,但是我们也会发现,传统的Recei ...
spark 启动job的流程分析
从WordCount開始分析编写一个样例程序编写一个从HDFS中读取并计算wordcount的样例程序: packageorg.apache.spark.examples importorg.ap ...
《图解Spark：核心技术与案例实战》作者经验谈
1,看您有维护博客,还利用业余时间著书,在技术输出.自我提升以及本职工作的时间利用上您有没有什么心得和大家分享?(也可以包含一些您写书的小故事.)回答:在工作之余能够写博客.著书主要对技术的坚持和热爱 ...
SparkStreaming流处理
一.Spark Streaming的介绍 1. 流处理流式处理(Stream Processing).流式处理就是指源源不断的数据流过系统时,系统能够不停地连续计算.所以流式处理没有什么 ...

随机推荐

从零开始实现一个简易的Java MVC框架(三)--实现IOC
Spring中的IOC IoC全称是Inversion of Control,就是控制反转,他其实不是spring独有的特性或者说也不是java的特性,他是一种设计思想.而DI(Dependency ...
Python-multiprocessing-Pool模块
from multiprocessing import Pool import os import time import random def long_time_task(name): print ...
mysql5.7提示密码过期的解决方法
首先把MySQL关闭打开一个终端,输入 sudo /usr/local/mysql/bin/mysqld_safe --skip-grant-tables 执行完命令后,再打开一个新的终端 sudo ...
Jmeter（十）断言
断言是我们在做自动化测试中常用的一个功能,用于检查测试中响应数据是否符合预期. 使用断言的目的:在request的返回层面增加一层判断机制:因为request成功了,并不代表结果一定正确. 下面我们就 ...
ERROR 1130 (HY000): Host 'test177' is not allowed to connect to this MySQL server
异常在测试环境新搭建的MySQL服务端,启动后登陆MySQL如下异常: [root@test177 ~]# mysql -u root -po2jSLWw0ni -h test177 mysql: ...
jmeter操作登录等简单的使用
一.登录 1.打开jmeter创建“线程组” 2.创建HTTP默认值 3.添加http默认值后,后边的http请求就可以省略填写部分内容 4.添加“HTTP信息管理头”在内添加名称:“Content- ...
SSRF和XSS-filter_var(), preg_match() 和 parse_url()绕过学习
0x01:url标准的灵活性导致绕过filter_var与parse_url进行ssrf filter_var() (PHP 5 >= 5.2.0, PHP 7) filter_var — 使用 ...
一本学习HTTP很好的书《图解HTTP》
网上电子版的一堆(*^__^*) 嘻嘻……
TCP时间戳选项Timestamp
时间戳选项发送方在每个报文段中放置一个时间戳值.接收方在确认中返回这个数值,从而允许发送方为每一个收到的ACK计算RTT(我们必须说“每一个收到的ACK”而不是“每一个收到的报文段”,是因为TCP通常 ...
Linux 多线程按照线程顺序打印字符
#include <stdio.h> #include <pthread.h> #include <unistd.h> ; pthread_mutex_t mute ...

RDD实例

RDD实例的更多相关文章

随机推荐

热门专题