使用Spark进行搜狗日志分析实例——列出搜索不同关键词超过10个的用户及其搜索的关键词

 package sogolog

 import org.apache.hadoop.io.{LongWritable, Text}

 import org.apache.hadoop.mapred.TextInputFormat

 import org.apache.spark.rdd.RDD

 import org.apache.spark.{SparkConf, SparkContext}

 class RddFile {

   def readFileToRdd(path: String): RDD[String] = {

     val conf = new SparkConf().setMaster("local").setAppName("sougoDemo")

     val sc = new SparkContext(conf);

     //使用这种方法能够避免中文乱码

     sc.hadoopFile("J:\\scala\\workspace\\first-spark-demo\\sougofile\\SogouQ.reduced",classOf[TextInputFormat], classOf[LongWritable], classOf[Text]).map{

       pair =>  new String(pair._2.getBytes, 0, pair._2.getLength, "GBK")}

   }

 }

 package sogolog

 import org.apache.spark.rdd.RDD

 /**

   * 列出搜索不同关键词超过3个的用户及其搜索的关键词

   */

 object userSearchKeyWordLT3 {

   def main(args: Array[String]): Unit = {

     //1、读入文件

     val textFile = new RddFile().readFileToRdd("J:\\scala\\workspace\\first-spark-demo\\sougofile\\SogouQ.reduced")

     //2、map操作，将每行的用户、关键词读入新的RDD中

     val userKeyWordTuple:RDD[(String,String)] = textFile.map(line=>{

       val arr = line.split("\t")

       (arr(1),arr(2))

     })

     //3、reduce操作，将相同用户的关键词进行合并

     val userKeyWordReduced = userKeyWordTuple.reduceByKey((x,y)=>{

       //去重

       if(x.contains(y)){

         x

       }else{

         x+","+y

       }

     })

     //4、使用filter进行最终过滤

     val finalResult = userKeyWordReduced.filter(x=>{

       //过滤小于10个关键词的用户

       x._2.split(",").length>=10

     })

     //5、打印出结果

     finalResult.collect().foreach(println)

   }

 }

运行结果：

使用Spark进行搜狗日志分析实例——列出搜索不同关键词超过10个的用户及其搜索的关键词的更多相关文章

使用Spark进行搜狗日志分析实例——统计每个小时的搜索量
package sogolog import org.apache.spark.rdd.RDD import org.apache.spark.{SparkConf, SparkContext} /* ...
使用Spark进行搜狗日志分析实例——map join的使用
map join相对reduce join来说,可以减少在shuff阶段的网络传输,从而提高效率,所以大表与小表关联时,尽量将小表数据先用广播变量导入内存,后面各个executor都可以直接使用 pa ...
ELK 日志分析实例
ELK 日志分析实例一.ELK-web日志分析二.ELK-MySQL 慢查询日志分析三.ELK-SSH登陆日志分析四.ELK-vsftpd 日志分析一.ELK-web日志分析通过logstash ...
Spark之搜狗日志查询实战
1.下载搜狗日志文件: 地址:http://www.sogou.com/labs/resource/chkreg.php 2.利用WinSCP等工具将文件上传至集群. 3.创建文件夹,存放数据: mk ...
基于Spark的网站日志分析
本文只展示核心代码,完整代码见文末链接. Web Log Analysis 提取需要的log信息,包括time, traffic, ip, web address 进一步解析第一步获得的log信息,如 ...
spark提交异常日志分析
java.lang.NoSuchMethodError: org.apache.spark.sql.SQLContext.sql(Ljava/lang/String;)Lorg/apache/spar ...
(转载)shell日志分析常用命令
shell日志分析常用命令总结时间:2016-03-09 15:55:29来源:网络导读:shell日志分析的常用命令,用于日志分析的shell脚本,统计日志中百度蜘蛛的抓取量.抓取最多的页面.抓 ...
Spark RDD/Core 编程 API入门系列之动手实战和调试Spark文件操作、动手实战操作搜狗日志文件、搜狗日志文件深入实战（二）
1.动手实战和调试Spark文件操作这里,我以指定executor-memory参数的方式,启动spark-shell. 启动hadoop集群 spark@SparkSingleNode:/usr/ ...
[spark案例学习] WEB日志分析
数据准备数据下载:美国宇航局肯尼迪航天中心WEB日志我们先来看看数据:首先将日志加载到RDD,并显示出前20行(默认). import sys import os log_file_path =' ...

随机推荐

[opengl]Clion配置opengl
如何在Clion中编写Opengl程序首先下载 GLAD GLFW 创建Clion工程在工程中创建文件夹lib.dll.include文件夹把下载下来的东西放入对应的文件夹 CMakeLists ...
【我的前端自学之路】【HTML5】.html和.htm的区别
以下为自学笔记内容,仅供参考. 转发请保留原文链接:https://www.cnblogs.com/it-dennis/p/10508171.html .htm 和 .html 的区别 .htm 和 ...
SAP 跨公司销售业务
SAP 跨公司销售业务 http://blog.sina.com.cn/s/blog_95ac31e30102x5wh.html 分类: SAP_SD SAP 跨公司销售业务一.业务简介在由 ...
structure streaming笔记
基于micro-batch, spark2.3之后, 支持continues processing 基于spark SQL 如同在静态table上运行标准批查询一样表现流计算, spark 通过在一个 ...
移动端input“输入框”常见问题及解决方法
转自 https://www.cnblogs.com/ljx20180807/p/9837748.html 1. ios中,输入框获得焦点时,页面输入框被遮盖,定位的元素位置错乱: 当页input存在 ...
js 克隆数组
js克隆数组 1.遍历push 2.slice const a1 = [1, 2];const a2 = a1.slice() 3.concat() const a2 = a1.concat(); a ...
Keras + LSTM 做回归demo
学习神经网络想拿lstm 做回归, 网上找demo 基本三种: sin拟合cos 那个, 比特币价格预测(我用相同的代码和数据没有跑成功, 我太菜了)和keras 的一个例子我基于keras 那个 ...
python 数据分类赋值
问题描述:在数据预处理时,往往需要对描述性数据进行分类赋值或对数据进行分级赋值. 首先,会想到用for循环,依次判断赋值: for n in range(len(data1)): print(n) i ...
python 读取excel文件
方法一:利用pandas import pandas as pd inputfile_1 = "F:\\大论文实验\\福贡县数据\\贫困人口数据_2015.xlsx" data1 ...
oracle 将一个表复制到另外一个表里 .
复制一个表到另一个表.视图.临时表博客分类: oracle Oracle数据结构软件测试SQL 创建一个表new_table和old_table表结构一样(没有old_table的记录) creat ...

使用Spark进行搜狗日志分析实例——列出搜索不同关键词超过10个的用户及其搜索的关键词

使用Spark进行搜狗日志分析实例——列出搜索不同关键词超过10个的用户及其搜索的关键词的更多相关文章

随机推荐

热门专题