flum到kafka 收集数据存储到redis 案例（ip.txt）

ip.scala

package ip

import org.apache.kafka.clients.consumer.ConsumerRecord

import org.apache.kafka.common.serialization.StringDeserializer

import org.apache.log4j.{Level, Logger}

import org.apache.spark.SparkConf

import org.apache.spark.rdd.RDD

import org.apache.spark.streaming.dstream.InputDStream

import org.apache.spark.streaming.kafka010._

import org.apache.spark.streaming.{Seconds, StreamingContext}

object ip {

  Logger.getLogger("org").setLevel(Level.WARN)

  def main(args: Array[String]): Unit = {

    //new sc

    val conf = new SparkConf ()

      .setAppName ( this.getClass.getSimpleName )

      .setMaster ( "local[*]" )

    val ssc=new StreamingContext(conf,Seconds())

    //创建topic

    val topic="ip01"

    val topics=Array(topic)

    //创建groupid

    val groupid="IPoffsets"

    //创建kafka链接参数

    val params=Map(

      "bootstrap.servers" -> "hadoop01:9092,hadoop02:9092,hadoop03:9092",

      "key.deserializer" -> classOf[StringDeserializer],

      "value.deserializer" -> classOf[StringDeserializer],

      "group.id" -> groupid,

      //告诉大家从哪里消费

      "auto.offset.reset" -> "earliest",

      //是否自动提交偏移量

      "enable.auto.commit" -> (false: java.lang.Boolean)

    )

    //创建kafka直连方式

    //判断偏移量是否存在

    val stream: InputDStream[ConsumerRecord[String, String]] =

      KafkaUtils.createDirectStream(

        ssc,

        LocationStrategies.PreferConsistent,

        ConsumerStrategies.Subscribe[String,String](topics,params)

      )

    stream.foreachRDD(rdd=>{

    rdd.foreach(println(_))

      //开启偏移量

      val ranges: Array[OffsetRange] = rdd.asInstanceOf[HasOffsetRanges].offsetRanges

      //去获取数据

      val ip1:RDD[((String,String,String),Int)] = rdd.map ( tp => {

        val splits = tp.value().split ( "[|]" )

        val prive=splits()

        val city = splits (  )

        val fangshi=splits()

        ((prive,city,fangshi),)

      } ).reduceByKey(_+_)

      //写一个方法，存储数据与偏移量信息

      DateMyRedis.saveDataOffset(ip1,ranges,groupid)

    })

    ssc.start()

    ssc.awaitTermination()

  }

}

DataMyRedis.scala

package ip

import java.util

import day15.Jpoods

import org.apache.kafka.common.TopicPartition

import org.apache.spark.rdd.RDD

import org.apache.spark.streaming.kafka010.OffsetRange

import scala.collection.mutable

object DateMyRedis {

  //保存数据到redis

  def saveDataOffset(result: RDD[((String,String, String),Int)],ranges: Array[OffsetRange],groupingID: String): Unit ={

    result.foreachPartition(filter=>{

      //获取jedis对象

      val jedis = Jpoods.getJedis ()

      //redis开启事务

      val transaction = jedis.multi()

      filter.foreach(tp=>{

        try {

          //存储数据

          transaction.hincrBy("IP1", tp._1._1+":"+tp._1._2+":"+tp._1._3, tp._2)

          //存储偏移量

          for (o <- ranges) {

            transaction.hset(groupingID, o.topic + ":" + o.partition, o.untilOffset.toString)

          }

        }catch {

          case _ =>

            println("报错了，需要回滚")

            transaction.discard()

        }

      })

      transaction.exec()

      jedis.close()

    })

  }

  //从redis中获取偏移量信息

  def getOffset(groupid: String, topic: String): mutable.Map[TopicPartition, Long] = {

    val offset = mutable.Map [TopicPartition, Long]()

    //tp._1  topic+partition   tp._2  offset

    import scala.collection.JavaConversions._

    val jedis = Jpoods.getJedis ()

    //导入转换list隐士转换

    val map: util.Map[String, String] = jedis.hgetAll ( groupid )

    val list = map.toList

    for (o <- list) {

      offset += new TopicPartition ( o._1.split ( ":" )(  ), o._1.split ( ":" )(  ).toInt ) -> o._2.toLong

    }

    offset

  }

}

Jpoods.scala

package day15

import org.apache.commons.pool2.impl.GenericObjectPoolConfig

import redis.clients.jedis.{Jedis, JedisPool}

object Jpoods {

  //设置参数

  private val conf=new GenericObjectPoolConfig()

  conf.setMaxIdle()

  conf.setMaxTotal()

  //获取jedis的连接对象

  private val jpoods=new JedisPool("192.168.186.150",)

  //获取jedis对象的方法

  def getJedis():Jedis={

    val jedis=jpoods.getResource()

    jedis.select()

    jedis

  }

}

shell脚本 flum-kafka.conf

a1.sources = r1

a1.channels = c1

#定义source

a1.sources.r1.type = TAILDIR

a1.sources.r1.positionFile = /usr/local/apache-flume-1.8.-bin/taildir_position.json

a1.sources.r1.filegroups = f1

a1.sources.r1.filegroups.f1 = /root/myde/logs/access.log

#定义channel

a1.channels.c1.type = org.apache.flume.channel.kafka.KafkaChannel

a1.channels.c1.kafka.bootstrap.servers = hadoop01:,hadoop02:,hadoop03:

a1.channels.c1.kafka.topic = ip01

a1.channels.c1.parseAsFlumeEvent = false

#将Source和channle组装在一起

a1.sources.r1.channels = c1

flum到kafka 收集数据存储到redis 案例（ip.txt）的更多相关文章

Spring Boot 揭秘与实战（二）数据存储篇 - Redis
文章目录 1. 环境依赖 2. 数据源 2.1. 方案一使用 Spring Boot 默认配置 2.2. 方案二手动创建 3. 使用 redisTemplate 操作4. 总结 3.1. 工具类 ...
Java基础知识强化之IO流笔记45：IO流练习之把集合中的数据存储到文本文件案例
1. 把集合中的数据存储到文本文件案例: 需求:把ArrayList集合中的字符串数据存储到文本文件 ? (1)分析:通过题目的意思我们可以知道如下的一些内容,ArrayList集合里存储的是字 ...
Python 抓取数据存储到Redis中
redis是一个key-value存储结构.和Memcached类似,它支持存储的value类型相对更多,包括string(字符串).list(链表).set(集合).zset(sorted set ...
redis使用日志（二）数据存储到redis
一段简短的代码,来展示如何把爬取内容写到redis里面: #! /usr/bin/env python # -*- coding=utf-8 -*- import requests import js ...
ELK+Redis+Nginx服务数据存储以及Nginx日志的收集
PS:此片文章是承接上篇ELK部署文档,再次便不详细说明了 [安装Redis] [root@Redis ~]# wget http://download.redis.io/releases/redi ...
Spark Streaming消费Kafka Direct保存offset到Redis，实现数据零丢失和exactly once
一.概述上次写这篇文章文章的时候,Spark还是1.x,kafka还是0.8x版本,转眼间spark到了2.x,kafka也到了2.x,存储offset的方式也发生了改变,笔者根据上篇文章和网上文章 ...
Kafka session.timeout.ms heartbeat.interval.ms参数的区别以及对数据存储的一些思考
Kafka session.timeout.ms heartbeat.interval.ms参数的区别以及对数据存储的一些思考在计算机世界中经常需要与数据打交道,这也是我们戏称CURD工程师的原因之 ...
大数据学习day31------spark11-------1. Redis的安装和启动，2 redis客户端 3.Redis的数据类型 4. kafka（安装和常用命令）5.kafka java客户端
1. Redis Redis是目前一个非常优秀的key-value存储系统(内存的NoSQL数据库).和Memcached类似,它支持存储的value类型相对更多,包括string(字符串).list ...
解决KafKa数据存储与顺序一致性保证
“严格的顺序消费”有多么困难下面就从3个方面来分析一下,对于一个消息中间件来说,”严格的顺序消费”有多么困难,或者说不可能. 发送端发送端不能异步发送,异步发送在发送失败的情况下,就没办法保证消息 ...

随机推荐

CentOS下nagios报警飞信部署四步走
CentOS下nagios报警飞信部署四步走今天帮群里一兄弟配了下nagios上的飞信,这个东西我个人感觉还是很实用的,不过好久没配了,今天配置了一遍,顺便就把过程记录下来了,供大家学习! ...
thinkphp5权限仿制
权限列表流程 thinkphp5封装好的权限模块 RBAC还有auth and then .......管理员表,可以依据auth.php搭建所有的权限表
Nowcoder Monotonic Matrix ( Lindström–Gessel–Viennot lemma 定理 )
题目链接题意 : 在一个 n * m 的矩阵中放置 {0, 1, 2} 这三个数字.要求每个元素 A(i, j) <= A(i+1, j) && A(i, j) <= ...
[CF1172E]Nauuo and ODT：Link-Cut Tree
分析 lxl大毒瘤. 感谢Ouuan等CNOIER提供了这么好的比赛. 这里只是把官方题解复述一遍,可以直接去看官方题解:点我. 考虑将问题转化为对于每个颜色,求出没有经过这个颜色的节点的路径有多少条 ...
[洛谷P1501] [国家集训队]Tree II（LCT模板）
传送门这是一道LCT的板子题,说白了就是在LCT上支持线段树2的操作. 所以我只是来存一个板子,并不会讲什么(再说我也不会,只能误人子弟2333). 不过代码里的注释可以参考一下. Code #in ...
[JZO6401]:Time（贪心+树状数组）
题目描述小$A$现在有一个长度为$n$的序列$\{x_i\}$,但是小$A$认为这个序列不够优美. 小$A$认为一个序列是优美的,当且仅当存在$k\in [1,n]$,满足:$$x_1\leqsla ...
java知识查漏补缺
一.重写(override)和重载(overload)的区别二者除了名字相似,其实没什么联系范围不同:重载发生在同一个类的不同方法之间.重写发生在父类和子类自荐. 前提: 重载要求:方法名相同,参 ...
C++入门经典-例3.15-使用do-while循环计算1到10的累加
1:代码如下: // 3.15.cpp : 定义控制台应用程序的入口点. // #include "stdafx.h" #include <iostream> usin ...
IDEA 无法显示项目目录结构解决
不要去网上看什么乱七八糟的骚教程,一点用都没有.直接按下列步骤操作: 1. 关闭IDEA, 2. 然后删除项目文件夹下的.idea文件夹3. 重新用IDEA工具打开项目
【转】Diamond -- 分布式配置中心
特别提示:本人博客部分有参考网络其他博客,但均是本人亲手编写过并验证通过.如发现博客有错误,请及时提出以免误导其他人,谢谢!欢迎转载,但记得标明文章出处:http://www.cnblogs.com/ ...

flum到kafka 收集数据 存储到redis 案例 （ip.txt）

flum到kafka 收集数据 存储到redis 案例 （ip.txt）的更多相关文章

随机推荐

热门专题

flum到kafka 收集数据存储到redis 案例（ip.txt）

flum到kafka 收集数据存储到redis 案例（ip.txt）的更多相关文章