sparkStreaming复习笔记(1)

一、SparkStreaming

　　1.sparkcore模块的扩展，具有可扩展，高吞吐量，容错机制，针对实时数据流处理，数据可以来自于kafka,flume以及tcp套接字，可以使用更加复杂的函数来进行处理

　　　　如map reduce 和filter。数据可以推送到hdfs,mysql，针对数据流可以应用到机器学习以及图计算中

　　2.在内部，spark接收实时数据流，分成小批次，所以spark不是实时计算，是小批次计算，由spark引擎来进行处理，最终在每个批次中产生结果数据流。按照时间来划分批次。

　　　　计算完成之后就变成一小块的数据。sparkstreaming提供了一个高级的抽象称为discretized stream or DStream,离散流，代表的是连续的数据流。通过kafka或者flue实时输入数据流产生，也可以通过其他的DStream进行高阶变换产生。在内部，DStream也表现为RDD流。

　　　3.体验sparkstreaming

　　　　(1)spark api编程

from pyspark import SparkContext

from pyspark.streaming import StreamingContext

# Create a local StreamingContext with two working thread and batch interval of  second

sc = SparkContext("local[2]", "NetworkWordCount") #创建一个sparkStreaming上下文对象，local要大于1

ssc = StreamingContext(sc, )#指定一个上下文对象

# Create a DStream that will connect to hostname:port, like localhost:9999与主机创建连接，localhost是9999

lines = ssc.socketTextStream("localhost", 9999)

# Split each line into words，把每一个流切换成一个单词

words = lines.flatMap(lambda line: line.split(" "))

# Count each word in each batch，计算在队列中的每一个单词，变换成对偶

pairs = words.map(lambda word: (word, 1))

wordCounts = pairs.reduceByKey(lambda x, y: x + y)

# Print the first ten elements of each RDD generated in this DStream to the console，在控制台上打印10个元素

wordCounts.pprint()

ssc.start()             # Start the computation开始计算

ssc.awaitTermination()  # Wait for the computation to terminate,等待计算结束

　　(2)启动nc服务器

　　　　nc -Ll -p 9999

sparkStreaming复习笔记(1)的更多相关文章

Java基础复习笔记系列九网络编程
Java基础复习笔记系列之网络编程学习资料参考: 1.http://www.icoolxue.com/ 2. 1.网络编程的基础概念. TCP/IP协议:Socket编程:IP地址. 中国和美国之 ...
Java基础复习笔记系列八多线程编程
Java基础复习笔记系列之多线程编程参考地址: http://blog.csdn.net/xuweilinjijis/article/details/8878649 今天的故事,让我们从上面这个图 ...
Java基础复习笔记系列七 IO操作
Java基础复习笔记系列之 IO操作我们说的出入,都是站在程序的角度来说的.FileInputStream是读入数据.?????? 1.流是什么东西? 这章的理解的关键是:形象思维.一个管道插入了一 ...
Java基础复习笔记系列五常用类
Java基础复习笔记系列之常用类 1.String类介绍. 首先看类所属的包:java.lang.String类. 再看它的构造方法: 2. String s1 = “hello”: String ...
Java基础复习笔记系列四数组
Java基础复习笔记系列之数组 1.数组初步介绍? Java中的数组是引用类型,不可以直接分配在栈上.不同于C(在Java中,除了基础数据类型外,所有的类型都是引用类型.) Java中的数组在申明时 ...
Java基础复习笔记基本排序算法
Java基础复习笔记基本排序算法 1. 排序排序是一个历来都是很多算法家热衷的领域,到现在还有很多数学家兼计算机专家还在研究.而排序是计算机程序开发中常用的一种操作.为何需要排序呢.我们在所有的系统 ...
Angular复习笔记7-路由（下）
Angular复习笔记7-路由(下) 这是angular路由的第二篇,也是最后一篇.继续上一章的内容路由跳转 Web应用中的页面跳转,指的是应用响应某个事件,从一个页面跳转到另一个页面的行为.对于使 ...
Angular复习笔记7-路由（上）
Angular复习笔记7-路由(上) 关于Angular路由的部分将分为上下两篇来介绍.这是第一篇. 概述路由所要解决的核心问题是通过建立URL和页面的对应关系,使得不同的页面可以用不同的URL来表 ...
Angular复习笔记6-依赖注入
Angular复习笔记6-依赖注入依赖注入(DependencyInjection)是Angular实现重要功能的一种设计模式.一个大型应用的开发通常会涉及很多组件和服务,这些组件和服务之间有着错综 ...

随机推荐

HDU2602 Bone Collector（01背包）
HDU2602 Bone Collector 01背包模板题 #include<stdio.h> #include<math.h> #include<string.h&g ...
内存地址 Memory Management
Memory Management https://docs.python.org/2/c-api/memory.html Memory management in Python involves a ...
awk调用系统命令
cmd = ("the linux command") cmd | getline dk; close(cmd) dk stores the output of the comma ...
2014 ECML: Covariate-correlated lasso for feature selection (ccLasso)
今天看了一篇 ECML 14 的文章(如题),记录一下. 原文链接:http://link.springer.com/chapter/10.1007/978-3-662-44848-9_38 这篇文章 ...
Redis安装启动，Redis Desktop Manager安装
Window 下安装下载地址:https://github.com/MSOpenTech/redis/releases.Redis 支持 32 位和 64 位.这个需要根据你系统平台的实际情况选择,这 ...
error: exportArchive: You don’t have permission to save the file “HelloWorld.ipa” in the folder “HelloWorld”.
成功clean环境和生成archive文件之后,最后一步导出ipa包,遇到了权限问题: you don’t have permission to save the file “HelloWorld.i ...
Java 八大基本数据类型
相关信息获取: (1)最小值:包装类.MIN_VALUE,如 Integer.MIN_VALUE (2)最大值:包装类.MAX_VALUE,如 Integer.MAX_VALUE (3)二进制位数:包 ...
阶段1 语言基础+高级_1-3-Java语言高级_1-常用API_1_第1节 Scanner类_3-Scanner的使用步骤
Scanner如何进行键盘输入,引用类型就包含了Scanner,它就是引用类型,所以也有这三个步骤, 导包.创建.使用先通过api文档找到它.左边输入要查找scanner.双夹scanner右边就会 ...
centos 6.5 升级openssh-7.5
1.环境 2.安装telnet 服务,防止ssh升级之后登陆不上服务器,使用telnet 连接服务器 yum install telnet-server -y chkconfig telnet on ...
vue组件父子间通信02
三.组件间通信($parent $refs) 父组件要想获取子组件的数据:①在调用子组件的时候,指定ref属性<child-component ref="mySon"> ...

sparkStreaming复习笔记(1)

一、SparkStreaming

sparkStreaming复习笔记(1)的更多相关文章

随机推荐

热门专题