Spark TempView和GlobalTempView的区别

TempView和GlobalTempView在spark的Dataframe中经常使用，两者的区别和应用场景有什么不同。

我们以下面的例子比较下两者的不同。

from pyspark.sql import SparkSession

import numpy as np

import pandas as pd

spark = SparkSession.builder.getOrCreate()

d = np.random.randint(1,100, 5*5).reshape(5,-1)

data = pd.DataFrame(d, columns=list('abcde'))

df = spark.createDataFrame(data)

df.show()

+---+---+---+---+---+

|  a|  b|  c|  d|  e|

+---+---+---+---+---+

| 17| 30| 61| 61| 33|

| 32| 23| 24|  7|  7|

| 47|  6|  4| 95| 34|

| 50| 69| 83| 21| 46|

| 52| 12| 83| 49| 85|

+---+---+---+---+---+

从tempview中取数据

temp = df.createTempView('temp')

temp_sql = "select * from temp where a=50"

res = spark.sql(temp_sql)

res.show()

+---+---+---+---+---+

|  a|  b|  c|  d|  e|

+---+---+---+---+---+

| 50| 69| 83| 21| 46|

+---+---+---+---+---+

从globaltempview中取数据

glob = df.createGlobalTempView('glob')

glob_sql = "select * from global_temp.glob where a = 17"

res2 = spark.sql(glob_sql)

res2.show()

+---+---+---+---+---+

|  a|  b|  c|  d|  e|

+---+---+---+---+---+

| 17| 30| 61| 61| 33|

+---+---+---+---+---+

Globaltempview 数据可以在多个sparkSession中共享

# 创建新的sparkSession

spark2 = spark.newSession()

spark2 == spark

False

# 新的sparkSession可以获取globaltempview中的数据

new_sql = "select * from global_temp.glob where a = 47"

temp = spark2.sql(new_sql)

temp.show()

+---+---+---+---+---+

|  a|  b|  c|  d|  e|

+---+---+---+---+---+

| 47|  6|  4| 95| 34|

+---+---+---+---+---+

# 新的sparkSession无法获取tempview中的数据

# 会提示找不到temp表

new_sql2 = "select * from temp where a = 47"

temp = spark2.sql(new_sql2)

temp.show()

# 使用global_temp前缀也不行

new_sql2 = "select * from global_temp.temp where a = 47"

temp = spark2.sql(new_sql2)

temp.show()

---------------------------------------------------------------------------

Py4JJavaError                             Traceback (most recent call last)

# 此处多行删除异常信息

AnalysisException: "Table or view not found: `global_temp`.`temp`; line 1 pos 14;\n'Project [*]\n+- 'Filter ('a = 47)\n   +- 'UnresolvedRelation `global_temp`.`temp`\n"

tempview删除后无法使用

spark.catalog.dropTempView('temp')

spark.catalog.dropGlobalTempView('glob')

# 报错，找不到table temp

temp_sql2 = "select * from temp where a = 47"

temp = spark.sql(temp_sql2)

# 报错，找不到global_temp.glob，spark和spark2中均报错

glob_sql2 = "select * from global_temp.glob where a = 47"

temp = spark.sql(glob_sql2)

temp = spark2.sql(glob_sql2)

总结

spark中有四个tempview方法

df.createGlobalTempView
df.createOrReplaceGlobalTempView
df.createOrReplaceTempView
df.createTempView

replace方法：不存在则直接创建，存在则替换

tempview删除后无法使用

两个删除方法

spark.catalog.dropTempView('temp')

spark.catalog.dropGlobalTempView('glob')

TempView和GlobalTempView的异同

tempview只能在一个sparkSession中使用
GlobaltempView可以在多个sparkSession中共享使用
但是他们都不能跨Application使用

Spark TempView和GlobalTempView的区别的更多相关文章

spark中map与mapPartitions区别
在spark中,map与mapPartitions两个函数都是比较常用,这里使用代码来解释一下两者区别 import org.apache.spark.{SparkConf, SparkContext ...
[Spark RDD_add_1] groupByKey & reduceBykey 的区别
[groupByKey & reduceBykey 的区别] 在都能实现相同功能的情况下优先使用 reduceBykey Combine 是为了减少网络负载 1. groupByKey 是没有 ...
spark 的createDstream和createDirectStream区别
spark读取kafka数据流提供了两种方式createDstream和createDirectStream. 两者区别如下: 1.KafkaUtils.createDstream 构造函数为Kafk ...
MR的shuffle和Spark的shuffle之间的区别
mr的shuffle mapShuffle 数据存到hdfs中是以块进行存储的,每一个块对应一个分片,maptask就是从分片中获取数据的在某个节点上启动了map Task,map Task读取是通 ...
spark的flatMap和map区别
map()是将函数用于RDD中的每个元素,将返回值构成新的RDD. flatmap()是将函数应用于RDD中的每个元素,将返回的迭代器的所有内容构成新的RDD,这样就得到了一个由各列表中的元素组成的R ...
spark coalesce和repartition的区别和使用场景
区别: repartition底层调用的是coalesce方法,默认shuffle def repartition(numPartitions: Int)(implicit ord: Ordering ...
spark map和mapPartitions的区别
package dayo1 import org.apache.spark.{SparkConf, SparkContext} import scala.collection.mutable.Arra ...
spark:reducebykey与groupbykey的区别
从源码看: reduceBykey与groupbykey: 都调用函数combineByKeyWithClassTag[V]((v: V) => v, func, func, partition ...
zhihu spark集群,书籍,论文
spark集群中的节点可以只处理自身独立数据库里的数据,然后汇总吗? 修改我将spark搭建在两台机器上,其中一台既是master又是slave,另一台是slave,两台机器上均装有独立的mongo ...

随机推荐

java实现第四届蓝桥杯大臣的旅费
大臣的旅费题目描述很久以前,T王国空前繁荣.为了更好地管理国家,王国修建了大量的快速路,用于连接首都和王国内的各大城市. 为节省经费,T国的大臣们经过思考,制定了一套优秀的修建方案,使得任何一个大 ...
OC语言－NSMutableArray为什么要用strong来修饰
Talk is cheap show you my code! NSMutableArray属性为什么要用strong来修饰,其实就是一个深复制和浅复制的问题. <pre name=" ...
Error:org.gradle.api.internal.tasks.DefaultTaskInputs$TaskInputUnionFileCollection cannot be cast to...异常处理
这个是打开Android Studio项目报的错误提示,单纯从上面的提示还是不能太直接的知道什么问题.后来我想这个项目的Gradle版本与我当前AS使用的版本不一致,可能是这个问题. 修改build. ...
如何在python列表中查找某个元素的索引
如何在python列表中查找某个元素的索引 2019-03-15 百度上回复别人的问题,几种方式的回答: 1) print('*'*15,'想找出里面有重复数据的索引值','*'*15) listA ...
Redis在CentOS for LInux上安装详细教程
1.首先上传安装包,这里我以 redis-5.0.8.tar.gz 为例子. Linux下载redis地址:wget http://download.redis.io/releases/redis-5 ...
cb29a_c++_STL_算法_查找算法_(2)search_n
cb29a_c++_STL_算法_查找算法_(2)search_n//比如:连续查找连续的n个8search_n(b,e,c,v),迭代器b,begin(),e,end().连续的c个vpos=sea ...
Windows下6款实用软件（强烈推荐！）
Windows下6款实用软件 1.notepads Notepads作为一款编辑器,美观.轻量,功能强大,支持多标签页.Markdown.日常文本编辑.查看,Notepads轻松胜任,如果厌烦了Win ...
Java操作RockeMQ
RocketMQ是阿里巴巴在2012年开源的分布式消息中间件,目前已经捐赠给Apache基金会,已经于2016年11月成为 Apache 孵化项目,相信RocketMQ的未来会发挥着越来越大的作用,将 ...
Kali中密码暴力破解工具hydra的使用
前言 hydra是著名黑客组织thc的一款开源的暴力破解密码工具,功能非常强大,kali下是默认安装的,几乎支持所有协议的在线破解.密码能否破解,在于字典是否强大.本文仅从安全角度去讲解工具的使用,请 ...
马士兵老师Java虚拟机调优
该视频主要讲解的内容如下所示: 1.虚拟机的内存结构 1.每一个线程都有一个虚拟机栈,线程中每调用一个方法都会开启一个栈帧,栈帧里面保存方法中的局部变量. 2.方法区在java8以后改名为永久区域pe ...

Spark TempView和GlobalTempView的区别

Spark TempView和GlobalTempView的区别

从tempview中取数据

从globaltempview中取数据

Globaltempview 数据可以在多个sparkSession中共享

tempview删除后无法使用

总结

Spark TempView和GlobalTempView的区别的更多相关文章

随机推荐

热门专题