Spark缓存策略

当对同一个rdd多次执行action时，如果在磁盘上则每次执行action都会从磁盘将数据加载，如果将其缓存到内存中会提高再次action的读取速度，Spark缓存主要有cache()和persist()两种，当缓存一个rdd时，每一个节点上都会存放这个rdd的partition，当要使用rdd的时候可以直接从内存读出。

cache源码：

def cache(self):

        """

        Persist this RDD with the default storage level (C{MEMORY_ONLY}).

        """

        self.is_cached = True

        self.persist(StorageLevel.MEMORY_ONLY)

        return self

从源码可以看出，cache底层调用的是persist方法，传入的参数是：StorageLevel.MEMORY_ONLY，再看persist()方法：

def persist(self, storageLevel=StorageLevel.MEMORY_ONLY):

        self.is_cached = True

        javaStorageLevel = self.ctx._getJavaStorageLevel(storageLevel)

        self._jrdd.persist(javaStorageLevel)

        return self

persist方法，传入的参数是StorageLevel，从StorageLevel的源码可以看出它的值总共有6种，因此persist()相比cache()在缓存形式上更为丰富，不仅支持内存的方式，还支持内存和磁盘、内存副本等方式。

StorageLevel.DISK_ONLY = StorageLevel(True, False, False, False)

StorageLevel.DISK_ONLY_2 = StorageLevel(True, False, False, False, 2)

StorageLevel.MEMORY_ONLY = StorageLevel(False, True, False, False)

StorageLevel.MEMORY_ONLY_2 = StorageLevel(False, True, False, False, 2)

StorageLevel.MEMORY_AND_DISK = StorageLevel(True, True, False, False)

StorageLevel.MEMORY_AND_DISK_2 = StorageLevel(True, True, False, False, 2)

StorageLevel.OFF_HEAP = StorageLevel(True, True, True, False, 1)

持久化到内存和直接从磁盘读取时间对比：

import os

import time

from pyspark import SparkContext, SparkConf

conf = SparkConf()

sc = SparkContext(conf=conf)

current_dir = os.path.dirname(os.path.realpath(__file__))

file_path = "{}/name_age.txt".format(current_dir)

def cached():

    start_time = time.time()

    text_rdd = sc.textFile("file://{}".format(file_path)).cache()

    text_rdd.count()

    text_rdd.count()

    end_time = time.time()

    print("{}:{}".format("first cache", end_time - start_time))

    start1_time = time.time()

    text1_rdd = sc.textFile("file://{}".format(file_path)).cache()

    text1_rdd.count()

    text1_rdd.count()

    end1_time = time.time()

    print("{}:{}".format("second cache", end1_time - start1_time))

def uncached():

    start_time = time.time()

    text_rdd = sc.textFile("file://{}".format(file_path))

    text_rdd.count()

    text_rdd.count()

    end_time = time.time()

    print("{}:{}".format("first uncache", end_time - start_time))

    start1_time = time.time()

    text1_rdd = sc.textFile("file://{}".format(file_path))

    text1_rdd.count()

    text1_rdd.count()

    end1_time = time.time()

    print("{}:{}".format("second uncache", end1_time - start1_time))

sc.stop()

执行cached()结果：

first cache:1.7104301452636719

second cache:0.2717571258544922

执行uncached()结果：

first uncache:1.4453039169311523

second uncache:0.49161386489868164

从执行结果可以看出，当第二次执行rdd.count()时，有cache情况下是0.2717571258544922；无cache情况下是0.49161386489868164，由于我的内存空间不足，所以不太明显，当数据量大且内存充足的时候，持久化到内存的效率会远远高于磁盘。

对pyspark有兴趣的小伙伴可以关注我的github，spark for python 持续更新

Spark缓存策略的更多相关文章

RDD缓存策略
Spark支持将数据集放置在集群的缓存中,以便于数据重用. Spark缓存策略对应的类: class StorageLevel private( private var useDisk_ : Bool ...
RDD概念、特性、缓存策略与容错
一.RDD概念与特性 1. RDD的概念 RDD(Resilient Distributed Dataset),是指弹性分布式数据集.数据集:Spark中的编程是基于RDD的,将原始数据加载到内存变成 ...
Spark持久化策略
spark持久化策略_缓存优化persist.cache都是持久化到内存缓存策略 StorageLevel_useDisk:是否使用磁盘_useMemory:是否使用内存_useOffHeap:不用堆 ...
Spark 缓存机制
Spark中的缓存机制:避免spark每次都重算RDD以及它的所有依赖,cache().persist(). checkpoint(). 1.cache():会被重复使用,但是不能太大的RDD,将其c ...
【腾讯Bugly干货分享】彻底弄懂 Http 缓存机制 - 基于缓存策略三要素分解法
本文来自于腾讯Bugly公众号(weixinBugly),未经作者同意,请勿转载,原文地址:https://mp.weixin.qq.com/s/qOMO0LIdA47j3RjhbCWUEQ 作者:李 ...
【转】理解Java Integer的缓存策略
本文将介绍 Java 中 Integer 缓存的相关知识.这是 Java 5 中引入的一个有助于节省内存.提高性能的特性.首先看一个使用 Integer 的示例代码,展示了 Integer 的缓存行为 ...
Redis的缓存策略和主键失效机制
作为缓存系统都要定期清理无效数据,就需要一个主键失效和淘汰策略. >>EXPIRE主键失效机制在Redis当中,有生存期的key被称为volatile,在创建缓存时,要为给定的key设置 ...
Web开发基本准则-55实录-缓存策略
续上篇<Web开发基本准则-55实录-Web访问安全>. Web开发基本准则-55实录-缓存策略郑昀创建于2013年2月郑昀最后更新于2013年10月26日提纲: Web访问安全 ...
腾讯QQ你的缓存策略应该改下了
缓存策略基本原则大家都怎么考虑的? 缓存好友数量这个也是醉了,这个数字好像变化频率有点低吧,ok,就算你企鹅用户量大,需要缓存,那肉肉的问一句你这更新策略也不能只管网上涨的,不管往下降的吧?难不成你是 ...

随机推荐

StringUtils常用方法+StringUtils详细介绍
StringUtils常用方法+StringUtils详细介绍 StringUtils用法+StringUtils详细介绍博文来源:http://yijianfengvip.blog.163.co ...
BZOJ 2243 染色
树链剖分+区间染色因为是一颗树不是森林,所以应该用树剖就行,但是LCT好像也能写.. 直接用线段树维护树上的节点,注意pushdown还有询问的时候要考虑区间相交的地方,也就是左孩子右边和有孩子的左 ...
hdu 2829 Lawrence(四边形不等式优化dp)
T. E. Lawrence was a controversial figure during World War I. He was a British officer who served in ...
Wannafly挑战赛23 T2游戏 SG函数
哎,被卡科技了,想了三个小时,最后还是大佬给我说是$SG$函数. $SG$函数,用起来很简单,证明呢?(不可能的,这辈子都是不可能的) $SG$定理游戏的$SG$函数就是各个子游戏的 ...
SQL随记(二)
1.purge关键字:可以清除oracle 回收站(recyclebin)中的表和索引并释放与其相关的空间,还可清空回收站,或者清除表空间中记录的已删除的部分表空间.但是purge后不能回滚和恢复. ...
1.2浅谈Spring-Spring结构
时隔很多天的我又回来....最近发展了一下自己的爱好,所以拖了很长时间. 前面我们从概念性上分析了spring的特性这里我们附上Spring框架的结构图我们简单的来说一些这个框架图我们从下往上看 ...
[物理学与PDEs]第4章习题2 反应力学方程组形式的化约 - 能量守恒方程
试证明: 利用连续性方程及动量方程, 能量守恒方程 (2. 15) 可化为 (2. 21) 的形式. 证明: 注意到 $$\beex \bea &\quad\cfrac{\p}{\p t}\s ...
DataBase vs Data Warehouse
Database https://en.wikipedia.org/wiki/Database A database is an organized collection of data.[1] A ...
js中的简单数据类型和复杂数据类型的存储
基本类型存储的是值而复杂数据类型也叫引用类型存储的是对象的地址如0x00001而在栈中存的是变量数值和函数参数堆中存的是对象和数组堆栈空间分配栈(操作系统):由操作系统自动分配释放 ,存放函数的 ...
入门嵌入式选择2440？树莓派？STM32？4412开发板？
如果了解一下当前IT和物联网发展的形势,就会发现Android工程师越来越受欢迎,相比之下单纯的Linux工程师却逊色不少,当然,Android系统的内核也是Linux的,Linux和Android作 ...

Spark缓存策略

Spark缓存策略的更多相关文章

随机推荐

热门专题