布隆过滤器(BloomFilter)持久化

摘要

Bloomfilter运行在一台机器的内存上，不方便持久化（机器down掉就什么都没啦），也不方便分布式程序的统一去重。我们可以将数据进行持久化，这样就克服了down机的问题，常见的持久化方法包括持久化到本地磁盘或结合Redis进行持久化。本文主要介绍持久化到本地的操作。

关于BloomFilter的基本原理、jar包及入门Demo，请参考我的博客：布隆过滤器

数据持久化

import java.io.File;

import java.io.FileNotFoundException;

import java.io.FileOutputStream;

import java.io.IOException;

import java.io.OutputStream;

import com.google.common.hash.BloomFilter;

import com.google.common.hash.Funnels;

public class Demo1 {

	public static void main(String[] args) throws FileNotFoundException {

		BloomFilter<Integer> filter = BloomFilter.create(

				  Funnels.integerFunnel(),

				  500,

				  0.01);

		//导入数据到filter

		for(int i = 0; i < 100; i++ )

		{

			filter.put(i);

		}

		//数据持久化到本地

		File f= new File("d:" + File.separator + "test2");

		OutputStream out = null;

		out = new FileOutputStream(f);    

		try {

			filter.writeTo(out);

		} catch (IOException e) {

			// TODO Auto-generated catch block

			e.printStackTrace();

		}

		//测试验证

		for(int i = 0 ; i < 10; i++)

		{

			boolean result = filter.mightContain(i);

			if(result)

			{

				System.out.println("i = " + i + " " + result);

			}

		}

	}

}

读取持久化数据

import java.io.File;

import java.io.FileInputStream;

import java.io.FileNotFoundException;

import java.io.IOException;

import java.io.InputStream;

import com.google.common.hash.BloomFilter;

import com.google.common.hash.Funnels;

public class Demo2 {

	public static void main(String[] args) throws FileNotFoundException {

		BloomFilter<Integer> filter = BloomFilter.create(

				  Funnels.integerFunnel(),

				  500,

				  0.01);

		//将之前持久化的数据加载到Filter

		File f= new File("d:" + File.separator + "test2") ;

		InputStream in = null;

		in = new FileInputStream(f);

		try {

			filter = BloomFilter.readFrom(in,Funnels.integerFunnel());

		} catch (IOException e) {

			e.printStackTrace();

		}

		//测试验证

		for(int i = 0 ; i < 10; i++)

		{

			boolean result = filter.mightContain(i);

			if(result)

			{

				System.out.println("i = " + i + " " + result);

			}

		}

	}

}

Demo说明

Demo1：初始化filter对象，并导入测试数据，然后结合writeTo()方法将数据持久化到本地磁盘；

Demo1：初始化filter对象，读取Demo1持久化到磁盘的数据，然后将数据导入到filter；

测试验证：Demo1和Demo2都对创建后的filter进行了测试验证。

布隆过滤器(BloomFilter)持久化的更多相关文章

Spark布隆过滤器(bloomFilter)
数据过滤在很多场景都会应用到,特别是在大数据环境下.在数据量很大的场景实现过滤或者全局去重,需要存储的数据量和计算代价是非常庞大的.很多小伙伴第一念头肯定会想到布隆过滤器,有一定的精度损失,但是存储性 ...
HBase之八--(3)：Hbase 布隆过滤器BloomFilter介绍
布隆过滤器( Bloom filters) 数据块索引提供了一个有效的方法,在访问一个特定的行时用来查找应该读取的HFile的数据块.但是它的效用是有限的.HFile数据块的默认大小是64KB,这个大 ...
白话布隆过滤器BloomFilter
通过本文将了解到以下内容: 查找问题的一般思路布隆过滤器的基本原理布隆过滤器的典型应用布隆过滤器的工程实现场景说明: 本文阐述的场景均为普通单机服务器.并非分布式大数据平台,因为在大数据平台下 ...
【浅析】|白话布隆过滤器BloomFilter
通过本文将了解到以下内容: 查找问题的一般思路布隆过滤器的基本原理布隆过滤器的典型应用布隆过滤器的工程实现场景说明: 本文阐述的场景均为普通单机服务器.并非分布式大数据平台,因为在大数据平台下 ...
Hbase 布隆过滤器BloomFilter介绍
转载自:http://blog.csdn.net/opensure/article/details/46453681 1.主要功能提高随机读的性能 2.存储开销 bloom filter的数据存在S ...
海量数据处理之布隆过滤器BloomFilter算法
Bloom Filter是由Bloom在1970年提出的一种多哈希函数映射的快速查找算法.通常应用在一些需要快速判断某个元素是否属于集合,但是并不严格要求100%正确的场合.使用场景:数据量为100亿 ...
SpringBoot(18）---通过Lua脚本批量插入数据到Redis布隆过滤器
通过Lua脚本批量插入数据到布隆过滤器有关布隆过滤器的原理之前写过一篇博客: 算法(3)---布隆过滤器原理在实际开发过程中经常会做的一步操作,就是判断当前的key是否存在. 那这篇博客主要分为三 ...
guava布隆过滤器
pom引入依赖 <dependency> <groupId>com.google.guava</groupId> <artifactId>guava&l ...
浅谈布隆过滤器Bloom Filter
先从一道面试题开始: 给A,B两个文件,各存放50亿条URL,每条URL占用64字节,内存限制是4G,让你找出A,B文件共同的URL. 这个问题的本质在于判断一个元素是否在一个集合中.哈希表以O(1) ...

随机推荐

WPF Binding学习(二)
Binding作为数据的桥梁,连通业务逻辑层的对象(源对象)和UI的控件对象(目标对象).在这座桥梁上,我们不仅可以控制在源对象与目标对象是双向通行还是单向通行.还可以控制数据的放行时机,甚至可以在这 ...
Jfinal控制器源码解读
本文对Jfinal的控制器源码做以下分析. PS:控制器是所有请求跳转的基础,本文就Jfinal控制器的继承关系及初始化的方法做出解释说明. 啰嗦下:所有的请求和响应都是都是通过web容器封装,我们主 ...
用户空间网络提升 NFV 的性能
本文是一篇翻译,翻译自https://software.intel.com/en-us/blogs/2015/06/12/user-space-networking-fuels-nfv-perform ...
JavaScript判断对象类型及节点类型、节点名称和节点值
一.JavaScript判断对象类型 1.可以使用typeof函数判断对象类型 function checkObject1(){ var str="str"; console.lo ...
HDU 1159 Common Subsequence【dp+最长公共子序列】
Common Subsequence Time Limit: 2000/1000 MS (Java/Others) Memory Limit: 65536/32768 K (Java/Other ...
树状数组-HDU1541-Stars一维树状数组 POJ1195-Mobile phones-二维树状数组
树状数组,学长很早之前讲过,最近才重视起来,enmmmm... 树状数组(Binary Indexed Tree(B.I.T), Fenwick Tree)是一个查询和修改复杂度都为log(n)的数据 ...
CodeForces776-A.Serial Killer-string
A Serial Killer time limit per test 2 seconds memory limit per test 256 megabytes input standard inp ...
Victor and World（spfa+状态压缩dp)
题目连接:http://acm.hdu.edu.cn/showproblem.php?pid=5418 Victor and World Time Limit: 4000/2000 MS (Java/ ...
Legal or Not(拓扑排序判环)
http://acm.hdu.edu.cn/showproblem.php?pid=3342 Legal or Not Time Limit: 2000/1000 MS (Java/Others) ...
android 2048游戏、kotlin应用、跑马灯、动画源码
Android精选源码 2048游戏源码 android实现获取号码归属地和其他信息诈骗.骚扰 android kotlin仿开眼app源码 android多种reveal动画效果 android K ...

布隆过滤器(BloomFilter)持久化

摘要

数据持久化

读取持久化数据

Demo说明

更多参考

布隆过滤器(BloomFilter)持久化的更多相关文章

随机推荐

热门专题