结合最近Disruptor的学习，和之前一直思考解决的大文件拆分问题，想到是否可以使用Disruptor作为生产者/消费者传递数据的通道呢？借助其高效的传递，理论上应当可以提升性能。此文便是此想法的落地实现。

问题描述

将大文件按照指定大小拆分为若干小文件。具体可参考：大文件拆分方案的java实践（附源码）。

方案设计

设计简图

如下：

核心组件

FileReadTask —— Disruptor的生产者线程，负责读取源文件，；
Disruptor —— FileReadTask和FileLineEventHandler线程之间传递数据的通道，无阻塞；
RingBuffer —— Disruptor的核心组件，负责暂存被传递的消息，同时负责协调生产者和消费者之间的工作节奏；
FileLineEventHandler —— 不断从Disruptor中读取FileLine，并直接扔给FileWriteTask的queue，是Disruptor的消费者，同时也是queue的生产者；
FileWriteTask —— 从queue中读取FileLine，并写入到子文件，是queue的消费者。

设计思路

使用Disruptor作为生产者和消费者之间传递数据的通道，利用Disruptor高效传递数据的特性提升性能；

FileLineEventHandler作为Disruptor的消费者，只负责从中读取数据，但是不负责耗时长的子文件操作；

FIleWriteTask服务耗时长的文件写入工作，且每个task独享queue，减少资源竞争。

性能表现

实测下来，和之前的‘生产者/消费者+nio’方案性能相当，最佳性能点为：

方案	-Xms	-Xmx	readTaskNum	writeTaskNum	queueSize	Durition (ms)	jvm_ CPU(%)	jvm_ mem	Physics _mem
生产者/消费者+nio	512m	512m	24	8	4096	8158	80	100M	4.6G
Disruptor+生产者/消费者+nio	512m	512m	2	2	1024	6191	80	500m	4.2G

相对与不使用Disruptor的方案，时延有所下降，但是并不明显，两个方案主要瓶颈都在于FileReadTask中对文件进行拆分的逻辑处理太费时，需要逐个字节读取并比对是否为换行符/回车符。所以性能提升并不是很明显。且性能表现并不稳定。

心得

这个示例或许没有达到想要的效果，但是通过这个实例，将Disruptor用到了生产者和消费者模式中，体会Disruptor的设计初衷，提升生产者与消费者之间数据传递的效率，尤其是在纯粹地快速交换数据的场景非常有用。

Disruptor持有的entry对象不宜直接传递给后续消费者使用，鉴于Disruptor会对RingBuffer的entries做内存预加载，且会循环使用对应entries，所以如果供消费者直接使用，会出现数据覆盖的问题。可以参考实例代码中FileLineEventHandler对写入queue的FileLine的处理。

代码示例

github地址：https://github.com/daoqidelv/filespilt-demo

包路径：com.daoqidlv.filespilt.disruptor

Disruptor的应用示例——大文件拆分的更多相关文章

大文件拆分问题的java实践（附源码）
引子大文件拆分问题涉及到io处理.并发编程.生产者/消费者模式的理解,是一个很好的综合应用场景,为此,花点时间做一些实践,对相关的知识做一次梳理和集成,总结一些共性的处理方案和思路,以供后续工作中借 ...
大文件拆分方案的java实践（附源码）
引子大文件拆分问题涉及到io处理.并发编程.生产者/消费者模式的理解,是一个很好的综合应用场景,为此,花点时间做一些实践,对相关的知识做一次梳理和集成,总结一些共性的处理方案和思路,以供后续工作中借 ...
Java:大文件拆分工具
java大文件拆分工具(过滤掉表头) import java.io.BufferedReader; import java.io.BufferedWriter; import java.io.File ...
elasticsearch bulk批量导入大文件拆分
命令如下: curl -s -XPOST http://localhost:9200/_bulk --data-binary @data.json 如果上传的data.json文件较大,可以将其切分为 ...
RedHat/CentOS 大文件拆分及合并与md5验证
[root@tdh55 mnt]# cd /opt/[root@tdh55 opt]# ll -h-rw-r--r--. 1 root root 7.5G May 12 11:19 TDH-Image ...
python 小程序大文件的拆分合并
1. 将大文件拆分为小文件 I 通过二进制的方式将大文件读取出来,将其拆分存,以不同的文件方式存放在一个目录下面 II 提供两种操作方式交互式和命令行模式 #! usr/bin/python # -* ...
高效读取大文件，再也不用担心 OOM 了！
内存读取第一个版本,采用内存读取的方式,所有的数据首先读读取到内存中,程序代码如下: Stopwatch stopwatch = Stopwatch.createStarted(); // 将全部行 ...
PHP读取CSV大文件导入数据库的示例
对于数百万条数据量的CSV文件,文件大小可能达到数百M,如果简单读取的话很可能出现超时或者卡死的现象. 为了成功将CSV文件里的数据导入数据库,分批处理是非常必要的. 下面这个函数是读取CSV文件中指 ...
php平均拆分大文件为N个小文件
用PHP程序拆分大文件为N个小文件 /* 假设有文件data.log , 内容如下,行数很多,假设有上亿条数据,文件大小大概在800M左右 92735290 80334472 49114074 871 ...

随机推荐

使用IDEA部署Myeclipse项目
IDEA的下载和FREE注册 IDEA 下载地址:IDEA最新版本下载地址 IDEA 注册方法:注册方法导入Myeclipse项目 IDEA主界面,选择Open,如下图所示选择Myeclipse项 ...
.Net程序员学用Oracle系列(8)：触发器、作业、序列、连接
1.触发器 2.作业 2.1.作业调度功能和应用 2.2.通过 DBMS_JOB 来调度作业 3.序列 3.1.创建序列 3.2.使用序列 & 删除序列 4.连接 4.1.创建连接 4.2.使 ...
java 上传1（使用java组件fileupload）
使用fileupload要添加以下包
Lua学习(5)——迭代器与泛型for
1. 迭代器 2. 泛型for语义所谓迭代器就是一种可以遍历一种集合中所有元素的机制.在lua中,迭代器通常表示为函数,每调用依次函数就返回集合中的下一个元素.泛型for 内部保存了迭代器函数实际 ...
使用Charles Proxy提升iOS开发效率
以前做前端开发的时候,使用最多的工具就是 Fiddler ,用来定位问题.模拟特定场景非常方便,极大提升了开发效率.而转做 iOS 开发以后,一大头疼的问题是 Fiddler 没有 Mac 版,幸亏找 ...
深入解析java String中getBytes()的编码问题
转载请注明出处:http://www.cnblogs.com/Joanna-Yan/p/6900536.html Java服务器后台在和Android端App通信时,遇到了两端关于用MD5加密同一包含 ...
jmeter 环境部署、数据库设置、分布式设置、多网卡配置等随笔
[root@web-249 ~]# env|grep LANGLANG=zh_CN.UTF-8[root@web-249 ~]# ...
iphone手机中对于html和css的一些特殊处理
1.iphone safari iso系统不兼容:hover的解决办法: 方法一: a:hover设置的样式在IOS系统的浏览器内显示不出来,看来是IOS系统的移动设备中,需要在按钮元素或者是body ...
Git基础-打标签
打标签同大多数 VCS 一样,Git 也可以对某一时间点上的版本打上标签.人们在发布某个软件版本(比如 v1.0 等等)的时候,经常这么做.本节我们一起来学习如何列出所有可用的标签,如何新建标签,以 ...
[HDU1020] Encoding - 加密
Problem Description Given a string containing only 'A' - 'Z', we could encode it using the following ...

Disruptor的应用示例——大文件拆分