利用JAVA多线程来提高数据处理效率
肿瘤大数据挖掘中经常需要处理上百亿行的文本文件,这些文件往往高达数百GB,假如文件结构简单统一,那么用sed和awk 处理是非常方便和快速的。但有时候会遇到逻辑较为复杂的处理流程,这样我一般会用JAVA来处理。但由于JAVA是单线程的,因此对于实验室多核服务器来说,能充分有效的利用起每个核会方便不少,那么这个时候就推荐用多线程来并发(并行)处理任务,从而达到运算速度倍速的提升。
这里举一个并行计算的例子。例子比较简单,主要是对三个数进行累加,最后输出结果。我们分别用单线程和多线程来执行,其中单线程是顺序执行而多线程则同时启动三个线程来并行(服务器CPU数大于三,所以这里是并行而不是并发)执行。
首先是单线程的运行结果:
public class Nothreading
{
public static void main(String[] args)
{
long startTime = System.currentTimeMillis();
int sum_i = 0;
int sum_j = 0;
int sum_k = 0;
for(int i = 0; i < 10000; i++)
{
sum_i += 1;
/* 增加程序运行时间, 后面同理 */
for(int a = 0 ; a < 100000 ; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
for(int j = 0; j < 10000; j++)
{
sum_j += 2;
for(int a = 0 ; a < 100000 ; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
for(int k = 0; k < 10000; k++)
{
sum_k += 3;
for(int a = 0 ; a < 100000 ; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
long endTime = System.currentTimeMillis();
System.out.println(sum_i + "\t" + sum_j + "\t" + sum_k);
System.out.println("run time:"+(endTime-startTime)+"ms");
}
}
运行结果:
run time:663587ms
图片是该程序运行时的CPU资源利用状态: 可以看到仅有一个CPU的利用率达到100%.
下面是多线程:
class Count_i
{
public int sum_i = 0;
public synchronized void count()
{
for(int i = 0 ; i < 10000; i++)
{
sum_i += 1;
/* 增加运行时间 后面同理*/
for(int a = 0 ; a < 100000; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
}
} class Count_j
{
public int sum_j = 0;
public synchronized void count()
{
for(int j = 0 ; j < 10000; j++)
{
sum_j += 2;
for(int a = 0 ; a < 100000; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
}
} class Count_k
{
public int sum_k = 0;
public synchronized void count()
{
for(int k = 0 ; k < 10000; k++)
{
sum_k += 3;
for(int a = 0 ; a < 100000; a ++)
{
String s = "To cost some time";
String[] ss = s.split(" ");
}
}
}
} class Mul_thread_i extends Thread
{
public Count_i c_i;
public Mul_thread_i(Count_i acc)
{
this.c_i = acc;
}
public void run()
{
c_i.count();
}
} class Mul_thread_j extends Thread
{
public Count_j c_j;
public Mul_thread_j(Count_j acc)
{
this.c_j = acc;
}
public void run()
{
c_j.count();
}
} class Mul_thread_k extends Thread
{
public Count_k c_k;
public Mul_thread_k(Count_k acc)
{
this.c_k = acc;
}
public void run()
{
c_k.count();
}
} public class Threethreading_save
{
public static void main(String[] args) throws InterruptedException
{
long startTime = System.currentTimeMillis();
Count_i ci = new Count_i();
Count_j cj = new Count_j();
Count_k ck = new Count_k();
Mul_thread_i aa = new Mul_thread_i(ci);
Mul_thread_j bb = new Mul_thread_j(cj);
Mul_thread_k cc = new Mul_thread_k(ck); aa.start();
bb.start();
cc.start();
aa.join();
bb.join();
cc.join(); System.out.println(ci.sum_i);
System.out.println(cj.sum_j);
System.out.println(ck.sum_k);
long endTime = System.currentTimeMillis();
System.out.println("run time:"+(endTime-startTime)+"ms");
}
}
下面是运行结果:
10000
20000
30000
run time:221227ms
CPU状态:可以看到有三个CPU的利用率达到100%.
空闲时的状态:
总结一些,当我们处理的任务量很大的时候,如果计算机有多个CPU,可以将待处理的任务合理的分为几个部分,然后开几个线程同时进行运算,等这些子任务都完成以后再交给主线程后续的处理,可以看到效率成倍的提升。当然线程安全是一个需要注意的问题,由于时间关系后面将详细介绍。
利用JAVA多线程来提高数据处理效率的更多相关文章
- GitHub Java项目推荐|功能丰富的 Java 工具包|提高开发效率
GitHub Java项目推荐|功能丰富的 Java 工具包|提高开发效率 功能丰富的 Java 工具包.它帮助我们实现了常用的工具方法,从而减少代码的体积,提高开发效率.该项目最初是作者工作项目中的 ...
- 如何优化JAVA代码及提高执行效率
可供程序利用的资源(内存.CPU时间.网络带宽等)是有限的,优化的目的就是让程序用尽可能少的资源完成预定的任务.优化通常包含两方面的内容:减小代码的体积,提高代码的运行效率.本文讨论的主要是如何提高代 ...
- (原创)JAVA多线程一传统多线程
一,多线程 多线程是提高程序效率,避免资源浪费的很好的解决方案,下面来慢慢的介绍多线程的一些基本知识,而这些是晋级高级不可或缺的一部分 1,Thread类 类实现多线程需要实现Runnable接口,我 ...
- java 多线程 22 :生产者/消费者模式 进阶 利用await()/signal()实现
java多线程15 :wait()和notify() 的生产者/消费者模式 在这一章已经实现了 wait/notify 生产消费模型 利用await()/signal()实现生产者和消费者模型 一样 ...
- 在一个千万级的数据库查寻中,如何提高查询效率?分别说出在数据库设计、SQL语句、java等层面的解决方案。
在一个千万级的数据库查寻中,如何提高查询效率?分别说出在数据库设计.SQL语句.java等层面的解决方案. 解答: 1)数据库设计方面: a. 对查询进行优化,应尽量避免全表扫描,首先应考虑在 whe ...
- 如何利用 Visual Studio 自带工具提高开发效率
Visual Stuido 是一款强大的Windows 平台集成开发工具,你是否好好地利用了它呢? 显示行号 有些时候(比如错误定位)的时候,显示行号将有利于我们进行快速定位. 如何显示 1. 工具 ...
- tomcat免重启随意更改java代码 提高开发效率
转载:http://developer.51cto.com/art/201012/241243.htm 做为了一个java开发人员,总是为因为要增加一个类,或是增加删除一个方法,甚至修改一个小处代码而 ...
- 【Java】能提高日常工作效率的一些Java函数
自编工具总是临时抱佛脚来得顺溜,宜常备手边以提高工作效率: package com.hy; import java.io.File; /** * 日常工作常用的一些工具方法 * @author 逆火 ...
- JAVA多线程提高十四: 面试题
前面针对多线程相关知识点进行了学习,那么我们来来看看常见的面试题: 1. 空中网面试题1 package com.kongzhongwang.interview; import java.util.c ...
随机推荐
- LayUI之table数据表格获取行、行高亮等相关操作
前言 目前LayUI数据表格既美观有不乏一些实用功能.基本上表格应有的操作已经具备,LayUI作者[贤心]肯定是煞费苦心去优化,此处致敬.但是实话实话,如果单纯那数据表格功能来说,EasUI的数据表格 ...
- Kafka Cached zkVersion [62] not equal to that in zookeeper, skip updating ISR (kafka.cluster.Partition) 问题分析
我司业务Kafka集群是3节点(broker分别为10,20,30),每个Topic 3 Partition,3 Repilication的配置,早上起床突然发现所有Topic的Broker节点都变为 ...
- python基础——内置函数
python基础--内置函数 一.内置函数(python3.x) 内置参数详解官方文档: https://docs.python.org/3/library/functions.html?highl ...
- Http协议消息报头
哎.不知道怎么写Http协议... 超文本传输协议(HTTP,HyperText Transfer Protocol)是互联网上应用最为广泛的一种网络协议. HTTP基于TCP/IP通信协议来传递数据 ...
- delphi 10.1 Berlin 中使用自带的 MD5 校验
uses System.Hash;//要引用这个单元哈 var Digest: TBytes; MD5: THashMD5; MD5Buf: TBytes; params: string; begin ...
- window.location各属性含义
window.location方法获取URL 统一资源定位符 (Uniform Resource Locator, URL) 完整的URL由这几个部分构成: scheme://host:p ...
- [HNOI 2001]求正整数
Description 对于任意输入的正整数n,请编程求出具有n个不同因子的最小正整数m.例如:n=4,则m=6,因为6有4个不同整数因子1,2,3,6:而且是最小的有4个因子的整数. Input n ...
- 计蒜客NOIP模拟赛(3)D2T1 小区划分
一条街道的两侧各连续坐落着 N 座单元楼.现在要为这些单元楼划分居民校区. 规则如下: 每个小区只能由同一侧连续的若干座单元楼组成.且两侧都恰有 K 个小区(每个小区至少有一栋楼). 两侧的小区划分规 ...
- ●洛谷P2664 树上游戏
题链: https://www.luogu.org/problemnew/show/P2664题解: 扫描线,线段树维护区间覆盖 https://www.luogu.org/blog/ZJ75211/ ...
- UVA - 11235:Frequent values
非常优美的RMQ问题,可以运到桶的思想 #include<cstdio> #include<cstdlib> #include<algorithm> #includ ...