Python 多进程、多线程效率比较

Python 界有条不成文的准则：计算密集型任务适合多进程，IO 密集型任务适合多线程。本篇来作个比较。

通常来说多线程相对于多进程有优势，因为创建一个进程开销比较大，然而因为在 python 中有 GIL 这把大锁的存在，导致执行计算密集型任务时多线程实际只能是单线程。而且由于线程之间切换的开销导致多线程往往比实际的单线程还要慢，所以在 python 中计算密集型任务通常使用多进程，因为各个进程有各自独立的 GIL，互不干扰。

而在 IO 密集型任务中，CPU 时常处于等待状态，操作系统需要频繁与外界环境进行交互，如读写文件，在网络间通信等。在这期间 GIL 会被释放，因而就可以使用真正的多线程。

以上是理论，下面做一个简单的模拟测试：大量计算用 math.sin() + math.cos() 来代替，IO 密集型用 time.sleep() 来模拟。在 Python 中有多种方式可以实现多进程和多线程，这里一并纳入看看是否有效率差异：

多进程： joblib.multiprocessing, multiprocessing.Pool, multiprocessing.apply_async, concurrent.futures.ProcessPoolExecutor
多线程： joblib.threading, threading.Thread, concurrent.futures.ThreadPoolExecutor

from multiprocessing import Pool

from threading import Thread

from concurrent.futures import ThreadPoolExecutor, ProcessPoolExecutor

import time, os, math

from joblib import Parallel, delayed, parallel_backend

def f_IO(a):  # IO 密集型

    time.sleep(5)

def f_compute(a):  # 计算密集型

    for _ in range(int(1e7)):

        math.sin(40) + math.cos(40)

    return

def normal(sub_f):

    for i in range(6):

        sub_f(i)

    return

def joblib_process(sub_f):

    with parallel_backend("multiprocessing", n_jobs=6):

        res = Parallel()(delayed(sub_f)(j) for j in range(6))

    return

def joblib_thread(sub_f):

    with parallel_backend('threading', n_jobs=6):

        res = Parallel()(delayed(sub_f)(j) for j in range(6))

    return

def mp(sub_f):

    with Pool(processes=6) as p:

        res = p.map(sub_f, list(range(6)))

    return

def asy(sub_f):

    with Pool(processes=6) as p:

        result = []

        for j in range(6):

            a = p.apply_async(sub_f, args=(j,))

            result.append(a)

        res = [j.get() for j in result]

def thread(sub_f):

    threads = []

    for j in range(6):

        t = Thread(target=sub_f, args=(j,))

        threads.append(t)

        t.start()

    for t in threads:

        t.join()

def thread_pool(sub_f):

    with ThreadPoolExecutor(max_workers=6) as executor:

        res = [executor.submit(sub_f, j) for j in range(6)]

def process_pool(sub_f):

    with ProcessPoolExecutor(max_workers=6) as executor:

        res = executor.map(sub_f, list(range(6)))

def showtime(f, sub_f, name):

    start_time = time.time()

    f(sub_f)

    print("{} time: {:.4f}s".format(name, time.time() - start_time))

def main(sub_f):

    showtime(normal, sub_f, "normal")

    print()

    print("------ 多进程 ------")

    showtime(joblib_process, sub_f, "joblib multiprocess")

    showtime(mp, sub_f, "pool")

    showtime(asy, sub_f, "async")

    showtime(process_pool, sub_f, "process_pool")

    print()

    print("----- 多线程 -----")

    showtime(joblib_thread, sub_f, "joblib thread")

    showtime(thread, sub_f, "thread")

    showtime(thread_pool, sub_f, "thread_pool")

if __name__ == "__main__":

    print("----- 计算密集型 -----")

    sub_f = f_compute

    main(sub_f)

    print()

    print("----- IO 密集型 -----")

    sub_f = f_IO

    main(sub_f)

结果：

----- 计算密集型 -----

normal time: 15.1212s

------ 多进程 ------

joblib multiprocess time: 8.2421s

pool time: 8.5439s

async time: 8.3229s

process_pool time: 8.1722s

----- 多线程 -----

joblib thread time: 21.5191s

thread time: 21.3865s

thread_pool time: 22.5104s

----- IO 密集型 -----

normal time: 30.0305s

------ 多进程 ------

joblib multiprocess time: 5.0345s

pool time: 5.0188s

async time: 5.0256s

process_pool time: 5.0263s

----- 多线程 -----

joblib thread time: 5.0142s

thread time: 5.0055s

thread_pool time: 5.0064s

上面每一方法都统一创建6个进程/线程，结果是计算密集型任务中速度：多进程 > 单进程/线程 > 多线程， IO 密集型任务速度：多线程 > 多进程 > 单进程/线程。

Python 多进程、多线程效率比较的更多相关文章

Python 多进程多线程协程 I/O多路复用
引言在学习Python多进程.多线程之前,先脑补一下如下场景: 说有这么一道题:小红烧水需要10分钟,拖地需要5分钟,洗菜需要5分钟,如果一样一样去干,就是简单的加法,全部做完,需要20分钟:但是, ...
python 多进程/多线程/协程同步异步
这篇主要是对概念的理解: 1.异步和多线程区别:二者不是一个同等关系,异步是最终目的,多线程只是我们实现异步的一种手段.异步是当一个调用请求发送给被调用者,而调用者不用等待其结果的返回而可以做其它的事 ...
python 多进程多线程的对比
link:http://www.cnblogs.com/whatisfantasy/p/6440585.html mark一下,挺详细
Python的多线程和多进程
(1)多线程的产生并不是因为发明了多核CPU甚至现在有多个CPU+多核的硬件,也不是因为多线程CPU运行效率比单线程高.单从CPU的运行效率上考虑,单任务进程及单线程效率是最高的,因为CPU没有任何进 ...
Python中多线程与多进程的恩恩怨怨
概念: 并发:当有多个线程在操作时,如果系统只有一个CPU,则它根本不可能真正同时进行一个以上的线程,它只能把CPU运行时间划分成若干个时间段,再将时间段分配给各个线程执行,在一个时间段的线程代码运 ...
Python中单线程、多线程和多进程的效率对比实验
GIL机制导致如下结果: Python的多线程程序并不能利用多核CPU的优势 (比如一个使用了多个线程的计算密集型程序只会在一个单CPU上面运行)python多线程适合io操作密集型的任务(如sock ...
Python的多线程（threading）与多进程（multiprocessing ）
进程:程序的一次执行(程序载入内存,系统分配资源运行).每个进程有自己的内存空间,数据栈等,进程之间可以进行通讯,但是不能共享信息. 线程:所有的线程运行在同一个进程中,共享相同的运行环境.每个独立的 ...
python数据采集与多线程效率分析
以前一直使用PHP写爬虫,用Snoopy配合simple_html_dom用起来也挺好的,至少能够解决问题. PHP一直没有一个好用的多线程机制,虽然可以使用一些trick的手段来实现并行的效果(例如 ...
python采用多进程/多线程/协程写爬虫以及性能对比，牛逼的分分钟就将一个网站爬下来!
首先我们来了解下python中的进程,线程以及协程! 从计算机硬件角度: 计算机的核心是CPU,承担了所有的计算任务.一个CPU,在一个时间切片里只能运行一个程序. 从操作系统的角度: 进程和线程,都 ...
python 多进程开发与多线程开发
转自: http://tchuairen.blog.51cto.com/3848118/1720965 博文作者参考的博文: 博文1 博文2 我们先来了解什么是进程? 程序并不能单独运行,只有将程 ...

随机推荐

【第五章】 springboot + mybatis
springboot集成了springJDBC与JPA,但是没有集成mybatis,所以想要使用mybatis就要自己去集成.集成方式相当简单. 1.项目结构 2.pom.xml <!-- 与数 ...
HDU 6103 Kirinriki（尺取法）
http://acm.hdu.edu.cn/showproblem.php?pid=6103 题意: 给出一个字符串,在其中找两串互不重叠的子串,计算它们之间的dis值,要求dis值小于等于m,求能选 ...
纯CSS实现一个微信logo，需要几个标签？
博客已迁移至http://lwzhang.github.io. 纯CSS实现一个微信logo并不难,难的是怎样用最少的html标签实现.我一直在想怎样用一个标签就能实现,最后还是没想出来,就只好用两个 ...
spoj TBATTLE 质因数分解+二分
题目链接:点击传送 TBATTLE - Thor vs Frost Giants #number-theory #sliding-window-1 Thor is caught up in a fie ...
Index.cshtml”处的视图必须派生自 WebViewPage 或 WebViewPage<TModel>。
解决方案: 1,在每个视图上面添加 @inherits System.Web.Mvc.WebViewPage 2,将views中的web.config COPY到新的视图模版文件夹下,就可以了
Seafile 文件访问日志时间不一致问题
修改/seafile-server-latest/seahub/seahub/setting.py # Local time zone for this installation. Choices c ...
webpack 集成 jQuery 和 Avalon
webpack 系列三:webpack 如何集成第三方js库 webpack系列目录 webpack 系列一:模块系统的演进 webpack 系列二:webpack 介绍&安装 webp ...
Java 常用对象-StringBuffer类
2017-11-02 20:57:02 StringBuffer:线程安全的可变字符序列.一个类似于 String 的字符串缓冲区,但不能修改.虽然在任意时间点上它都包含某种特定的字符序列,但通过某些 ...
Razor及HtmlHelper学习笔记
Razor 不是编程语言.它是服务器端标记语言. 什么是Razor? Razor 是一种允许您向网页中嵌入基于服务器的代码(Visual Basic 和 C#)的标记语法. 当网页被写入浏览器时,基于 ...
Destroy the Colony CodeForces - 1111D (可逆背包,计数)
大意:给定字符串$s$, 保证长度为偶数, 给定q个询问, 每次询问给定两个位置$x$,$y$, 可以任意交换字符, 要求所有字符$s[x],s[y]$在同一半边, 剩余所有同种字符在同一半边的方案数 ...

Python 多进程、多线程效率比较

Python 多进程、多线程效率比较的更多相关文章

随机推荐

热门专题