适用于CUDA GPU的Numba 随机数生成

随机数生成

Numba提供了可以在GPU上执行的随机数生成算法。由于NVIDIA如何实现cuRAND的技术问题，Numba的GPU随机数生成器并非基于cuRAND。相反，Numba的GPU RNG是xoroshiro128 +算法的实现。xoroshiro128 +算法的周期为2**128 - 1，比cuRAND中默认使用的XORWOW算法的周期短，但是xoroshiro128 +算法仍然通过了随机数发生器质量的BigCrush测试。

在GPU上使用任何RNG时，重要的是要确保每个线程都有其自己的RNG状态，并且它们已初始化为产生不重叠的序列。numba.cuda.random模块提供了执行此操作的主机功能，以及提供统一或正态分布的随机数的CUDA设备功能。

注意

Numba (like cuRAND) uses the Box-Muller transform <https://en.wikipedia.org/wiki/Box%E2%80%93Muller_transform>从统一生成器生成正态分布的随机数。但是，Box-Muller生成随机数对，当前实现只返回其中之一。结果，生成正态分布的值是均匀分布的值的速度的一半。

numba.cuda.random.create_xoroshiro128p_states(n, seed, subsequence_start=0, stream=0)

返回为n个随机数生成器初始化的新设备数组。

这将初始化RNG状态，以便数组中的每个状态与主序列中彼此分开2 ** 64步的子序列相对应。因此，只要没有CUDA线程请求超过2 ** 64个随机数，就可以保证此函数产生的所有RNG状态都是独立的。

subsequence_start参数可用于将第一个RNG状态提前2 ** 64步的倍数。

参数：

n（int）–要创建的RNG状态数
seed（uint64）–生成器列表的起始种子
subsequence_start（uint64）–
Stream（CUDA流）–在其上运行初始化内核的流

numba.cuda.random.init_xoroshiro128p_states(states, seed, subsequence_start=0, stream=0)

在GPU上为并行生成器初始化RNG状态。

subsequence_start参数可用于将第一个RNG状态提前2 ** 64步的倍数。

参数：

states (1D DeviceNDArray, dtype=xoroshiro128p_dtype)– RNG状态数组
seed（uint64）–生成器列表的起始种子

numba.cuda.random.xoroshiro128p_uniform_float32

返回范围为[0.0，1.0）的float32并前进states[index]。

参数：	states (1D DeviceNDArray, dtype=xoroshiro128p_dtype)– RNG状态数组 index（int64）–要更新的状态的偏移量
返回类型：	float32

numba.cuda.random.xoroshiro128p_uniform_float64

返回范围为[0.0，1.0）的float64并前进states[index]。

参数：	状态states (1D array, dtype=xoroshiro128p_dtype)– RNG状态数组 index（int64）–要更新的状态的偏移量
返回类型：	float64

numba.cuda.random.xoroshiro128p_normal_float32

返回正态分布的float32并前进states[index]。

使用Box-Muller变换从平均值= 0和sigma = 1的高斯中得出返回值。这使RNG序列前进了两个步骤。

参数：	states (1D array, dtype=xoroshiro128p_dtype)– RNG状态数组 index（int64）–要更新的状态的偏移量
返回类型：	float32

numba.cuda.random.xoroshiro128p_normal_float64

返回正态分布的float32并前进states[index]。

使用Box-Muller变换从平均值= 0和sigma = 1的高斯中得出返回值。这使RNG序列前进了两个步骤。

参数：	状态states (1D array, dtype=xoroshiro128p_dtype)– RNG状态数组 index（int64）–要更新的状态的偏移量
返回类型：	float64

例

这是使用随机数生成器的示例程序：

from __future__ import print_function, absolute_import

from numba import cuda

from numba.cuda.random import create_xoroshiro128p_states, xoroshiro128p_uniform_float32

import numpy as np

@cuda.jit

def compute_pi(rng_states, iterations, out):

"""Find the maximum value in values and store in result[0]"""

thread_id = cuda.grid(1)

# Compute pi by drawing random (x, y) points and finding what

# fraction lie inside a unit circle

inside = 0

for i in range(iterations):

x = xoroshiro128p_uniform_float32(rng_states, thread_id)

y = xoroshiro128p_uniform_float32(rng_states, thread_id)

if x**2 + y**2 <= 1.0:

inside += 1

out[thread_id] = 4.0 * inside / iterations

threads_per_block = 64

blocks = 24

rng_states = create_xoroshiro128p_states(threads_per_block * blocks, seed=1)

out = np.zeros(threads_per_block * blocks, dtype=np.float32)

compute_pi[blocks, threads_per_block](rng_states, 10000, out)

print('pi:', out.mean())

适用于CUDA GPU的Numba 随机数生成的更多相关文章

适用于CUDA GPU的Numba例子
适用于CUDA GPU的Numba例子矩阵乘法这是使用CUDA内核的矩阵乘法的简单实现: @cuda.jit def matmul(A, B, C): """Perf ...
适用于AMD ROC GPU的Numba概述
适用于AMD ROC GPU的Numba概述 Numba通过按照HSA执行模型将Python代码的受限子集直接编译到HSA内核和设备功能中,从而支持AMD ROC GPU编程.用Numba编写的内核似 ...
NVIDIA GPU上的随机数生成
NVIDIA GPU上的随机数生成 NVIDIA CUDA随机数生成库(cuRAND)提供高性能的GPU加速的随机数生成(RNG).cuRAND库使用NVIDIA GPU中提供的数百个处理器内核,将质 ...
Gradient Boosting, Decision Trees and XGBoost with CUDA ——GPU加速5-6倍
xgboost的可以参考:https://xgboost.readthedocs.io/en/latest/gpu/index.html 整体看加速5-6倍的样子. Gradient Boosting ...
CUDA ---- GPU架构（Fermi、Kepler）
GPU架构 SM(Streaming Multiprocessors)是GPU架构中非常重要的部分,GPU硬件的并行性就是由SM决定的. 以Fermi架构为例,其包含以下主要组成部分: CUDA co ...
奉献pytorch 搭建 CNN 卷积神经网络训练图像识别的模型，配合numpy 和matplotlib 一起使用调用 cuda GPU进行加速训练
1.Torch构建简单的模型 # coding:utf-8 import torch class Net(torch.nn.Module): def __init__(self,img_rgb=3,i ...
CUDA && GPU中dim3介绍
布客·ApacheCN 翻译/校对/笔记整理活动进度公告 2020.1
注意请贡献者查看参与方式,然后直接在 ISSUE 中认领. 翻译/校对三个文档就可以申请当负责人,我们会把你拉进合伙人群.翻译/校对五个文档的贡献者,可以申请实习证明. 请私聊片刻(52981514 ...
真实机下 ubuntu 18.04 安装GPU +CUDA+cuDNN 以及其版本选择（亲测非常实用）【转】
本文转载自:https://blog.csdn.net/u010801439/article/details/80483036 ubuntu 18.04 安装GPU +CUDA+cuDNN : 目前, ...

随机推荐

C#-Socket(TCP)
//提示,线程里面不要给控件赋值 LinkSocket.Send(result, length, 0); 自己挂起 private void button1_Click(object sender, ...
<JVM从入门到精通>导航
笔记来源:尚硅谷JVM全套教程,百万播放,全网巅峰(宋红康详解java虚拟机) 同步更新:https://gitee.com/vectorx/NOTE_JVM https://codechina.cs ...
【.NET 与树莓派】六轴飞控传感器（MPU 6050）
所谓"飞控",其实是重力加速度计和陀螺仪的组合,因为多用于控制飞行器的平衡(无人机.遥控飞机).有同学会问,这货为什么会有六轴呢?咱们常见的不是X.Y.Z三轴吗?重力加速度有三轴, ...
【2020BUAA软件工程】个人博客作业
个人作业博客项目内容北航2020软工班级博客作业要求具体要求我的课程目标学习软件工程,掌握团队合作,锻炼自我作业在哪个方面帮助我实现目标通读<构建之法>,尝试理解软件工 ...
从零搭建springboot服务03-redis消息订阅
愿历尽千帆,归来仍是少年 1.所需依赖  <dependency> <groupId>org.springframework.boo ...
[bug] IDEA springboot项目访问静态资源 html页面报404
原因复制的静态资源目录没有编译解决检查target目录中,是否有static目录,若没有,重新右键项目install即可若还不能解决,尝试浏览器缓存和IDEA编译设置,详见参考链接参考 ht ...
[Qt] 《开发指南》samp4.1 源码分析
界面: 功能: 输入单价和数量,计算总价:进制转换控件: Qlabel QLineEdit QPushButton 文件依赖关系图(depend on): main.cpp:程序入口 widget. ...
[Python] execl读写
相关库读:xlrd 写:xlwt 案例要求: 将图1中的数据导以图2的形式写入另一个文件中第一列索引关系:{1:K1-B1,2:K1-B2} ...(18列) 思路: 按行读取数据,根据索引关系 ...
用JIRA管理你的项目——（一）JIRA环境搭建
JIRA,大家应该都已经不陌生了! 最初接触这个工具的时候,我还在一味地单纯依靠SVN管理代码,幻想着SVN可以有个邮件通知,至少在项目成员进行代码修改的时候,我可以第一时间通过邮件获得这个消息! 当 ...
Vim删除空行
Vim删除空行 1 Vim删除空行打开vim输入:g/^$/d :g将在与正则表达式匹配的行上执行命令. 正则表达式是'空行',命令是:d (删除)

适用于CUDA GPU的Numba 随机数生成

适用于CUDA GPU的Numba 随机数生成的更多相关文章

随机推荐

热门专题