CUDA ---- 线程配置

前言

线程的组织形式对程序的性能影响是至关重要的，本篇博文主要以下面一种情况来介绍线程组织形式：

2D grid 2D block

线程索引

矩阵在memory中是row-major线性存储的：

在kernel里，线程的唯一索引非常有用，为了确定一个线程的索引，我们以2D为例：

线程和block索引
矩阵中元素坐标
线性global memory 的偏移

首先可以将thread和block索引映射到矩阵坐标：

ix = threadIdx.x + blockIdx.x * blockDim.x

iy = threadIdx.y + blockIdx.y * blockDim.y

之后可以利用上述变量计算线性地址：

idx = iy * nx + ix

上图展示了block和thread索引，矩阵坐标以及线性地址之间的关系，谨记，相邻的thread拥有连续的threadIdx.x，也就是索引为(0,0)(1,0)(2,0)(3,0)...的thread连续，而不是(0,0)(0,1)(0,2)(0,3)...连续，跟我们线代里玩矩阵的时候不一样。

现在可以验证出下面的关系：

thread_id（2,1）block_id（1,0） coordinate（6,1） global index 14 ival 14

下图显示了三者之间的关系：

代码

int main(int argc, char **argv) {

　　printf("%s Starting...\n", argv[]);

　　// set up device

　　int dev = ;

　　cudaDeviceProp deviceProp;

　　CHECK(cudaGetDeviceProperties(&deviceProp, dev));

　　printf("Using Device %d: %s\n", dev, deviceProp.name);

　　CHECK(cudaSetDevice(dev));

　　// set up date size of matrix

　　int nx = <<;

　　int ny = <<;

　　int nxy = nx*ny;

　　int nBytes = nxy * sizeof(float);

　　printf("Matrix size: nx %d ny %d\n",nx, ny);


　　// malloc host memory

　　float *h_A, *h_B, *hostRef, *gpuRef;

　　h_A = (float *)malloc(nBytes);

　　h_B = (float *)malloc(nBytes);

　　hostRef = (float *)malloc(nBytes);

　　gpuRef = (float *)malloc(nBytes);

　　
　　// initialize data at host side

　　double iStart = cpuSecond();

　　initialData (h_A, nxy);

　　initialData (h_B, nxy);

　　double iElaps = cpuSecond() - iStart;

　　memset(hostRef, , nBytes);

　　memset(gpuRef, , nBytes);


　　// add matrix at host side for result checks

　　iStart = cpuSecond();

　　sumMatrixOnHost (h_A, h_B, hostRef, nx,ny);

　　iElaps = cpuSecond() - iStart;


　　// malloc device global memory

　　float *d_MatA, *d_MatB, *d_MatC;

　　cudaMalloc((void **)&d_MatA, nBytes);

　　cudaMalloc((void **)&d_MatB, nBytes);

　　cudaMalloc((void **)&d_MatC, nBytes);

　　
　　// transfer data from host to device

　　cudaMemcpy(d_MatA, h_A, nBytes, cudaMemcpyHostToDevice);

　　cudaMemcpy(d_MatB, h_B, nBytes, cudaMemcpyHostToDevice);


　　// invoke kernel at host side

　　int dimx = ;

　　int dimy = ;

　　dim3 block(dimx, dimy);

　　dim3 grid((nx+block.x-)/block.x, (ny+block.y-)/block.y);

　　iStart = cpuSecond();

　　sumMatrixOnGPU2D <<< grid, block >>>(d_MatA, d_MatB, d_MatC, nx, ny);

　　cudaDeviceSynchronize();

　　iElaps = cpuSecond() - iStart;

　　printf("sumMatrixOnGPU2D <<<(%d,%d), (%d,%d)>>> elapsed %f sec\n", grid.x,

　　grid.y, block.x, block.y, iElaps);


　　// copy kernel result back to host side

　　cudaMemcpy(gpuRef, d_MatC, nBytes, cudaMemcpyDeviceToHost);


　　// check device results

　　checkResult(hostRef, gpuRef, nxy);

　　
　　// free device global memory

　　cudaFree(d_MatA);

　　cudaFree(d_MatB);

　　cudaFree(d_MatC);


　　// free host memory

　　free(h_A);

　　free(h_B);

　　free(hostRef);

　　free(gpuRef);


　　// reset device

　　cudaDeviceReset();

　　return ();

}

编译运行：

$ nvcc -arch=sm_20 sumMatrixOnGPU-2D-grid-2D-block.cu -o matrix2D

$ ./matrix2D

输出：

./a.out Starting...

Using Device : Tesla M2070

Matrix size: nx  ny

sumMatrixOnGPU2D <<<(,), (,)>>> elapsed 0.060323 sec

Arrays match.

接下来，我们更改block配置为32x16，重新编译，输出为：

sumMatrixOnGPU2D <<<(512,1024), (32,16)>>> elapsed 0.038041 sec

可以看到，性能提升了一倍，直观的来看，我们会认为第二个配置比第一个多了一倍的block所以性能提升一倍，实际上也确实是因为block增加了。但是，如果你继续增加block的数量，则性能又会降低：

sumMatrixOnGPU2D <<< (1024,1024), (16,16) >>> elapsed 0.045535 sec

下图展示了不同配置的性能;

关于性能的分析将在之后的博文中总结，现在只是了解下，本文在于掌握线程组织的方法。

代码下载：CodeSamples.zip

CUDA ---- 线程配置的更多相关文章

最优的cuda线程配置
1 每个SM上面失少要有192个激活线程,寄存器写后读的数据依赖才能被掩盖 2 将寄存器的bank冲突降到最低,应尽量使每个block含有的线程数是64的倍数 3 block的数量应设置得 ...
GPU编程自学2 —— CUDA环境配置
深度学习的兴起,使得多线程以及GPU编程逐渐成为算法工程师无法规避的问题.这里主要记录自己的GPU自学历程. 目录 <GPU编程自学1 -- 引言> <GPU编程自学2 -- CUD ...
Tomcat 内存和线程配置优化
1. tomcat 的线程配置参数详情如下: 修改conf/server.xml中的<Connector .../> 节点如下: <Connector port="8080 ...
十五、springboot集成定时任务(Scheduling Tasks)（二）之（线程配置）
配置类: /** * 定时任务线程配置 * */ @Configuration public class SchedulerConfig implements SchedulingConfigurer ...
【深度学习】在linux和windows下anaconda+pycharm+tensorflow+cuda的配置
在linux和windows下anaconda+pycharm+tensorflow+cuda的配置在linux和windows下anaconda+pycharm+tensorflow+cuda的配 ...
OpenCV GPU CUDA OpenCL 配置
首先,正确安装OpenCV,并且通过测试. 我理解GPU的环境配置由3个主要步骤构成. 1. 生成关联文件,即makefile或工程文件 2. 编译生成与使用硬件相关的库文件,包括动态.静态库文件. ...
CUDA学习笔记（二）——CUDA线程模型
转自:http://blog.sina.com.cn/s/blog_48b9e1f90100fm5b.html 一个grid中的所有线程执行相同的内核函数,通过坐标进行区分.这些线程有两级的坐标,bl ...
GPU（CUDA）学习日记（十一）------ 深入理解CUDA线程层次以及关于设置线程数的思考
GPU线程以网格(grid)的方式组织,而每个网格中又包含若干个线程块,在G80/GT200系列中,每一个线程块最多可包含512个线程,Fermi架构中每个线程块支持高达1536个线程.同一线程块中的 ...
【CUDA】Win10 + VS2017新 CUDA 项目配置
一.新建项目打开VS2017 → 新建项目 → Win32控制台应用程序 → “空项目”打钩二.调整配置管理器平台类型右键项目 → 属性 → 配置管理器 → 全改为“x64” 三.配置生成属性 ...

随机推荐

JAVA框架 Mybaits
注意:我们在resultType中,对于selectlist方法也是projo类.resultType参数的含义是list的泛型的类型. 一:jar包下载: https://github.com/m ...
《Java程序设计》第2周学习总结（Markdown语法修改版）
20175105 2018-2019-2 <Java程序设计>第2周学习总结 Vim操作的一些总结这些天通过学习,对于vim的操作有了很大的提升,下面我把vim的比较常见的操作方式做了归 ...
MySQL学习笔记04 插入中文时出现ERROR 1366 (HY000)
1 环境: MySQL Server 6.0 命令行工具 2 问题 : 插入中文字符数据出现如下错误: ERROR 1366 (HY000): Incorrect string value: '\ ...
关于docker构建镜像
今天正好看到这一块了,记录一下,希望可以帮助到大家. 构建Dockerfile 先来看一个示例: --------------------------------------------------- ...
go语言之行--简介与环境搭建
一.Go简介 Go 是一个开源的编程语言,它能让构造简单.可靠且高效的软件变得容易. Go是从2007年末由Robert Griesemer, Rob Pike, Ken Thompson主持开发,后 ...
python基础4之递归、lambda、深浅copy
内容概要: 一.递归二.匿名函数三.关于python中的深浅拷贝与赋值一.递归递归就是函数本身调用自己,直到满足指定条件之后一层层退出函数递归特性: 必须有一个明确的结束条件每次进入更深一 ...
WPF控件加阴影模糊问题
原文:WPF控件加阴影模糊问题不能直接把阴影加在控件上应该加在控件的同级兄弟节点上,覆盖在底下就不会模糊了
Python基础(字符串和编码)
字符编码我们已经讲过了,字符串也是一种数据类型,但是,字符串比较特殊的是还有一个编码问题. 因为计算机只能处理数字,如果要处理文本,就必须先把文本转换为数字才能处理.最早的计算机在设计时采用8个比特 ...
Spring集成Swagger，Java自动生成Api文档
博主很懒... Swagger官网:http://swagger.io GitHub地址:https://github.com/swagger-api 官方注解文档:http://docs.swagg ...
奔跑吧Linux
刚拿到MiZ702,就被他的"外貌"深深的吸引,核心板加底板的形式让她看上去,强大而神秘-- 华丽的外表之下是否有着与之相当的内含呢,我们拿Linux将其检验一番! 板载的TF卡里 ...

CUDA ---- 线程配置

前言

线程索引

代码

CUDA ---- 线程配置的更多相关文章

随机推荐

热门专题