多GPU设备处理点积示例

多GPU设备处理点积示例，项目打包下载

 /*

 * Copyright 1993-2010 NVIDIA Corporation.  All rights reserved.

 *

 * NVIDIA Corporation and its licensors retain all intellectual property and

 * proprietary rights in and to this software and related documentation.

 * Any use, reproduction, disclosure, or distribution of this software

 * and related documentation without an express license agreement from

 * NVIDIA Corporation is strictly prohibited.

 *

 * Please refer to the applicable NVIDIA end user license agreement (EULA)

 * associated with this source code for terms and conditions that govern

 * your use of this NVIDIA software.

 *

 */

 #include "../common/book.h"

 #include "cuda.h"

 #include "device_launch_parameters.h"

 #include "device_functions.h"

 #include "cuda_runtime.h"

 #define imin(a,b) (a<b?a:b)

 #define     N    (33*1024*1024)

 const int threadsPerBlock = ;

 const int blocksPerGrid =

 imin(, (N /  + threadsPerBlock - ) / threadsPerBlock);

 __global__ void dot(int size, float *a, float *b, float *c) {

     __shared__ float cache[threadsPerBlock];

     int tid = threadIdx.x + blockIdx.x * blockDim.x;

     int cacheIndex = threadIdx.x;

     float   temp = ;

     while (tid < size) {

         temp += a[tid] * b[tid];

         tid += blockDim.x * gridDim.x;

     }

     // set the cache values

     cache[cacheIndex] = temp;

     // synchronize threads in this block

     __syncthreads();

     //块内归约

     int i = blockDim.x / ;

     while (i != ) {

         if (cacheIndex < i)

             cache[cacheIndex] += cache[cacheIndex + i];

         __syncthreads();

         i /= ;

     }

     if (cacheIndex == )

         c[blockIdx.x] = cache[];

 }

 struct DataStruct {

     int     deviceID;

     int     size;

     float   *a;

     float   *b;

     float   returnValue;

 };

 unsigned WINAPI routine(void *pvoidData)

 //void* routine(void *pvoidData)

 {

     DataStruct  *data = (DataStruct*)pvoidData;

     HANDLE_ERROR(cudaSetDevice(data->deviceID));

     int     size = data->size;

     float   *a, *b, c, *partial_c;

     float   *dev_a, *dev_b, *dev_partial_c;

     // allocate memory on the CPU side

     a = data->a;

     b = data->b;

     partial_c = (float*)malloc(blocksPerGrid*sizeof(float));

     // allocate the memory on the GPU

     HANDLE_ERROR(cudaMalloc((void**)&dev_a,

         size*sizeof(float)));

     HANDLE_ERROR(cudaMalloc((void**)&dev_b,

         size*sizeof(float)));

     HANDLE_ERROR(cudaMalloc((void**)&dev_partial_c,

         blocksPerGrid*sizeof(float)));

     // copy the arrays 'a' and 'b' to the GPU

     HANDLE_ERROR(cudaMemcpy(dev_a, a, size*sizeof(float),

         cudaMemcpyHostToDevice));

     HANDLE_ERROR(cudaMemcpy(dev_b, b, size*sizeof(float),

         cudaMemcpyHostToDevice));

     dot <<<blocksPerGrid, threadsPerBlock >>>(size, dev_a, dev_b,

         dev_partial_c);

     // copy the array 'c' back from the GPU to the CPU

     HANDLE_ERROR(cudaMemcpy(partial_c, dev_partial_c,

         blocksPerGrid*sizeof(float),

         cudaMemcpyDeviceToHost));

     // finish up on the CPU side

     c = ;

     for (int i = ; i<blocksPerGrid; i++) {

         c += partial_c[i];

     }

     HANDLE_ERROR(cudaFree(dev_a));

     HANDLE_ERROR(cudaFree(dev_b));

     HANDLE_ERROR(cudaFree(dev_partial_c));

     // free memory on the CPU side

     free(partial_c);

     data->returnValue = c;

     return ;

 }

 int main(void) {

     int deviceCount;

     HANDLE_ERROR(cudaGetDeviceCount(&deviceCount));

     //要求两个设备

     if (deviceCount < ) {

         printf("We need at least two compute 1.0 or greater "

             "devices, but only found %d\n", deviceCount);

         return ;

     }

     float   *a = (float*)malloc(sizeof(float)* N);

     HANDLE_NULL(a);

     float   *b = (float*)malloc(sizeof(float)* N);

     HANDLE_NULL(b);

     // fill in the host memory with data

     for (int i = ; i<N; i++) {

         a[i] = i;

         b[i] = i * ;

     }

     /*

     为多线程做准备

     每个DateStruct都为数据集大小的一半

     */

     DataStruct  data[];

     data[].deviceID = ;

     data[].size = N / ;

     data[].a = a;

     data[].b = b;

     data[].deviceID = ;

     data[].size = N / ;

     data[].a = a + N / ;

     data[].b = b + N / ;

     CUTThread   thread = start_thread(routine, &(data[]));

     routine(&(data[]));

     end_thread(thread);

     // free memory on the CPU side

     free(a);

     free(b);

     printf("Value calculated:  %f\n",

         data[].returnValue + data[].returnValue);

     return ;

 }

多GPU设备处理点积示例的更多相关文章

利用nvidia-smi 管理和监控NVIDIA GPU设备
NVIDIA系统管理界面介绍原文来源:https://developer.nvidia.com/nvidia-system-management-interface NVIDIA系统管理界面(nvi ...
【VS开发】设备控制台 (DevCon.exe) 示例
设备控制台 (DevCon.exe) 示例本部分提供以下设备控制台 (DevCon.exe) 命令的示例: DevCon HwIDs 示例 1:查找所有硬件 ID 示例 2:使用模式查找硬件 ID ...
[转载]tensorflow中使用tf.ConfigProto()配置Session运行参数&&GPU设备指定
tf.ConfigProto()函数用在创建session的时候,用来对session进行参数配置: config = tf.ConfigProto(allow_soft_placement=True ...
tensorflow中使用tf.ConfigProto()配置Session运行参数&&GPU设备指定
tf.ConfigProto()函数用在创建session的时候,用来对session进行参数配置: config = tf.ConfigProto(allow_soft_placement=True ...
使用tf.ConfigProto()配置Session运行参数和GPU设备指定
参考链接:https://blog.csdn.net/dcrmg/article/details/79091941 tf.ConfigProto()函数用在创建session的时候,用来对sessio ...
tf.Session()函数的参数应用（tensorflow中使用tf.ConfigProto()配置Session运行参数&&GPU设备指定）
版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明.本文链接:https://blog.csdn.net/dcrmg/article/details ...
OpenStack 企业私有云的若干需求（1）：Nova 虚机支持 GPU
本系列会介绍OpenStack 企业私有云的几个需求: 自动扩展(Auto-scaling)支持多租户和租户隔离 (multi-tenancy and tenancy isolation) 混合云( ...
《CUDA并行程序设计：GPU编程指南》
<CUDA并行程序设计:GPU编程指南> 基本信息原书名:CUDA Programming:A Developer’s Guide to Parallel Computing with ...
GPU编程自学3 —— CUDA程序初探
深度学习的兴起,使得多线程以及GPU编程逐渐成为算法工程师无法规避的问题.这里主要记录自己的GPU自学历程. 目录 <GPU编程自学1 -- 引言> <GPU编程自学2 -- CUD ...

随机推荐

开发整理-Javaweb应用的系统升级功能
web应用有一个功能菜单是系统升级,通过调用升级脚本,将新发布的war替换原来的tomcat的webapps下的应用,然后停掉tomcate,再重启tomcate.最初实现就是通过简单的用在web项目 ...
通过ps给透明通道的图片添加灰度（适用于需要兼容IE7，效果很好）
原始的图片是这样的第一步: 第二步: 第三步: 第四步: 更多(文字居中): 1: 2: 3: 4:
poj2186-Popular Cows(强连通分支)
有N(N<=10000)头牛,每头牛都想成为most poluler的牛,给出M(M<=50000)个关系,如(1,2)代表1欢迎2,关系可以传递,但是不可以相互,即1欢迎2不代表2欢迎1 ...
练习六：斐波那契数列(fibonacci)
题目:斐波那契数列. 程序分析:斐波那契数列(Fibonacci sequence),又称黄金分割数列,指的是这样一个数列:0.1.1.2.3.5.8.13.21.34.……. 在数学上,斐波那契数列 ...
忘记mysql数据库密码时进行修改方法
长时间没有使用数据库了,或者把密码改完之后就忘了数据库密码,不能正常进入数据库,也无法修改密码,有一个简单的常用修改密码方式: 1.首先找到和打开mysql.exe和mysqld.exe所在的文件夹( ...
UVALive 7500 Boxes and Balls 2015EC final 签到题二分
分析题目后,得到要求的是最接近n的一个数,并且这个数字能写成1+2+3+....+x = ans这种形式. 要求的是最大的值. 这题就直接二分去做吧.二分出一个f(mid)<=n的最大值. 最后 ...
android 开发-Toast控件的实现
Toast吐司: Toast内容简单,不做过多介绍,Toast支持自带简单吐司,自定义吐司.内容简单可见代码,详见API.A toast provides simple feedback about ...
SpringBoot | 第九章：Mybatis-plus的集成和使用
前言本章节开始介绍数据访问方面的相关知识点.对于后端开发者而言,和数据库打交道是每天都在进行的,所以一个好用的ORM框架是很有必要的.目前,绝大部分公司都选择MyBatis框架作为底层数据库持久化框 ...
你还在为UiPath课程考试发愁吗？
刚开始学UiPath的时候,课程的考试难倒了很多人,有语言的原因也有对课程理解的原因,记忆中好像有一课考了5次估计,由于题库也就那么多,只要你努力考,总会过的. 学会了RPA的自动化工具,能否自动化答 ...
在txt文本后追加内容
public void CheckLog(string Log) { if (File.Exists(LogFile)) { ...

多GPU设备处理点积示例

多GPU设备处理点积示例的更多相关文章

随机推荐

热门专题