今天买了本新书《高性能CUDA应用设计与开发方法与最佳实践》,今天读了第一章有点出获,分享给大家。

程序功能:给向量填充数据并计算各元素之和

1. CPU串行运行的代码:

//seqSerial.cpp:串行执行数组的填充及求和

#include<iostream>

#include<vector>

using namespace std;

int main()

{

 const int N=50000;
 //任务1:创建数组

 vector<int> a(N);
 //任务2:填充数组

 for(int i=0;i<N;i++)a[i]=i;
 //任务3:计算数组各元素之和

 int sumA=0;

 for(int i=0;i<N;i++)sumA+=a[i];

 //任务4:计算0-N-1之和

 int sumCheck=0;

 for(int i=0;i<N;i++)sumCheck+=i;

 //任务5:检查结果是否正确

 if(sumA==sumCheck) cout<<"Test Succeeded!"<<endl;

 else {cerr<<"TestFailed!"<<endl;return(1);}

 return (0);

}

2.Cuda Thrust C++ API 程序

#include<iostream>

using namespace std;

#include<thrust\/reduce.h>

#include<thrust/sequence.h>

#include<thrust/host_vector.h>

#include<thrust/device_vector.h>

int main()

{

 const int N=50000;
 //任务1:创建数组

 thrust::device_vector<int>a(N);
 //任务2:填充数组,并行运算

 thrust::sequence(a.begin(),a.end(),0);

 //任务3:计算数组元素之和,并行计算
 int sumA=thrust::reduce(a.begin(),a.end(),0);

 //

 int sumCheck=0;

 for(int i=0;i<N;i++)

  sumCheck+=i;

 //

 if(sumA==sumCheck)cout<<"Test Succeeded!"<<endl;

 else

 {

  cerr<<"Test Failed!"<<endl;

  return(1);

 }

 getchar();

 return (0);

}

3.仅对数据填充改为Runtime API 程序

//使用cuda Runtime API完成向数组中填充连续整数
#include<iostream>

using namespace std;

#include<thrust\/reduce.h>

#include<thrust/sequence.h>

#include<thrust/host_vector.h>

#include<thrust/device_vector.h>

__global__ void fillKernel(int *a,int n)

{

 int tid=blockIdx.x*blockDim.x+threadIdx.x;

 if(tid<n) a[tid]=tid;

}

void fill(int *d_a,int n)

{

 int nThreadsPerBlock=512;

 //int nBlocks=n/nThreadsPerBlock+(n%nThreadsPerBlock)?1:0);

 int nBlocks=(n+nThreadsPerBlock)/nThreadsPerBlock;

 fillKernel<<<nBlocks,nThreadsPerBlock>>>(d_a,n);

}

int main()

{

 const int N=50000;

 //任务1:创建数组
 thrust::device_vector<int>a(N);

 //任务2:填充数组,使用Runtime API 填充数组
 fill(thrust::raw_pointer_cast(&a[0]),N);

 //任务3:计算数组元素之和,并行计算
 int sumA=thrust::reduce(a.begin(),a.end(),0);

 //任务4:计算0-N-1之和
 int sumCheck=0;

 for(int i=0;i<N;i++)

  sumCheck+=i;

 //任务5:检查结果的正确性
 if(sumA==sumCheck)cout<<"Test Succeeded!"<<endl;

 else

 {

  cerr<<"Test Failed!"<<endl;

  return(1);

 }

 getchar();

 return (0);

}

【CUDA开发】Cuda C++ Thrust API与 Cuda Runtime API程序比较的更多相关文章

  1. 【CUDA开发】CUDA面内存拷贝用法总结

    [CUDA开发]CUDA面内存拷贝用法总结 标签(空格分隔): [CUDA开发] 主要是在调试CUDA硬解码并用D3D9或者D3D11显示的时候遇到了一些代码,如下所示: CUdeviceptr g_ ...

  2. 【并行计算-CUDA开发】【视频开发】ffmpeg Nvidia硬件加速总结

    2017年5月25日 0. 概述 FFmpeg可通过Nvidia的GPU进行加速,其中高层接口是通过Video Codec SDK来实现GPU资源的调用.Video Codec SDK包含完整的的高性 ...

  3. 【ARM-Linux开发】【CUDA开发】【深度学习与神经网络】Jetson Tx2安装相关之三

    JetPack(Jetson SDK)是一个按需的一体化软件包,捆绑了NVIDIA®Jetson嵌入式平台的开发人员软件.JetPack 3.0包括对Jetson TX2 , Jetson TX1和J ...

  4. 【CUDA开发】CUDA编程接口(一)------一十八般武器

    子曰:工欲善其事,必先利其器.我们要把显卡作为通用并行处理器来做并行算法处理,就得知道CUDA给我提供了什么样的接口,就得了解CUDA作为通用高性能计算平台上的一十八般武器.(如果你想自己开发驱动,自 ...

  5. 【并行计算与CUDA开发】英伟达硬件加速编解码

    硬件加速 并行计算 OpenCL OpenCL API VS SDK 英伟达硬件编解码方案 基于 OpenCL 的 API 自己写一个编解码器 使用 SDK 中的编解码接口 使用编码器对于 OpenC ...

  6. 【CUDA开发】CUDA从入门到精通

    CUDA从入门到精通(零):写在前面 在老板的要求下,本博主从2012年上高性能计算课程开始接触CUDA编程,随后将该技术应用到了实际项目中,使处理程序加速超过1K,可见基于图形显示器的并行计算对于追 ...

  7. 关于CUDA两种API:Runtime API 和 Driver API

                 CUDA 眼下有两种不同的 API:Runtime API 和 Driver API,两种 API 各有其适用的范围. 高级API(cuda_runtime.h)是一种C++ ...

  8. Windows平台CUDA开发之前的准备工作

    CUDA是NVIDIA的GPU开发工具,眼下在大规模并行计算领域有着广泛应用. windows平台上面的CUDA开发之前.最好去NVIDIA官网查看说明,然后下载对应的driver. ToolKits ...

  9. 【神经网络与深度学习】【CUDA开发】caffe-windows win32下的编译尝试

    [神经网络与深度学习][CUDA开发]caffe-windows win32下的编译尝试 标签:[神经网络与深度学习] [CUDA开发] 主要是在开发Qt的应用程序时,需要的是有一个使用的库文件也只是 ...

随机推荐

  1. BZOJ 2219 数论之神 (CRT推论+BSGS+原根指标)

    看了Po神的题解一下子就懂了A了! 不过Po神的代码出锅了-solve中"d-temp"并没有什么用QwQQwQQwQ-应该把模数除以p^temp次方才行. 来自BZOJ讨论板的h ...

  2. docker限制容器日志大小

    1.新建/etc/docker/daemon.json,若有就不用新建了.添加log-dirver和log-opts参数,样例如下: # vim /etc/docker/daemon.json { & ...

  3. 5 解析器、url路由控制、分页、渲染器和版本

    1 数据解析器 1 什么是解析器 相当于request 中content-type 对方传什么类型的数据,我接受什么样的数据:怎样解析 无论前面传的是什么数据,都可以解开 例如:django不能解析j ...

  4. 题解 [HNOI2004]宠物收养场

    解析 这题似乎是裸的平衡树\(+\)模拟...于是用\(treap\)写了个板子. 看上去,我们似乎要维护两颗树(宠物和顾客), 然而,注意到,同一时间宠物点只有一类人(或物qwq), 所以,只要判断 ...

  5. php+大视频文件上传+进度条

    该项目核心就是文件分块上传.前后端要高度配合,需要双方约定好一些数据,才能完成大文件分块,我们在项目中要重点解决的以下问题. * 如何分片: * 如何合成一个文件: * 中断了从哪个分片开始. 如何分 ...

  6. luoguP2863 [USACO06JAN]牛的舞会The Cow Prom

    P2863 [USACO06JAN]牛的舞会The Cow Prom 123通过 221提交 题目提供者 洛谷OnlineJudge 标签 USACO 2006 云端 难度 普及+/提高 时空限制 1 ...

  7. NOI 2017滚粗退役记

    NOI 2017 游记 又到了OIer退役了的季节 Day -1 今天是报到日. 中午11点多的动车.动车上和dick32165401和runzhe2000谈笑风生.顺便用dick32165401的流 ...

  8. 灰度图像--频域滤波 傅里叶变换之连续信号傅里叶变换(FT)

    学习DIP第20天 转载请标明本文出处:http://blog.csdn.net/tonyshengtan,欢迎大家转载,发现博客被某些论坛转载后,图像无法正常显示,无法正常表达本人观点,对此表示很不 ...

  9. Spring——5种增强方式

    一.前置增强 二.后置增强 三.环绕增强  环绕增强相当于前置增强和后置增强的结合体,可以使用<aop:around>进行处理,这里我采用代理工厂的方式 1.接口及其实现类 public ...

  10. jq获取页面中checkbox已经选中的checkbox

    var len=$("input[name='bike']:checked").length; //len为0未选中