C++编程笔记(GPU并行编程-2)

C++与CUDA

内存管理

封装

利用标准库容器实现对GPU的内存管理

#include <iostream>

#include <cuda_runtime.h>

#include <vector>

#include <cstddef>

template<class T>

struct CUDA_Allocator {

  using value_type = T;  //分配器必须要有的

  T *allocate(size_t size) {

    T *dataPtr = nullptr;

    cudaError_t err = cudaMallocManaged(&dataPtr, size * sizeof(T));

    if (err != cudaSuccess) {

      return nullptr;

    }

    return dataPtr;

  }

  void deallocate(T *ptr, size_t size = 0) {

    cudaError_t err = cudaFree(ptr);

  }

};

__global__ void kernel(int *arr, int arrLen) {

  for (int i = blockDim.x * blockIdx.x + threadIdx.x; i < arrLen; i += blockDim.x * gridDim.x) {

    arr[i] = i;

    //printf("i=%d\n", i);

  }

}

int main() {

  int size = 65523;

  std::vector<int, CUDA_Allocator<int>> arr(size);

  kernel<<<13, 28>>>(arr.data(), size);

  cudaError_t err = cudaDeviceSynchronize();

  if (err != cudaSuccess) {

    printf("Error:%s\n", cudaGetErrorName(err));

    return 0;

  }

  for (int i = 0; i < size; ++i) {

    printf("arr[%d]=%d\n", i, arr[i]);

  }

}

其中allocate和deallocate是必须实现的

这里不用默认的std::allocate,使用自己定义的分配器，使得内存分配在GPU上

vector是会自动初始化的，如果不想自动初始化的化，可以在分配器中自己写构造函数

关于分配器的更多介绍

函数调用

template<class Func>

__global__ void para_for(int n, Func func) {

  for (int i = blockDim.x * blockIdx.x + threadIdx.x; i < n; i += blockDim.x * gridDim.x) {

    func(i);

  }

}

//定义一个仿函数

struct MyFunctor {

  __device__ void operator()(int i) {

    printf("number %d\n", i);

  }

};

int main() {

  int size = 65513;

  para_for<<<13,33>>>(size,MyFunctor{});

  cudaError_t err = cudaDeviceSynchronize();

  if (err != cudaSuccess) {

    printf("Error:%s\n", cudaGetErrorName(err));

    return 0;

  }

}

同样的，lambda也是被支持的，但是要先在cmake中开启

target_compile_options(${PROJECT_NAME} PUBLIC $<$<COMPILE_LANGUAGE:CUDA>:--extended-lambda>)

lambda

lambda写法

  para_for<<<13, 33>>>(size, [] __device__(int i) { printf("number:%d\n", i); });

lambda捕获外部变量

一定要注意深拷贝和浅拷贝

如果这里直接捕获arr的话，是个深拷贝，这样是会出错的，因为拿到的arr是在CPU上的，而数据是在GPU上的，所以这里要浅拷贝指针，拿到指针的值，就是数据在GPU上的地址，这样就可以使用device函数对数据进行操作了

  std::vector<int, CUDA_Allocator<int>> arr(size);

  int*arr_ptr=arr.data();

  para_for<<<13, 33>>>(size, [=] __device__(int i) { arr_ptr[i] = i; });

  cudaError_t err = cudaDeviceSynchronize();

  if (err != cudaSuccess) {

    printf("Error:%s\n", cudaGetErrorName(err));

    return 0;

  }

  for (int i = 0; i < size; ++i) {

    printf("arr[%d]=%d\n", i, arr[i]);

  }

同时还可以这样捕获

  para_for<<<13, 33>>>(size, [arr=arr.data()] __device__(int i) { arr[i] = i; });

时间测试



#include <chrono>

#define TICK(x) auto bench_##x = std::chrono::steady_clock::now();

#define TOCK(x) std::cout << #x ": " << std::chrono::duration_cast<std::chrono::duration<double> >(std::chrono::steady_clock::now() - bench_##x).count() << "s" << std::endl;

int main(){

  int size = 65513;

  std::vector<float, CUDA_Allocator<float>> arr(size);

  std::vector<float> cpu(size);

  TICK(cpu_sinf)

  for (int i = 0; i < size; ++i) {

    cpu[i] = sinf(i);

  }

  TOCK(cpu_sinf)

  TICK(gpu_sinf)

  para_for<<<16, 64>>>(

      size, [arr = arr.data()] __device__(int i) { arr[i] = sinf(i); });

  cudaError_t err = cudaDeviceSynchronize();

  TOCK(gpu_sinf)

  if (err != cudaSuccess) {

    printf("Error:%s\n", cudaGetErrorName(err));

    return 0;

  }

}

结果:

可以看到，求正弦GPU是要快于CPU的，这里差距还不明显，一般来说速度是由数量级上的差距的

学习链接

C++编程笔记(GPU并行编程-2)的更多相关文章

五浅谈CPU 并行编程和 GPU 并行编程的区别
前言 CPU 的并行编程技术,也是高性能计算中的热点,也是今后要努力学习的方向.那么它和 GPU 并行编程有何区别呢? 本文将做出详细的对比,分析各自的特点,为将来深入学习 CPU 并行编程技术打下铺 ...
第五篇：浅谈CPU 并行编程和 GPU 并行编程的区别
前言 CPU 的并行编程技术,也是高性能计算中的热点,也是今后要努力学习的方向.那么它和 GPU 并行编程有何区别呢? 本文将做出详细的对比,分析各自的特点,为将来深入学习 CPU 并行编程技术打下铺 ...
三 GPU 并行编程的运算架构
前言 GPU 是如何实现并行的?它实现的方式较之 CPU 的多线程又有什么分别?本文将做一个较为细致的分析. GPU 并行计算架构 GPU 并行编程的核心在于线程,一个线程就是程序中的一个单一指令流, ...
第三篇：GPU 并行编程的运算架构
前言 GPU 是如何实现并行的?它实现的方式较之 CPU 的多线程又有什么分别? 本文将做一个较为细致的分析. GPU 并行计算架构 GPU 并行编程的核心在于线程,一个线程就是程序中的一个单一指令流 ...
四 GPU 并行编程的存储系统架构
前言在用 CUDA 对 GPU 进行并行编程的过程中,除了需要对线程架构要有深刻的认识外,也需要对存储系统架构有深入的了解. 这两个部分是 GPU 编程中最为基础,也是最为重要的部分,需要花时间去理 ...
第四篇：GPU 并行编程的存储系统架构
前言在用 CUDA 对 GPU 进行并行编程的过程中,除了需要对线程架构要有深刻的认识外,也需要对存储系统架构有深入的了解. 这两个部分是 GPU 编程中最为基础,也是最为重要的部分,需要花时间去理 ...
【并行计算-CUDA开发】GPU并行编程方法
转载自:http://blog.sina.com.cn/s/blog_a43b3cf2010157ph.html 编写利用GPU加速的并行程序有多种方法,归纳起来有三种: 1. 利用现有的G ...
大数据学习笔记3 - 并行编程模型MapReduce
分布式并行编程用于解决大规模数据的高效处理问题.分布式程序运行在大规模计算机集群上,集群中计算机并行执行大规模数据处理任务,从而获得海量计算能力. MapReduce是一种并行编程模型,用于大规模数据 ...
C#并发编程之初识并行编程
写在前面之前微信公众号里有一位叫sara的朋友建议我写一下Parallel的相关内容,因为手中商城的重构工作量较大,一时之间无法抽出时间.近日,这套系统已有阶段性成果,所以准备写一下Parallel ...
GPU并行编程小结
http://peghoty.blog.163.com/blog/static/493464092013016113254852/ http://blog.csdn.net/augusdi/artic ...

随机推荐

java多线程实例程序实现与思想
写程序之前要了解两个概念 1.什么是进程 2.什么是线程搞清楚这两个概念之后才能写好一个合适而不会太抽象的程序对进程和线程的理解见链接: https://blog.csdn.net/new_te ...
Prometheus 监控 Kubernetes Job 资源误报的坑
转载自:https://www.qikqiak.com/post/prometheus-monitor-k8s-job-trap/ 昨天在 Prometheus 课程辅导群里面有同学提到一个问题,是关 ...
连接Vue.js作为前端，Fastapi作为后端
项目结构 ├── main.py └── templates └── home.html 环境安装 pip install fastapi[all] pip install jinja2 Backen ...
Elasticsearch与MySQL对应关系表
MySQL 中的数据库(DataBase),等价于 ES 中的索引(Index). MySQL 中一个数据库下面有 N 张表(Table),等价于1个索引 Index 下面有 N 多类型(Type). ...
MySQL学习(1)---MySQL概述
什么是数据库概述数据库(Database)是长期存储在计算机内有组织.大量.共享的数据集合.它可以供各种用户共享,具有最小冗余度和较高的数据独立性.数据库管理系统DBMS(Database Man ...
NSIS 去除字串中的汉字
!include "LogicLib.nsh" XPStyle on !include "WordFunc.nsh" #编写,水晶石 #去除字串中的汉字 #本例 ...
Jquery封装的ajax的使用过程发生的问题
Jquery封装的ajax的使用过程发生的问题今天在做项目的时候使用到了ajax来完成项目前后端数据交互,在之后发现在前端没有数据显示,而后端数据确实存在,在多次检查代码之后,发现代码并不存在问题, ...
Leetcode栈&队列
Leetcode栈&队列 232.用栈实现队列题干: 思路: 栈是FILO,队列是FIFO,所以如果要用栈实现队列,目的就是要栈实现一个FIFO的特性. 具体实现方法可以理解为,准备两个栈, ...
Shading-JDBC、ShadingSphere、ShardingProxy 使用详解
ShadingSphere ShardingSphere是一款起源于当当网内部的应用框架,2015年在当当网内部诞生,2016年由主要开发人员张亮带入京东数科,在国内经历了当当网.电信翼支付.京东数 ...
如何实现通过Leaflet加载dwg格式的CAD图
前言在前面介绍了通过openlayers加载dwg格式的CAD图并与互联网地图叠加,openlayers功能很全面,但同时也很庞大,入门比较难,适合于大中型项目中.而在中小型项目中,一般用开源的 ...