关于cuda拷贝的速度测试

由于没有使用profiler,仅仅通过简单的传输函数测试,如下测试了10000个点,1000000个点,100000000个点的速度:

均按时钟周期来计时,通过MAX调整数据

int main(){

    clock_t start,finish;



    int *d_data,*h_data;

    h_data = (int *)calloc(MAX, sizeof(int));

    memset(h_data,0,MAX*sizeof(int));

    cudaMalloc((void **) &d_data,MAX*sizeof(int));





    start = clock();

    cudaMemcpy(d_data,h_data,MAX*sizeof(int),cudaMemcpyHostToDevice);

    cudaMemcpy(h_data,d_data,MAX*sizeof(int),cudaMemcpyDeviceToHost);

    finish = clock();





    cudaFree(d_data);

    free(h_data);

    cout<<"time is "<<finish-start<<endl;

    getchar();

return 0;

}

 

测试结果

测试结果 10,000个节点 1,000,000个节点 100,000,000个节点
第一次测试 0 7 822
第二次测试 0 8 715
第三次测试 1 7 696

测试图表如下:

关于cuda拷贝的速度测试

 

 

所以在小批量数组的情况下,完全可以在cpu中完成数据操作,然后device上面做简单的加和或者乘积运算。

你可能感兴趣的:(测试)