跳转到主内容
极星编程网:以代码为星,赴技术山海!

P100和P40,深度学习训练谁更强?

深度学习训练,P100和P40哪个更胜一筹?别急,这篇文章就来帮你揭晓答案。我们通过NVCaffe、MXNet、TensorFlow三个主流深度学习框架,对P100和P40进行了图像分类场景的卷积神经网络模型训练性能对比,让你一次性看懂它们的性能差异。

背景

去年NVIDIA推出了Tesla P100加速卡,速度是之前高端系统的12倍。同年,NVIDIA又发布了Tesla P4、P40两款深度学习芯片。P100主攻学习和训练任务,而P4和P40主要负责图像、文字和语音识别。虽然P40在Spec上看起来比P100更强,但实际情况如何呢?接下来,我们就通过实测数据来揭晓答案。

初步分析

从Spec参数来看,P40的单精运算能力确实强于P100,但深度学习训练普遍使用单精度浮点类型,这是衡量深度学习性能的一个重要指标。P40支持IN8类型,非常适合精度要求不高的推理场景,24G的显存也非常适合在线处理大数据量的图像等。然而,P100搭载的HBM2高速显存,而P40只搭载了GDDR5的显存,这使得P100的显存带宽达到了P40的2倍多,这是影响深度学习训练的另一个重要指标。接下来,我们通过实测数据来验证这一点。

实测数据

3.1 NVCaffe:GoogLeNet

使用ImageNet ILSVRC2012数据集进行测试,数据单位是Images/Second(每秒处理的图像张数),OOM表示Batch Size太大导致GPU显存不够。测试数据如下:

(此处应插入测试数据表格)

3.2 MXNet:Inception-v3

使用Benchmark模式测试Imagenet训练,数据单位samples/sec,测试数据如下:

(此处应插入测试数据表格)

3.3 TensorFlow:AlexNet

TensorFlow使用AlexNet Benchmark模式测试单GPU Forward和Forward-backward作为比较参考,数据单位sec/ batch,越小性能越好。P100与P40比较的单GPU测试数据如下:

(此处应插入测试数据表格)

测试结论

通过实测NVCaffe、MXNet、TensorFlow三个主流深度学习框架的图像分类训练性能,验证了我们前面的分析。P40虽然计算力优于P100,但受限于显存带宽,在深度学习训练上性能是不如P100的。通过实测数据,我们可以得出结论:P100比P40训练性能至少高出20%以上。

深度学习训练,选择P100就对了。阿里云上提供的GN5系列GPU实例,可搭载最多8块P100 GPU,可大大加速深度学习训练。搭载最新V100 GPU的GN6实例近期也已经上线公测,我们后续也会给出GN6实例的性能评测报告。

——苏承栈,极星编程网资深编辑

相关文章