环境:win10,vs2015,cuda9.0,cudnn7.1.4
1,yolo v3,编译能通过,不能运行
2,自己的cifar10训练(cudnn封装的类),使用bn层增加,batch=32就会失败,batch=64就会正常,甚至要batch=128(使用5个bn层)
3,batch=128,6个bn层,失败,但是相同程序,相同配置,1060显卡,batch=32,6个bn层能成功运行!成绩只是不高!
4,还有就是,batch=128(使用5个bn层),测试时,batch=1,mx550会闪退,所以不得不重写了一个测试函数仿照训练模式!但是1060显卡正常(batch=32(使用5个bn层),测试时,batch=1)!
5,batch=128(使用5个bn层),运行成功,相同程序改成batch=64,5个bn层,会出现nan失败!
6,6*6,8*8的卷积也不能用!(cpu自己写程序,正常)
7,封装成类的层与cudnn api混合用在程序中,也会闪退!
8,但是只要程序正常运行,运行时间基本与1060显卡相同,cifar10训练1轮5万张图片,基本25秒时间
环境升级:win10,vs2015,cuda10.2,cudnn7.6下,
6个bn层,仍然失败,但是其他稳定多了,cifar10训练1轮5万张图片,基本60秒时间,性能下降了?!但是可以用compute_75了!
yolo v3可以正常运行(编译运行都正常!)