3赞

踩坑:pytorch中eval模式下结果远差于train模式介绍

作者：coco2冰冰 | 2022-10-15 05:15

这篇文章主要介绍了踩坑:pytorch中eval模式下结果远差于train模式介绍，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧

首先，eval模式和train模式得到不同的结果是正常的。我的模型中，eval模式和train模式不同之处在于Batch Normalization和Dropout。Dropout比较简单，在train时会丢弃一部分连接，在eval时则不会。Batch Normalization，在train时不仅使用了当前batch的均值和方差，也使用了历史batch统计上的均值和方差，并做一个加权平均（momentum参数）。在test时，由于此时batchsize不一定一致，因此不再使用当前batch的均值和方差，仅使用历史训练时的统计值。

我出bug的现象是，train模式下可以收敛，但一旦在测试中切换到了eval模式，结果就很差。如果在测试中仍沿用train模式，反而可以得到不错的结果。为了确保是程序bug而不是算法本身就不适合于预测，我在测试时再次使用了训练集，正常情况下此时应发生过拟合，正确率一定会很高，然而eval模式下正确率仍然很低。参照网上的一些说法（Performance highly degraded when eval() is activated in the test phase
），我调大了batchsize，降低了BN层的momentum，检查了是否存在不同层使用相同BN层的bug，均不见效。有一种方法说应在BN层设置track_running_stats为False，它虽然带来了好的效果，但实际上它只不过是不用eval模式，切回train模式罢了，所以也不对。

学习了在训练过程中，如何将BN层中统计的均值和方差输出。即在forward()中，

# bn是一个BN层，torch.nn.batch_normalization(...)
print(bn.running_mean)
print(bn.running_var)

同时学习了如何输出一个Tensor自身的均值和方差，即

# x是一个Tensor，dims是需要计算的维度
print(x.cpu().detach().numpy().mean(dims)
print(x.cpu().detach().numpy().var(dims)

观察每一层的输出结果，发现出现了很大的方差，才猛然意识到自己的输入数据没有做归一化（事后想想也确实如此，毕竟模型和训练方法都是github上参考别人的，出错概率很小；反而是自己写的DataSet部分，其实是最容易出错的）。给模型加上归一化后，eval和train的结果就没有问题了。

再次验证了我的观点：越是玄学的问题，越是傻逼的bug。

补充知识：Pytorch中的train和eval用法注意点

1.介绍

一般情况，model.train()是在训练的时候用到，model.eval()是在测试的时候用到

2.用法

如果模型中没有类似于BN这样的归一化或者Dropout，model.train()和model.eval()可以不要（建议写一下，比较安全），并且model.train()和model.eval()得到的效果是一样

如果模型中有类似于BN这样的归一化或者Dropout，并且程序需要边训练和边测试，最好就是用model.eval()测试完之后，后面补一个model.train()。

其中model.train()是保证BN用每一批数据的均值和方差，而model.eval()是保证BN用全部训练数据的均值和方差；而对于Dropout，model.train()是随机取一部分网络连接来训练更新参数，而model.eval()是利用到了所有网络连接（结果是取了平均）

以上这篇踩坑:pytorch中eval模式下结果远差于train模式介绍就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持。

推荐阅读

程序员
我应该在哪里将js脚本文件放在mvc应用程序中,以便jquery运行良好？

如何解决《我应该在哪里将js脚本文件放在mvc应用程序中,以便jquery运行良好？》经验，为你挑选了1个好方法。 ... [详细]
程序员
在应用程序中发出GET请求时ECONNREFUSED,但API成功返回JSON

如何解决《在应用程序中发出GET请求时ECONNREFUSED,但API成功返回JSON》经验，为你挑选了1个好方法。 ... [详细]
程序员
在后台线程中执行OkHttp网络操作

如何解决《在后台线程中执行OkHttp网络操作》经验，为你挑选了1个好方法。 ... [详细]
程序员
在Phoenix Framework中集成Bootstrap主题

如何解决《在PhoenixFramework中集成Bootstrap主题》经验，为你挑选了1个好方法。 ... [详细]
程序员
Laravel中的mergeBindings是什么意思

如何解决《Laravel中的mergeBindings是什么意思》经验，为你挑选了1个好方法。 ... [详细]
程序员
C#在枚举中更改项的int值

如何解决《C#在枚举中更改项的int值》经验，为你挑选了1个好方法。 ... [详细]
程序员
在Haskell中只获取Maybe的Value组件

如何解决《在Haskell中只获取Maybe的Value组件》经验，为你挑选了1个好方法。 ... [详细]
程序员
Google登录(iOS)使用后端服务器进行身份验证无效的颁发者错误

如何解决《Google登录(iOS)使用后端服务器进行身份验证无效的颁发者错误》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何从嵌套的json值中提取特定值？

如何解决《如何从嵌套的json值中提取特定值？》经验，为你挑选了1个好方法。 ... [详细]
程序员
节点js错误:不支持协议"https:".预计"http:"

如何解决《节点js错误:不支持协议"https:".预计"http:"》经验，为你挑选了3个好方法。 ... [详细]
程序员
Python/Django:RelatedObjectDoesNotExist:Cart没有用户

如何解决《Python/Django:RelatedObjectDoesNotExist:Cart没有用户》经验，为你挑选了1个好方法。 ... [详细]
程序员
SQL选择列以字母开头的位置

如何解决《SQL选择列以字母开头的位置》经验，为你挑选了1个好方法。 ... [详细]
程序员
套接字accept()后无法获取返回值

如何解决《套接字accept()后无法获取返回值》经验，为你挑选了1个好方法。 ... [详细]
程序员
在CakePHP 3中放置自定义PHP类的位置？

如何解决《在CakePHP3中放置自定义PHP类的位置？》经验，为你挑选了1个好方法。 ... [详细]
程序员
JS flie是什么

如何解决《JSflie是什么》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何避免LLVM的支持CommandLine泄漏库参数？

如何解决《如何避免LLVM的支持CommandLine泄漏库参数？》经验，为你挑选了1个好方法。 ... [详细]
程序员
ElasticSearch:如何在一个或多个索引中的所有类型的任何字段中搜索值？

如何解决《ElasticSearch:如何在一个或多个索引中的所有类型的任何字段中搜索值？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在swift 2.0中处理连续多次尝试

如何解决《如何在swift2.0中处理连续多次尝试》经验，为你挑选了1个好方法。 ... [详细]
程序员
无法恢复/删除/更新NuGet包,因为上述版本不再可用

如何解决《无法恢复/删除/更新NuGet包,因为上述版本不再可用》经验，为你挑选了2个好方法。 ... [详细]
程序员
'is'运算符与非缓存整数意外地运行

如何解决《'is'运算符与非缓存整数意外地运行》经验，为你挑选了2个好方法。 ... [详细]

coco2冰冰

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章