pytorch loss反向传播出错的解决方案

2025-02-20 14:49:20

今天在使用pytorch进行训练，在运行 loss.backward() 误差反向传播时出错：

RuntimeError: grad can be implicitly created only for scalar outputs

File "train.py", line 143, in train
loss.backward()
File "/usr/local/lib/python3.6/dist-packages/torch/tensor.py", line 198, in backward
torch.autograd.backward(self, gradient, retain_graph, create_graph)
File "/usr/local/lib/python3.6/dist-packages/torch/autograd/__init__.py", line 94, in backward
grad_tensors = _make_grads(tensors, grad_tensors)
File "/usr/local/lib/python3.6/dist-packages/torch/autograd/__init__.py", line 35, in _make_grads
raise RuntimeError("grad can be implicitly created only for scalar outputs")
RuntimeError: grad can be implicitly created only for scalar outputs

问题分析：

因为我们在执行 loss.backward() 时没带参数，这与 loss.backward(torch.Tensor(1.0)) 是相同的，参数默认就是一个标量。

但是由于自己的loss不是一个标量，而是二维的张量，所以就会报错。

解决办法：

1. 给 loss.backward() 指定传递给后向的参数维度：

loss = criterion(pred, targets)
loss.backward()
# 改为：
loss = criterion(pred, targets)
loss.backward(loss.clone().detach())

2. 修改loss函数的输出维度

把张量的输出修改为标量，比如说多多个维度的loss求和或求均值等。此方法对于某些任务不一定适用，可以尝试自己修改。

criterion = nn.L1Loss(reduction='none')
# 把参数去掉，改为：
criterion = nn.L1Loss()

这里顺便介绍一下pytorch loss函数里面的reduction 参数

在新的pytorch版本里，使用reduction 参数取代了旧版本的size_average和reduce参数。

reduction 参数有三种选择：

'elementwise_mean'：为默认情况，表明对N个样本的loss进行求平均之后返回(相当于reduce=True，size_average=True);

'sum'：指对n个样本的loss求和(相当于reduce=True，size_average=False);

'none'：表示直接返回n分样本的loss(相当于reduce=False)

补充：在Pytorch下，由于反向传播设置错误导致 loss不下降的原因及解决方案

在Pytorch下，由于反向传播设置错误导致 loss不下降的原因及解决方案

刚刚接触深度学习一段时间，一直在研究计算机视觉方面，现在也在尝试实现自己的idea，从中也遇见了一些问题，这次就专门写一下，自己由于在反向传播（backward）过程中参数没有设置好，而导致的loss不下降的原因。

对于多个网络交替

描述

简单描述一下我的网络结构，我的网络是有上下两路，先对第一路网络进行训练，使用groud truth对这一路的结果进行监督loss_steam1，得到训练好的feature.然后再将得到的feature级联到第二路，通过网络得到最后的结果，再用groud truth进行监督loss。

整个网络基于VGG19网络，在pytorch下搭建，有GPU环境：

出现的情况，loss_steam1不怎么下降

这个问题确实折麽自己一段时间，结果发现自己出现了一个问题，下面将对这个问题进行分析和解答：

PyTorch梯度传递

在PyTorch中，传入网络计算的数据类型必须是Variable类型， Variable包装了一个Tensor，并且保存着梯度和创建这个Variablefunction的引用，换句话说，就是记录网络每层的梯度和网络图，可以实现梯度的反向传递.
则根据最后得到的loss可以逐步递归的求其每层的梯度，并实现权重更新。

在实现梯度反向传递时主要需要三步：

1、初始化梯度值：net.zero_grad() 清除网络状态

2、反向求解梯度：loss.backward() 反向传播求梯度

3、更新参数：optimizer.step() 更新参数

解决方案

自己在写代码的时候，还是没有对自己的代码搞明白。在反向求解梯度时，对第一路没有进行反向传播，这样肯定不能使这一路的更新，所以我就又加了一步：

loss_steam1.backward( retain_graph = True) //因为每次运行一次backward时，如果不加retain_graph = True，运行完后，计算图都会free掉。

loss.backward()

这样就够了么？我当时也是这么认为的结果发现loss_steam1还是没有降，又愁了好久，结果发现梯度有了，不更新参数，怎么可能有用！

optimizer_steam1.step() //这项必须加
optimizer.step()

哈哈！这样就完成了，效果也确实比以前好了很多。

以上为个人经验，希望能给大家一个参考，也希望大家多多支持我们。如有错误或未考虑完全的地方，望不吝赐教。

pytorch .detach() .detach_() 和 .data用于切断反向传播的实现

当我们再训练网络的时候可能希望保持一部分的网络参数不变,只对其中一部分的参数进行调整:或者值训练部分分支网络,并不让其梯度对主网络的梯度造成影响,这时候我们就需要使用detach()函数来切断一些分支的反向传播 1 detach()[source] 返回一个新的Variable,从当前计算图中分离下来的,但是仍指向原变量的存放位置,不同之处只是requires_grad为false,得到的这个Variable永远不需要计算其梯度,不具有grad. 即使之后重新将它的requires_grad
pytorch中的自定义反向传播,求导实例

pytorch中自定义backward()函数.在图像处理过程中,我们有时候会使用自己定义的算法处理图像,这些算法多是基于numpy或者scipy等包. 那么如何将自定义算法的梯度加入到pytorch的计算图中,能使用Loss.backward()操作自动求导并优化呢.下面的代码展示了这个功能` import torch import numpy as np from PIL import Image from torch.autograd import gradcheck class Bicu
PyTorch: 梯度下降及反向传播的实例详解

线性模型线性模型介绍线性模型是很常见的机器学习模型,通常通过线性的公式来拟合训练数据集.训练集包括(x,y),x为特征,y为目标.如下图: 将真实值和预测值用于构建损失函数,训练的目标是最小化这个函数,从而更新w.当损失函数达到最小时(理想上,实际情况可能会陷入局部最优),此时的模型为最优模型,线性模型常见的的损失函数: 线性模型例子下面通过一个例子可以观察不同权重(w)对模型损失函数的影响. #author:yuquanle #data:2018.2.5 #Study of Linear
pytorch 多个反向传播操作

之前我的一篇文章pytorch 计算图以及backward,讲了一些pytorch中基本的反向传播,理清了梯度是如何计算以及下降的,建议先看懂那个,然后再看这个. 从一个错误说起: RuntimeError: Trying to backward through the graph a second time, but the buffers have already been freed 在深度学习中,有些场景需要进行两次反向,比如Gan网络,需要对D进行一次,还要对G进行一次,很多人都会遇到
pytorch loss反向传播出错的解决方案

今天在使用pytorch进行训练,在运行 loss.backward() 误差反向传播时出错 : RuntimeError: grad can be implicitly created only for scalar outputs File "train.py", line 143, in train loss.backward() File "/usr/local/lib/python3.6/dist-packages/torch/tensor.py", li
pytorch损失反向传播后梯度为none的问题

错误代码:输出grad为none a = torch.ones((2, 2), requires_grad=True).to(device) b = a.sum() b.backward() print(a.grad) 由于.to(device)是一次操作,此时的a已经不是叶子节点了修改后的代码为: a = torch.ones((2, 2), requires_grad=True) c = a.to(device) b = c.sum() b.backward() print(a.grad)
PyTorch训练LSTM时loss.backward()报错的解决方案

训练用PyTorch编写的LSTM或RNN时,在loss.backward()上报错: RuntimeError: Trying to backward through the graph a second time, but the buffers have already been freed. Specify retain_graph=True when calling backward the first time. 千万别改成loss.backward(retain_graph=Tru
Pytorch反向传播中的细节-计算梯度时的默认累加操作

Pytorch反向传播计算梯度默认累加今天学习pytorch实现简单的线性回归,发现了pytorch的反向传播时计算梯度采用的累加机制, 于是百度来一下,好多博客都说了累加机制,但是好多都没有说明这个累加机制到底会有啥影响, 所以我趁着自己练习的一个例子正好直观的看一下以及如何解决: pytorch实现线性回归先附上试验代码来感受一下: torch.manual_seed(6) lr = 0.01 # 学习率 result = [] # 创建训练数据 x = torch.rand(20, 1
PyTorch梯度下降反向传播

前言: 反向传播的目的是计算成本函数C对网络中任意w或b的偏导数.一旦我们有了这些偏导数,我们将通过一些常数 α的乘积和该数量相对于成本函数的偏导数来更新网络中的权重和偏差.这是流行的梯度下降算法.而偏导数给出了最大上升的方向.因此,关于反向传播算法,我们继续查看下文. 我们向相反的方向迈出了一小步——最大下降的方向,也就是将我们带到成本函数的局部最小值的方向如题: 意思是利用这个二次模型来预测数据,减小损失函数(MSE)的值. 代码如下: import torch import matplo
pytorch训练神经网络爆内存的解决方案

训练的时候内存一直在增加,最后内存爆满,被迫中断. 后来换了一个电脑发现还是这样,考虑是代码的问题. 检查才发现我的代码两次存了loss,只有一个地方写的是loss.item().问题就在loss,因为loss是variable类型. 要写成loss_train = loss_train + loss.item(),不能直接写loss_train = loss_train + loss.否则就会发现随着epoch的增加,占的内存也在一点一点增加. 算是一个小坑吧,希望大家还是要仔细. 补充:py