pytorch-backword函数的理解

函数：\(tensor.backward(params)\)

这个params的维度一定要和tensor的一致，因为tensor如果是一个向量y = [y1,y2,y3]，那么传入的params=[a1,a2,a3]，这三个值是系数，那么是什么的系数呢？
假定对x =[ x1,x2]求导，那么我们知道，
\(dy/dx\) 为：
第一列： \(dy1/dx1,dy2/dx1,dy3/dx1\)
第二列：\(dy1/dx2, dy2/dx2,dy3/dx2\)
从而 \(dy/dx\)是一个3行2列的矩阵，每一列对应了对x1的导数，每一列也就是\(x1\)的梯度向量
而反向计算的时候，并不是返回这个矩阵，而是返回这个矩阵每列的和作为梯度，也就是：\(dy1/dx1+dy2/dx1+dy3/dx1\) 是y对x1的梯度
这就好理解了，系数为\(params=[a1,a2,a3]\)就对应了这加和的三项！也就是，对\(x1\)的梯度实际上是\(a1*dy1/dx1+a2*dy2/dx1+a3*dy3/dx1\)
而输出y是标量的时候，就不需要了，默认的就是\(1.\)

自己重写backward函数时，要写上一个grad_output参数，这个参数就是上面提到的params

这个grad_output参数究竟是什么呢？下面作出解释：
是这样的，假如网络有两层， h = h(x)，y = y(h)
你可以计算\(dy/dx\)，这样，y.backward(),因为\(dy/dy=1\)，那么，backward的参数就可以省略
如果计算h.backward()，因为你想求的是\(dy/dx\)，（这才是输出对于输入的梯度），那么，计算图中的y = y(h)就没有考虑到
因为\(dy/dx = dy/dh * dh/dx\)，h.backward()求得是\(dh/dx\)，那么你必须传入之前的梯度\(dy/dh\)才行，也就是说，h.backward(params=dy/dh)这里面的参数就是\(dy/dh\)

这就好理解了，如果我们自己实现了一层，继承自Function，自己实现静态方法forward和backward时，backward必须有个grad_output参数，这个参数就是计算图中输出对该自定义层的梯度，这样才能求出对输入的梯度。

另外，假设定义的层计算出的是y，调用的就是y.backward(grad_output)，这个里面的参数的维度必须和y是相同的。这也就是为什么前面提到对于输出是多维的，会有个“系数”的原因，这个系数就是后向传播时，该层之前的梯度的累积，这样与本层再累积，才实现了完整的链式法则，最终求出out对input的梯度。

另外，自定义实现forward和backward时，两函数的输入输出是有要求的，即forward的输入必须和~的return相对应，如forward的input有个w参数，那么backward的return就必须在对应的位置返回grad_w，因为只有这样，才能够对相应的输入参数梯度下降。

【pytorch】pytorch-backward()的理解的更多相关文章

ARTS-S pytorch中backward函数的gradient参数作用
导数偏导数的数学定义参考资料1和2中对导数偏导数的定义都非常明确.导数和偏导数都是函数对自变量而言.从数学定义上讲,求导或者求偏导只有函数对自变量,其余任何情况都是错的.但是很多机器学习的资料和开源 ...
Pytorch autograd,backward详解
平常都是无脑使用backward,每次看到别人的代码里使用诸如autograd.grad这种方法的时候就有点抵触,今天花了点时间了解了一下原理,写下笔记以供以后参考.以下笔记基于Pytorch1.0 ...
Pytorch 之 backward
首先看这个自动求导的参数: grad_variables:形状与variable一致,对于y.backward(),grad_variables相当于链式法则dz/dx=dz/dy × dy/dx 中 ...
[pytorch] Pytorch入门
Pytorch入门简单容易上手,感觉比keras好理解多了,和mxnet很像(似乎mxnet有点借鉴pytorch),记一记. 直接从例子开始学,基础知识咱已经看了很多论文了... import t ...
pytorch lstm crf 代码理解重点
好久没有写博客了,这一次就将最近看的pytorch 教程中的lstm+crf的一些心得与困惑记录下来. 原文 PyTorch Tutorials 参考了很多其他大神的博客,https://blog.c ...
pytorch lstm crf 代码理解
好久没有写博客了,这一次就将最近看的pytorch 教程中的lstm+crf的一些心得与困惑记录下来. 原文 PyTorch Tutorials 参考了很多其他大神的博客,https://blog.c ...
Pytorch的LSTM的理解
class torch.nn.LSTM(*args, **kwargs) 参数列表 input_size:x的特征维度 hidden_size:隐藏层的特征维度 num_layers:lstm隐层的层 ...
pytorch autograd backward函数中 retain_graph参数的作用，简单例子分析，以及create_graph参数的作用
retain_graph参数的作用官方定义: retain_graph (bool, optional) – If False, the graph used to compute the grad ...
pytorch的backward
在学习的过程中遇见了一个问题,就是当使用backward()反向传播时传入参数的问题: net.zero_grad() #所有参数的梯度清零 output.backward(Variable(t.on ...

随机推荐

2.4配置的热更新「深入浅出ASP.NET Core系列」
希望给你3-5分钟的碎片化学习,可能是坐地铁.等公交,积少成多,水滴石穿,谢谢关注. 大家知道通常我们修改网站的配置文件比如,webconfig的时候,网站需要重启才能读取到最新的修改,所谓热更新就是 ...
MySQL 笔记整理（11） --怎么给字符串字段加索引？
笔记记录自林晓斌(丁奇)老师的<MySQL实战45讲> (本篇内图片均来自丁奇老师的讲解,如有侵权,请联系我删除) 11) --怎么给字符串字段加索引? 日常工作中的登录系统,你很可能会使 ...
Yii2设计模式——Yii2中用到哪些设计模式？
"Yii2设计模式"包含了两个方面的内容:1.设计模式,2.Yii2框架. <设计模式>一书虽然以JAVA语言来表达设计模式的思想,但是设计模式远不限制于某一种特定的语 ...
通过JS动态的修改HTML元素的样式和增添标签元素等
一. 通过JS动态的修改HTML元素的样式 1. 要想在js中动态的修改HTML元素的样式,首先需要写document, document我们称之为文档对象,这个对象中保存了当前网页中所有的 ...
.net开源工作流引擎ccflow表单数据返回值Pop分组模式和表格模式对比
Pop分组模式和表格模式对比关键词: 驰骋工作流引擎表单引擎 ccflow .net开源工作流 jflow Java工作流引擎驰骋工作流程快速开发平台工作流程管理系统工作流引擎 a ...
Dynamics 365-为什么查到的Record的Id是Guid初始值
通过代码查询CRM数据,这个是开发经常会碰到的情况,获取返回的EntityCollection之后,我们会拿Entity.Id做进一步操作.笔者最近碰到的情况,是Entity.Id是个初始值.先上一段 ...
【Android】用Cubism 2制作自己的Live2D——官方App样例源码学习(4)！
前言- 这是最后一个重要的类了——LAppLive2DManager,流程什么的也清晰了,话不多说我们来康康吧! LAppLive2DManager- public class LAppLive2DM ...
node.js微信小程序配置消息推送
在开发微信小程序时,有一个消息推送,它的解释是这样的. 消息推送具体的内容是下面的这个网址 https://developers.weixin.qq.com/miniprogram/dev/fra ...
Jmeter 接口测试实战-有趣的cookie
Jmeter 接口测试实战-有趣的cookie 场景: 接口测试时常都需要登录,请求方式(post), 登录常用的方法有通过获取token, 获取session, 获取cookie, 等等. 这几种都 ...
IIS发布的网站，内网和外网不能访问的解决办法
A.关闭防火墙.控制面板-Windows防火墙-打开或关闭Windows防火墙(不推荐) B.打开:控制面板-Windows防火墙-高级设置-入站规则,在入站规则窗口中找到”BranchCache内容 ...

【pytorch】pytorch-backward()的理解

pytorch-backword函数的理解

【pytorch】pytorch-backward()的理解的更多相关文章

随机推荐

热门专题