神经网络入门篇：详解随机初始化（Random+Initialization）

当训练神经网络时，权重随机初始化是很重要的。对于逻辑回归，把权重初始化为0当然也是可以的。但是对于一个神经网络，如果把权重或者参数都初始化为0，那么梯度下降将不会起作用。

来看看这是为什么。

有两个输入特征，\(n^{[0]} = 2\)，2个隐藏层单元\(n^{[1]}\)就等于2。

因此与一个隐藏层相关的矩阵，或者说\(W^{[1]}\)是2*2的矩阵，假设把它初始化为0的2*2矩阵，\(b^{[1]}\)也等于 \([0\;0]^T\)，把偏置项\(b\)初始化为0是合理的，但是把\(w\)初始化为0就有问题了。

那这个问题如果按照这样初始化的话，总是会发现\(a_{1}^{[1]}\) 和 \(a_{2}^{[1]}\)相等，这个激活单元和这个激活单元就会一样。因为两个隐含单元计算同样的函数，当做反向传播计算时，这会导致\(\text{dz}_{1}^{[1]}\) 和 \(\text{dz}_{2}^{[1]}\)也会一样，对称这些隐含单元会初始化得一样，这样输出的权值也会一模一样，由此\(W^{[2]}\)等于\([0\;0]\)；

图1.11.1

但是如果这样初始化这个神经网络，那么这两个隐含单元就会完全一样，因此他们完全对称，也就意味着计算同样的函数，并且肯定的是最终经过每次训练的迭代，这两个隐含单元仍然是同一个函数，令人困惑。\(dW\)会是一个这样的矩阵，每一行有同样的值因此做权重更新把权重\(W^{[1]}\implies{W^{[1]}-adW}\)每次迭代后的\(W^{[1]}\)，第一行等于第二行。

由此可以推导，如果把权重都初始化为0，那么由于隐含单元开始计算同一个函数，所有的隐含单元就会对输出单元有同样的影响。一次迭代后同样的表达式结果仍然是相同的，即隐含单元仍是对称的。通过推导，两次、三次、无论多少次迭代，不管训练网络多长时间，隐含单元仍然计算的是同样的函数。因此这种情况下超过1个隐含单元也没什么意义，因为他们计算同样的东西。当然更大的网络，比如有3个特征，还有相当多的隐含单元。

如果要初始化成0，由于所有的隐含单元都是对称的，无论运行梯度下降多久，他们一直计算同样的函数。这没有任何帮助，因为想要两个不同的隐含单元计算不同的函数，这个问题的解决方法就是随机初始化参数。应该这么做：把\(W^{[1]}\)设为np.random.randn(2,2)(生成高斯分布)，通常再乘上一个小的数，比如0.01，这样把它初始化为很小的随机数。然后\(b\)没有这个对称的问题（叫做symmetry breaking problem），所以可以把 \(b\) 初始化为0，因为只要随机初始化\(W\)就有不同的隐含单元计算不同的东西，因此不会有symmetry breaking问题了。相似的，对于\(W^{[2]}\)可以随机初始化，\(b^{[2]}\)可以初始化为0。

\(W^{[1]} = np.random.randn(2,2)\;*\;0.01\;,\;b^{[1]} = np.zeros((2,1))\)

\(W^{[2]} = np.random.randn(2,2)\;*\;0.01\;,\;b^{[2]} = 0\)

也许会疑惑，这个常数从哪里来，为什么是0.01，而不是100或者1000。通常倾向于初始化为很小的随机数。因为如果用tanh或者sigmoid激活函数，或者说只在输出层有一个Sigmoid，如果（数值）波动太大，当计算激活值时\(z^{[1]} = W^{[1]}x + b^{[1]}\;,\;a^{[1]} = \sigma(z^{[1]})=g^{[1]}(z^{[1]})\)如果\(W\)很大，\(z\)就会很大或者很小，因此这种情况下很可能停在tanh/sigmoid函数的平坦的地方(见图3.8.2)，这些地方梯度很小也就意味着梯度下降会很慢，因此学习也就很慢。

回顾一下：如果\(w\)很大，那么很可能最终停在（甚至在训练刚刚开始的时候）\(z\)很大的值，这会造成tanh/Sigmoid激活函数饱和在龟速的学习上，如果没有sigmoid/tanh激活函数在整个的神经网络里，就不成问题。但如果做二分类并且的输出单元是Sigmoid函数，那么不会想让初始参数太大，因此这就是为什么乘上0.01或者其他一些小数是合理的尝试。对于\(w^{[2]}\)一样，就是np.random.randn((1,2))，猜会是乘以0.01。

事实上有时有比0.01更好的常数，当训练一个只有一层隐藏层的网络时（这是相对浅的神经网络，没有太多的隐藏层），设为0.01可能也可以。但当训练一个非常非常深的神经网络，可能要试试0.01以外的常数。无论如何它通常都会是个相对小的数。

好了，看完神经网络入门篇。就已经知道如何建立一个一层的神经网络了，初始化参数，用前向传播预测，还有计算导数，结合反向传播用在梯度下降中。

神经网络入门篇：详解随机初始化（Random+Initialization）的更多相关文章

PHP函数篇详解十进制、二进制、八进制和十六进制转换函数说明
PHP函数篇详解十进制.二进制.八进制和十六进制转换函数说明作者: 字体:[增加减小] 类型:转载中文字符编码研究系列第一期,PHP函数篇详解十进制.二进制.八进制和十六进制互相转换函数说明 ...
走向DBA[MSSQL篇] 详解游标
原文:走向DBA[MSSQL篇] 详解游标前篇回顾:上一篇虫子介绍了一些不常用的数据过滤方式,本篇详细介绍下游标. 概念简单点说游标的作用就是存储一个结果集,并根据语法将这个结果集的数据逐条处理. ...
java 日志体系（三）log4j从入门到详解
java 日志体系(三)log4j从入门到详解一.Log4j 简介在应用程序中添加日志记录总的来说基于三个目的: 监视代码中变量的变化情况,周期性的记录到文件中供其他应用进行统计分析工作: 跟踪代 ...
Scala进阶之路-Scala函数篇详解
Scala进阶之路-Scala函数篇详解作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.传值调用和传名调用 /* @author :yinzhengjie Blog:http: ...
（十八）整合Nacos组件，环境搭建和入门案例详解
整合Nacos组件,环境搭建和入门案例详解 1.Nacos基础简介 1.1 关键特性 1.2 专业术语解释 1.3 Nacos生态圈 2.SpringBoot整合Nacos 2.1 新建配置 2.2 ...
【深度学习系列】手写数字识别卷积神经--卷积神经网络CNN原理详解(一)
上篇文章我们给出了用paddlepaddle来做手写数字识别的示例,并对网络结构进行到了调整,提高了识别的精度.有的同学表示不是很理解原理,为什么传统的机器学习算法,简单的神经网络(如多层感知机)都可 ...
【深度学习系列】卷积神经网络CNN原理详解(一)——基本原理
上篇文章我们给出了用paddlepaddle来做手写数字识别的示例,并对网络结构进行到了调整,提高了识别的精度.有的同学表示不是很理解原理,为什么传统的机器学习算法,简单的神经网络(如多层感知机)都可 ...
es6入门4--promise详解
可以说每个前端开发者都无法避免解决异步问题,尤其是当处理了某个异步调用A后,又要紧接着处理其它逻辑,而最直观的做法就是通过回调函数(当然事件派发也可以)处理,比如: 请求A(function (请求响 ...
Django入门基础详解
本次使用django版本2.1.2 安装django 安装最新版本 pip install django 安装指定版本 pip install django==1.10.1 查看本机django版本 ...
日志处理(一) log4j 入门和详解(转)
log4j 入门. 详解转自雪飘寒的文章 1. Log4j 简介在应用程序中添加日志记录总的来说基于三个目的: 监视代码中变量的变化情况,周期性的记录到文件中供其他应用进行统计分析工作 ...

随机推荐

看，这些 plugins 常用又简单
前面文章中体验了webpack的打包 .解析css资源 .处理图片字体等文件接下来看看 plugins 有什么作用吧~ 项目路径如下,和上一篇处理图片字体等文件项目保持一致 demo ├─ s ...
当 GPT-4 拥有了 Diff 视图，那真的是如虎添翼！
目录 1. 当你要求 GPT-4 帮你写点代码时 2. 你需要的背景知识都在这里 2.1 关于 GoPool 和 DevChat 2.2 关于 GoPool 的工作原理 2.3 我想要让 taskQu ...
#Powerbi 1分钟学会，RANK函数，多字段排名函数.
一:思维导图&数据源示例 1.1思维导图 1.2示例数据源二:参数构成三:案例度量值基础度量值总销量 = CALCULATE(SUM('数据源'[销量])) 总销售额 = CALCUL ...
mall ：rabbit项目源码解析
目录一.mall开源项目 1.1 来源 1.2 项目转移 1.3 项目克隆二.RabbitMQ 消息中间件 2.1 rabbit简介 2.2 分布式后端项目的使用流程 2.3 分布式后端项目的使用 ...
用了这么久SpringBoot却还不知道的一个小技巧
前言你可能调第三方接口喜欢启动application,修改,再启动,再修改,顺便还有个不喜欢写JUnitTest的习惯. 你可能有一天想要在SpringBoot启动后,立马想要干一些事情,现在没有可 ...
ArcMap中矢量数据修改标注Label的方法
本文介绍在ArcMap软件中,修改图层标签(Label)所显示字段与具体显示内容的方法. 在之前的文章中,我们看到了ArcMap中修改图层标签的重要性:可是,如何自定义图层的标签内容呢? ...
文心一言 VS 讯飞星火 VS chatgpt （86）-- 算法导论8.2 3题
三.用go语言,假设我们在 COUNTING-SORT的第 10行循环的开始部分,将代码改写为: 10 for j = 1 to A.length 试证明该算法仍然是正确的.它还稳定吗? 文心一言: ...
如何对MongoDB进行测试
一.环境搭建关于环境搭建,最好的搭建方式,当然是脚本一键式搭建我这里是centos6 x64版本的linux上进行构建,这个linux版本现在应该是大部分的主流服务器的标配版本下面是安装脚本的编 ...
Java并发Map的面试指南：线程安全数据结构的奥秘
简介在计算机软件开发的世界里,多线程编程是一个重要且令人兴奋的领域.然而,与其引人入胜的潜力相伴而来的是复杂性和挑战,其中之一就是处理共享数据.当多个线程同时访问和修改共享数据时,很容易出现各种问题 ...
js递归查询之根据id查询当前对象
需求:递归查询数组中id对应的数据 Json数据格式: 1 let cityArr = [ 2 { 3 id: 1000, 4 name: '四川省', 5 children: [ 6 { 7 id: ...

神经网络入门篇：详解随机初始化（Random+Initialization）

神经网络入门篇：详解随机初始化（Random+Initialization）的更多相关文章

随机推荐

热门专题