作者：szx_spark

1. Padding

在卷积操作中，过滤器（又称核）的大小通常为奇数，如3x3，5x5。这样的好处有两点：

在特征图（二维卷积）中就会存在一个中心像素点。有一个中心像素点会十分方便，便于指出过滤器的位置。
在没有padding的情况下，经过卷积操作，输出的数据维度会减少。以二维卷积为例，输入大小 \(n\times n\)，过滤器大小\(f\times f\)，卷积后输出的大小为\((n-f+1)\times(n-f+1)\)。
为了避免这种情况发生，可以采取padding操作，padding的长度为\(p\)，由于在二维情况下，上下左右都“添加”长度为\(p\)的数据。构造新的输入大小为\((n+2p)\times(n+2p)\) , 卷积后的输出变为\((n+2p-f+1)\times(n+2p-f+1)\)。
如果想使卷积操作不缩减数据的维度，那么\(p\)的大小应为\((f-1)/2\)，其中\(f\)是过滤器的大小，该值如果为奇数，会在原始数据上对称padding，否则，就会出现向上padding 1个，向下padding 2个，向左padding 1个，向右padding 2个的情况，破坏原始数据结构。

2. Stride

卷积中的步长大小为\(s\)，指过滤器在输入数据上，水平/竖直方向上每次移动的步长，在Padding 公式的基础上，最终卷积输出的维度大小为：

\[\left \lfloor \frac{n+2p-f}{s}+1 \right \rfloor \times \left \lfloor \frac{n+2p-f}{s}+1 \right \rfloor\]

\(\left \lfloor \right\rfloor\)符号指向下取整，在python 中为floor地板除操作。

3. Channel

通道，通常指数据的最后一个维度（三维），在计算机视觉中，RGB代表着3个通道(channel)。

举例说明：现在有一张图片的大小为\(6\times 6\times 3\)，过滤器的大小为\(3\times 3\times n_c\), 这里\(n_c\)指过滤器的channel大小，该数值必须与输入的channel大小相同，即\(n_c=3\)。
如果有\(k\)个\(3\times 3\times n_c\)的过滤器，那么卷积后的输出维度为\(4\times 4\times k\)。注意此时\(p=0, s=1\)，\(k\)表示输出数据的channel大小。一般情况下，\(k\)代表\(k\)个过滤器提取的k个特征，如\(k=128\)，代表128个\(3\times 3\)大小的过滤器，提取了128个特征，且卷积后的输出维度为\(4\times 4\times 128\)。

在多层卷积网络中，以计算机视觉为例，通常情况下，图像的长和宽会逐渐缩小，channel数量会逐渐增加。

4. Pooling

除了卷积层，卷积网络使用池化层来缩减数据的大小，提高计算的速度，同时提高所提取特征的鲁棒性。池化操作不需要对参数进行学习，只是神经网络中的静态属性。
池化层中，数据的维度变化与卷积操作类似。池化后的channel数量与输入的channel数量相同，因为在每个channel上单独执行最大池化操作。
f=2, s=2，相当于对数据维度的减半操作，f指池化层过滤器大小，s指池化步长。

5. 卷积神经网络（CNN）示例

课堂笔记中关于简单卷积神经网络的介绍：

一个用于手写数字识别的CNN结构如下图所示：

该网络应用了两层卷积，并且在第二个池化层之后又接了几个全连接层，这样做的目的是避免某一层的激活值数量减少的太快，具体原因后文解释。

与卷积神经网络的参数数量计算相关的问题：

该手写数字识别的CNN具体参数数量可视化如下所示：

从图中可以发现，卷积层的参数数量较小，大部分参数集中在全连接层。而且随着网络层的加深，激活值数量逐渐减少，如果激活值数量下降太快，会影响网络的性能。
因此需要构建多个全连接层，而不是一个全连接层一步到位。

6. 卷积层的好处

与只用全连接层相比，卷积层的主要优点是参数共享和稀疏连接，这使得卷积操作所需要学习的参数数量大大减少。

吴恩达深度学习笔记（deeplearning.ai）之卷积神经网络（CNN）（上）的更多相关文章

【Deeplearning.ai 】吴恩达深度学习笔记及课后作业目录
吴恩达深度学习课程的课堂笔记以及课后作业代码下载:https://github.com/douzujun/Deep-Learning-Coursera 吴恩达推荐笔记:https://mp.weix ...
吴恩达深度学习笔记（deeplearning.ai）之卷积神经网络（一）
Padding 在卷积操作中,过滤器(又称核)的大小通常为奇数,如3x3,5x5.这样的好处有两点: 在特征图(二维卷积)中就会存在一个中心像素点.有一个中心像素点会十分方便,便于指出过滤器的位置. ...
吴恩达深度学习笔记（deeplearning.ai）之卷积神经网络（二）
经典网络 LeNet-5 AlexNet VGG Ng介绍了上述三个在计算机视觉中的经典网络.网络深度逐渐增加,训练的参数数量也骤增.AlexNet大约6000万参数,VGG大约上亿参数. 从中我们可 ...
吴恩达深度学习笔记（deeplearning.ai）之循环神经网络（RNN）（三）
1. 导读本节内容介绍普通RNN的弊端,从而引入各种变体RNN,主要讲述GRU与LSTM的工作原理. 事先声明,本人采用ng在课堂上所使用的符号系统,与某些学术文献上的命名有所不同,不过核心思想都是 ...
吴恩达深度学习笔记（八） —— ResNets残差网络
(很好的博客:残差网络ResNet笔记) 主要内容: 一.深层神经网络的优点和缺陷二.残差网络的引入三.残差网络的可行性四.identity block 和 convolutional bloc ...
吴恩达深度学习笔记（十二）—— Batch Normalization
主要内容: 一.Normalizing activations in a network 二.Fitting Batch Norm in a neural network 三.Why does ...
吴恩达深度学习笔记（七） —— Batch Normalization
主要内容: 一.Batch Norm简介二.归一化网络的激活函数三.Batch Norm拟合进神经网络四.测试时的Batch Norm 一.Batch Norm简介 1.在机器学习中,我们一般会 ...
吴恩达深度学习笔记1-神经网络的编程基础(Basics of Neural Network programming)
一:二分类(Binary Classification) 逻辑回归是一个用于二分类(binary classification)的算法.在二分类问题中,我们的目标就是习得一个分类器,它以对象的特征向量 ...
吴恩达深度学习笔记（十一）—— dropout正则化
主要内容: 一.dropout正则化的思想二.dropout算法流程三.dropout的优缺点一.dropout正则化的思想在神经网络中,dropout是一种“玄学”的正则化方法,以减少过拟合 ...

随机推荐

初识waindows窗体程序错题整理
解析:A:Items表示集合B:获取或设置 ComboBox 的可编辑部分中选定的文本.C:SelectedIndex是索引D:获取或设置控件中选定项的模板解析:本题目考不同窗体之间跳转的方法,使 ...
【JMeter】基础元件
测试计划(Test Plan) 它用来描述一个测试方案,包含与本次性能测试所有相关的功能.也就说本次测试的所有内容是于基于一个计划的. “函数测试模式”复选框,如果被选择,它会使Jmeter记录来自服 ...
python-面向对象-06_私有属性和私有方法
私有属性和私有方法 01. 应用场景及定义方式应用场景在实际开发中,对象的某些属性或方法可能只希望在对象的内部被使用,而不希望在外部被访问到私有属性就是对象不希望公开的属性私 ...
前端 HTML body标签相关内容常用标签列表标签 ul，ol,li
列表标签 ul,ol,li ul.ol.li标签都属于块级标签,独占一行网站页面上一些列表相关的内容比如说物品列表.人名列表等等都可以使用列表标签来展示.通常后面跟<li>标签一起用, ...
urllib2 python3错误？用from urllib import request来代替！
今天ytkah在一个python3项目要引用urllib2,可是提示ImportError: No module named 'urllib2'错误了.原来是urllib2可以在python2.x适用 ...
回文字符串 NYOJ
# include<iostream> # include<string> # include<string.h> # include<queue> # ...
关于spark的mllib学习总结（Java版）
本篇博客主要讲述如何利用spark的mliib构建机器学习模型并预测新的数据,具体的流程如下图所示: 加载数据对于数据的加载或保存,mllib提供了MLUtils包,其作用是Helper metho ...
[django]主次表如何取出对方数据[主表obj.子表__set()]
[sql]mysql管理手头手册,多对多sql逻辑国家--城市例子 class Country(models.Model): name = models.CharField(max_length=3 ...
tf中的run()与eval()【转载】
转自:https://blog.csdn.net/jiaoyangwm/article/details/79248535 1.eval() 其实就是tf.Tensor的Session.run() 的 ...
C语言中各个数据类型的取值范围
因为CPU的差异,各系统中的数据类型所占的字节数(bytes)不同,二进制位数(bit)也不同.那么怎样才能知道自己系统的数据类型的字节数,位数呢? 授之以鱼不如授之以渔,大家可以自己从电脑里获取这些 ...

吴恩达深度学习笔记（deeplearning.ai）之卷积神经网络（CNN）（上）