第四周

Model Representation I

让我们来看看如何使用神经网络来表示假设函数。在非常简单的水平上,神经元基本上是将输入(树突)作为输入到输出(轴突)的电输入(称为“尖峰”)的计算单元。在我们的模型中,我们的树突像输入特征x1 ... xn,输出是我们的假设函数的结果。在这个模型中,我们的x0输入节点有时被称为“偏置单元”。它总是等于1.在神经网络中,我们使用与分类11 + e-θTx相同的逻辑函数,但我们有时称之为S形(逻辑)激活函数。在这种情况下,我们的“theta”参数有时称为“权重”。

在视觉上,一个简单的表示形式如下:

⎡⎣x0x1x2⎤⎦→[ ]→hθ(x)

我们的输入节点(层1),也称为“输入层”,进入另一个节点(层2),其最终输出称为“输出层”的假设函数。

我们可以在输入和输出层之间有称为“隐藏层”的中间节点层。

在这个例子中,我们标记这些中间或“隐藏”层节点a 20 ... a 21n并将其称为“激活单元”。

a(j)i =层j中单元i的“激活”=控制从层j到层j + 1的函数映射的权重矩阵

a(j)i="activation" of unit i in layer j

Θ(j)=matrix of weights controlling function mapping from layer j to layer j+1

如果我们有一个隐藏层,它看起来像:

⎡⎣⎢⎢x0 x1 x2 x3⎤⎦⎥⎥→⎡⎣⎢⎢⎢a(2)1 a(2)2 a(2)3⎤⎦⎥⎥⎥→hθ(x)

每个“激活”节点的值如下获得:

a(2)1=g(Θ(1)10x0+Θ(1)11x1+Θ(1)12x2+Θ(1)13x3)

a(2)2=g(Θ(1)20x0+Θ(1)21x1+Θ(1)22x2+Θ(1)23x3)

a(2)3=g(Θ(1)30x0+Θ(1)31x1+Θ(1)32x2+Θ(1)33x3)

hΘ(x)=a(3)1=g(Θ(2)10a(2)0+Θ(2)11a(2)1+Θ(2)12a(2)2+Θ(2)13a(2)3)

这就是说,我们通过使用3×4的参数矩阵来计算我们的激活节点。我们将每行参数应用到我们的输入,以获得一个激活节点的值。我们的假设输出是应用于我们的激活节点的值的和的逻辑函数,其已经被包含用于我们的第二层节点的权重的又一参数矩阵Θ(2)相乘。

每个层获得其自己的权重矩阵Θ(j)。

这些权重矩阵的尺寸确定如下:

如果网络在层j中具有sj
个单元并且在层j
+ 1中具有sj+1
个单元,则Θ(j)将具有尺寸sj+1×(sj+1)。

+1来自“偏置节点”的Θ(j)中的加法,x0和Θ(j)0。换句话说,输出节点将不包括偏置节点,而输入将会。下面的图像总结了我们的模型表示:

示例:第1层有2个输入节点,第2层有4个激活节点。Θ(1)的尺寸将为4×3,其中sj=2
和sj+1=4,因此sj+1×(sj+1)=4×3。

Model
Representation II

为了重复,以下是神经网络的示例:

a(2)1=g(Θ(1)10x0+Θ(1)11x1+Θ(1)12x2+Θ(1)13x3)

a(2)2=g(Θ(1)20x0+Θ(1)21x1+Θ(1)22x2+Θ(1)23x3)

a(2)3=g(Θ(1)30x0+Θ(1)31x1+Θ(1)32x2+Θ(1)33x3)

hΘ(x)=a(3)1=g(Θ(2)10a(2)0+Θ(2)11a(2)1+Θ(2)12a(2)2+Θ(2)13a(2)3)

在本节中,我们将对上述函数进行向量化实现。
我们要定义一个新的变量z(j)k,它包含了g函数中的参数。
在我们前面的例子中,如果我们用变量z替换所有的参数,我们会得到:

a(2)1=g(z(2)1)

a(2)2=g(z(2)2)

a(2)3=g(z(2)3)

换句话说,对于层j
= 2和节点k,变量z将是:

z(2)k=Θ(1)k,0x0+Θ(1)k,1x1+⋯+Θ(1)k,nxn

The
vector representation of x and zj is:

x=⎡⎣⎢⎢x0x1⋯xn⎤⎦⎥⎥z(j)=⎡⎣⎢⎢⎢⎢z(j)1z(j)2⋯z(j)n⎤⎦⎥⎥⎥⎥

Setting
x=a(1),
we can rewrite the equation as:

z(j)=Θ(j−1)a(j−1)

我们通过具有高度(n
+ 1)的矢量a(j−1)将我们的矩阵Θ(j−1)乘以尺寸sj×(n+1)sj×(n+1)(其中sj
是我们的激活节点的数目)。这给出了我们具有高度sj的向量z(j)。现在我们可以得到我们的层j的激活节点的向量如下:

a(j)=g(z(j))

其中我们的函数g可以元素地应用于我们的向量z(j)。

然后,我们可以在计算a(j)之后向层j添加偏置单元(等于1)。这将是元素a(j)0
并且将等于1.为了计算我们的最终假设,让我们先计算另一个z向量:

z(j+1)=Θ(j)a(j)

我们通过将Θ(j-1)之后的下一个θ矩阵与我们刚刚得到的所有激活节点的值相乘来获得这个最终z向量。该最后θ矩阵Θ(j)将仅具有乘以一列a(j)的一行,使得我们的结果是单个数。然后我们得到我们的最终结果:

hΘ(x)=a(j+1)=g(z(j+1))

注意,在这最后一步,在层j和层j
+
1之间,我们做的事情与在logistic回归中做的完全相同。将所有这些中间层添加到神经网络中允许我们更优雅地产生有趣的和更复杂的非线性假设。

《Machine Learning》系列学习笔记之第四周的更多相关文章

  1. [Machine Learning]学习笔记-Logistic Regression

    [Machine Learning]学习笔记-Logistic Regression 模型-二分类任务 Logistic regression,亦称logtic regression,翻译为" ...

  2. Machine Learning 学习笔记

    点击标题可转到相关博客. 博客专栏:机器学习 PDF 文档下载地址:Machine Learning 学习笔记 机器学习 scikit-learn 图谱 人脸表情识别常用的几个数据库 机器学习 F1- ...

  3. [Python & Machine Learning] 学习笔记之scikit-learn机器学习库

    1. scikit-learn介绍 scikit-learn是Python的一个开源机器学习模块,它建立在NumPy,SciPy和matplotlib模块之上.值得一提的是,scikit-learn最 ...

  4. Machine Learning 学习笔记1 - 基本概念以及各分类

    What is machine learning? 并没有广泛认可的定义来准确定义机器学习.以下定义均为译文,若以后有时间,将补充原英文...... 定义1.来自Arthur Samuel(上世纪50 ...

  5. Coursera 机器学习 第6章(上) Advice for Applying Machine Learning 学习笔记

    这章的内容对于设计分析假设性能有很大的帮助,如果运用的好,将会节省实验者大量时间. Machine Learning System Design6.1 Evaluating a Learning Al ...

  6. Structuring Machine Learning Projects 笔记

    1 Machine Learning strategy 1.1 为什么有机器学习调节策略 当你的机器学习系统的性能不佳时,你会想到许多改进的方法.但是选择错误的方向进行改进,会使你花费大量的时间,但是 ...

  7. machine learning学习笔记

    看到Max Welling教授主页上有不少学习notes,收藏一下吧,其最近出版了一本书呢还,还没看过. http://www.ics.uci.edu/~welling/classnotes/clas ...

  8. [Machine Learning]学习笔记-线性回归

    模型 假定有i组输入输出数据.输入变量可以用\(x^i\)表示,输出变量可以用\(y^i\)表示,一对\(\{x^i,y^i\}\)名为训练样本(training example),它们的集合则名为训 ...

  9. 吴恩达Machine Learning学习笔记(一)

    机器学习的定义 A computer program is said to learn from experience E with respect to some class of tasks T ...

随机推荐

  1. FP Tree算法原理总结

    在Apriori算法原理总结中,我们对Apriori算法的原理做了总结.作为一个挖掘频繁项集的算法,Apriori算法需要多次扫描数据,I/O是很大的瓶颈.为了解决这个问题,FP Tree算法(也称F ...

  2. RabbitMQ小白菜学习之在window下的安装配置

    RabbitMQ安装 首先需要下载RabbitMQ的平台环境Erlang OTP平台和RabbitMQ Server(windows版): OTP 19.1 Windows 64-bit Binary ...

  3. libMF阅读记录(一):首先要编译通过

    libMF是林智仁老师开发的一个用于推荐系统的矩阵分解库,下载地址:libMF 测试用的数据集是MovieLen,一个给电影评分的数据集,下载在此:ML 最近在阅读libMF的源代码,并且准备开发其M ...

  4. 华为oj---合并数组

    题目标题: 将两个整型数组按照升序合并,并且过滤掉重复数组元素 详细描述: 接口说明 原型: voidCombineBySort(int* pArray1,intiArray1Num,int* pAr ...

  5. [html5] 学习笔记-响应式布局

    1.响应式布局介绍 响应式布局是2010年5月份提出的一个概念,简而言之,就是一个网站能够兼容多个终端——而不是每一个终端做一个特定的版本.这个概念是为了兼容移动互联网浏览而诞生的,其目的是为用户提供 ...

  6. GIS制图人员的自我修养(2)--制图意识

    GIS制图人员的自我修养(2)--制图意识 by 李远祥 上次提及到GIS制图人员的一些制图误区,主要是为GIS制图人员剖析在制图工作中的一些问题.但如何提高制图的自我修养,却是一个非常漫长的过程,这 ...

  7. phpcmsV9于基本介绍

    1.phpcms做企业站 2.内容+管理栏目=页面显示的导航 3.文件目录结构 根目录 api 接口文件目录 caches 缓存文件目录 confings 系统配置文件目录 caches_*系统缓存目 ...

  8. jquery实现全选、全不选、反选、获取选中的所有值总结

    HTML 我们的页面上有一个歌曲列表,列出多行歌曲名称,并匹配复选框供用户选择,并且在列表下方有一排操作按钮. <!doctype html> <html> <head& ...

  9. 【UWP】列表项宽度自适应的实现

    目的 在UWP开发中,我们常常用到两个显示列表的控件:ListView和GridView.而这两个列表控件在PC等大屏幕上如果能多列"智能"调整自己的大小(通常是根据当前窗口大小调 ...

  10. android学习3——长宽的单位问题dp,px,dpi

    android设备的单位px,pt,dp,sp 分辨率 先通俗说下分辨率的概念.可以把屏幕想想成一个个正方形格子组成的.如果横向有1280个格子,竖向有720个格子.那么分辨率就是1280*720.这 ...