Stanford机器学习---第四讲. 神经网络的表示 Neural Networks representation

原文 http://blog.csdn.net/abcjennifer/article/details/7749309

本栏目（Machine learning）包括单参数的线性回归、多参数的线性回归、Octave Tutorial、Logistic Regression、Regularization、神经网络、机器学习系统设计、SVM（Support Vector Machines 支持向量机）、聚类、降维、异常检测、大规模机器学习等章节。所有内容均来自Standford公开课machine learning中Andrew老师的讲解。（https://class.coursera.org/ml/class/index）

第四讲——Neural Networks 神经网络的表示

===============================

（一）、为什么引入神经网络？——Nonlinear hypothesis

（二）、神经元与大脑（Neurons and Brain）

（三）、神经网络的表示形式

（四）、怎样用神经网络实现逻辑表达式？

（五）、分类问题（Classification）

本章主要围绕神经网络的建模及其线性表示（即neural networks的representation）做以初步了解，在下一章中将会有更详细的神经网络如何学习方面的知识。

===============================

（一）、为什么引入神经网络？——Nonlinear hypothesis

之前我们讨论的ML问题中，主要针对Regression做了分析，其中采用梯度下降法进行参数更新。然而其可行性基于假设参数不多，如果参数多起来了怎么办呢？比如下图中这个例子：从100*100个pixels中选出所有XiXj作为logistic regression的一个参数，那么总共就有5*10^7个feature，即x有这么多维。

所以引入了Nonlinear hypothesis，应对高维数据和非线性的hypothesis（如下图所示）：

===============================

（二）、神经元与大脑（neurons and brain）

神经元工作模式：

神经网络的逻辑单元：输入向量x（input layer），中间层a(2,i)（hidden layer）, 输出层h(x)（output layer）。

其中，中间层的a(2,i)中的2表示第二个级别（第一个级别是输入层），i表示中间层的第几个元素。或者可以说，a(j,i) is the activation of unit i in layer j.

===============================

（三）、神经网络的表示形式

从图中可知，中间层a(2，j)是输入层线性组合的sigmod值，输出又是中间层线性组合的sigmod值。

下面我们进行神经网络参数计算的向量化：

令z⁽²⁾表示中间层，x表示输入层，则有

，

z⁽²⁾=Θ⁽¹⁾x

a⁽²⁾=g(z⁽²⁾)

或者可以将x表示成a⁽¹⁾，那么对于输入层a⁽¹⁾有[x_0~x_3]4个元素，中间层a⁽²⁾有[a⁽²⁾₀~a⁽²⁾₃]4个元素（其中令a⁽²⁾₀=1），则有

h(x)= a⁽³⁾=g(z⁽³⁾)

z⁽³⁾=Θ⁽²⁾a⁽²⁾

通过以上这种神经元的传递方式（input->activation->output）来计算h(x), 叫做Forward propagation, 向前传递。

这里我们可以发现，其实神经网络就像是logistic regression，只不过我们把logistic regression中的输入向量[x₁~x₃]变成了中间层的[a⁽²⁾₁~a⁽²⁾₃], 即

h(x)=g(Θ⁽²⁾₀ a⁽²⁾₀+Θ⁽²⁾₁ a⁽²⁾₁+Θ⁽²⁾₂ a⁽²⁾₂+Θ⁽²⁾₃ a⁽²⁾₃)

而中间层又由真正的输入向量通过Θ⁽¹⁾学习而来，这里呢，就解放了输入层，换言之输入层可以是original input data的任何线性组合甚至是多项式组合如set x1*x2 as original x1...另外呢，具体怎样利用中间层进行更新下面会更详细地讲；此外，还有一些其他模型，比如：

===============================

（四）、怎样用神经网络实现逻辑表达式？

神经网路中，单层神经元（无中间层）的计算可用来表示逻辑运算，比如逻辑AND、逻辑或OR

举例说明：逻辑与AND；下图中左半部分是神经网络的设计与output层表达式，右边上部分是sigmod函数，下半部分是真值表。

给定神经网络的权值就可以根据真值表判断该函数的作用。再给出一个逻辑或的例子，如下图所示：

以上两个例子只是单层传递，下面我们再给出一个更复杂的例子，用来实现逻辑表达< x1 XNOR x2 >, 即逻辑同或关系，它由前面几个例子共同实现：

将AND、NOT AND和 OR分别放在下图中输入层和输出层的位置，即可得到x1 XNOR x2，道理显而易见：

a²₁ = x1 && x2

a²₂ = （﹁x1）&&（﹁x2）

a³₁ =a²₁||a²₁ =(x1 && x2) || （﹁x1）&&（﹁x2） = x1 XNOR x2；

应用：手写识别系统

===============================

（五）、分类问题（Classification）

记得上一章中我们讲过的one-vs-all分类问题么？one-vs-all方法是把二类分类问题到多类分类的一个推广，在这里，我们就讲述如何用神经网络进行分类。网络设计如下图所示：

输入向量x有三个维度，两个中间层，输出层4个神经元分别用来表示4类，也就是每一个数据在输出层都会出现[a b c d]^T，且a,b,c,d中仅有一个为1，表示当前类。

===============================

小结

本章引入了ML中神经网络的概念，主要讲述了如何利用神经网络的construction及如何进行逻辑表达function的构造，在下一章中我们将针对神经网络的学习过程进行更详细的讲述。

Stanford机器学习---第四讲. 神经网络的表示 Neural Networks representation的更多相关文章

（原创）Stanford Machine Learning (by Andrew NG) --- (week 4) Neural Networks Representation
Andrew NG的Machine learning课程地址为:https://www.coursera.org/course/ml 神经网络一直被认为是比较难懂的问题,NG将神经网络部分的课程分为了 ...
8、神经网络：表述(Neural Networks: Representation)
8.1 非线性假设我们之前学的,无论是线性回归还是逻辑回归都有这样一个缺点,即:当特征太多时,计算的负荷会非常大. 下面是一个例子: 当我们使用x1, x2 的多次项式进行预测时,我们可以应用的很好 ...
第十四章——循环神经网络（Recurrent Neural Networks）（第一部分）
由于本章过长,分为两个部分,这是第一部分. 这几年提到RNN,一般指Recurrent Neural Networks,至于翻译成循环神经网络还是递归神经网络都可以.wiki上面把Recurrent ...
第十四章——循环神经网络（Recurrent Neural Networks）（第二部分）
本章共两部分,这是第二部分: 第十四章--循环神经网络(Recurrent Neural Networks)(第一部分) 第十四章--循环神经网络(Recurrent Neural Networks) ...
循环神经网络(RNN, Recurrent Neural Networks)介绍（转载）
循环神经网络(RNN, Recurrent Neural Networks)介绍这篇文章很多内容是参考:http://www.wildml.com/2015/09/recurrent-neur ...
循环神经网络(RNN, Recurrent Neural Networks)介绍
原文地址: http://blog.csdn.net/heyongluoyao8/article/details/48636251# 循环神经网络(RNN, Recurrent Neural Netw ...
（原创）Stanford Machine Learning (by Andrew NG) --- (week 5) Neural Networks Learning
本栏目内容来自Andrew NG老师的公开课:https://class.coursera.org/ml/class/index 一般而言, 人工神经网络与经典计算方法相比并非优越, 只有当常规方法解 ...
Stanford机器学习---第五讲. 神经网络的学习 Neural Networks learning
原文 http://blog.csdn.net/abcjennifer/article/details/7758797 本栏目(Machine learning)包括单参数的线性回归.多参数的线性回归 ...
今天开始学模式识别与机器学习(PRML)，章节5.1，Neural Networks神经网络-前向网络。
今天开始学模式识别与机器学习Pattern Recognition and Machine Learning (PRML),章节5.1,Neural Networks神经网络-前向网络. 话说上一次写 ...

随机推荐

RESTful WebService入门（转）
原创作品,允许转载,转载时请务必以超链接形式标明文章原始出处 .作者信息和本声明.否则将追究法律责任.http://lavasoft.blog.51cto.com/62575/229206 REST ...
MySQL性能分析
第一步检查系统的状态通过操作系统的一些工具检查系统的状态,比如CPU.内存.交换.磁盘的利用率,根据经验或与系统正常时的状态相比对,有时系统表面上看起来看空闲,这也可能不是一个正常的状态,因为cp ...
Oracle中新增表代码
create table userinfo ( id varchar2(36) primary key, username varchar2(50) not null, password varcha ...
JSP页面中 <base href="<%=basePath%>">
base标记是一个基链接标记,是一个单标记.用以改变文件中所有连结标记的参数内定值.它只能应用于标记<head>与</head>之间.你网页上的所有相对路径在链接时都将在前面加 ...
POJ-1273 Drainage Ditches 最大流Dinic
Drainage Ditches Time Limit: 1000MS Memory Limit: 10000K Total Submissions: 65146 Accepted: 25112 De ...
Java JDBC下执行SQL的不同方式、参数化预编译防御
相关学习资料 http://zh.wikipedia.org/wiki/Java数据库连接 http://lavasoft.blog.51cto.com/62575/20588 http://blog ...
git使用记录
唔,git有本地版本管理功能,所以,这个完全是可以拿来自己做版本管理的.所以有必要学习一下,另外,在oschina上开了个账户,用来管理自己一些代码,也是增加自己学习git的动力. 1. 使用clon ...
linux中防CC攻击两种实现方法（转）
CC攻击就是说攻击者利用服务器或代理服务器指向被攻击的主机,然后模仿DDOS,和伪装方法网站,这种CC主要是用来攻击页面的,导致系统性能用完而主机挂掉了,下面我们来看linux中防CC攻击方法. 什么 ...
如何使用MASM来编译、连接、调试汇编语言
先声明下,本人绝非大虾,也只是菜鸟一个,写此文的目的只是为了加深我对知识的理解罢了.好,进入正题.我是把masm解压后发在D盘中的一个叫masm的文件里,在masm文件里新建个记事本(记事本功能是很强 ...
javascript的字符串模板
在其他语言存在字符串内插(string interpolation)或者叫变量内插(Variable interpolation).ES6中的称为template string. 模板字符串使用反引号 ...

Stanford机器学习---第四讲. 神经网络的表示 Neural Networks representation

Stanford机器学习---第四讲. 神经网络的表示 Neural Networks representation的更多相关文章

随机推荐

热门专题