深度学习---手写字体识别程序分析（python）

我想大部分程序员的第一个程序应该都是“hello world”，在深度学习领域，这个“hello world”程序就是手写字体识别程序。

这次我们详细的分析下手写字体识别程序，从而可以对深度学习建立一个基本的概念。

1.初始化权重和偏置矩阵，构建神经网络的架构

import numpy as np

class network():

　　def __init__(self, sizes):

　　　　self.num_layers = len(sizes)

　　　　self.sizes = sizes

　　　　self.biases = [ np.random.randn(y,1) for y in sizes[1:] ]

　　　　self.weights = [ np.random.randn(y,x) for x,y in zip(sizes(:-1), sizes(1:)) ]

在实例化一个神经网络时，去初始化权重和偏置的矩阵，例如

　　network0 = network([784, 30, 10])

可以初始化一个3层的神经网络，各层神经元的个数分别为 784， 30 ， 10

2. 如何去反向传播计算代价函数的梯度？

这个过程可以大概概括如下：

（1）正向传播，获得每个神经元的带权输出和激活因子（a）

（2）计算输出层的误差

（3）反向传播计算每一层的误差和梯度

用python实现的代码如下：

def backprop(self, x, y):

　　delta_w = [ np.zeros(w.shape) for w in self.weights]

delta_b = [ np.zeros(b.shape) for b in self.biases ]

#计算每个神经元的带权输入z及激活值

　　zs = []

activation = x

activations = [x]

　　for b,w in zip(self.biases, self.weights):

　　　　z = np.dot(w, activation) + b

　　　　zs.append(z)

　　　　activation = sigmod(z)

　　　　activations.append(activation)

#计算输出层误差(这里采用的是二次代价函数)

　　delta = (activations[-1] - y) * sigmod_prime(zs[-1])

　　delta_w[-1] = np.dot(delta, activations[-2].transpose())

　　delta_b[-1] = delta

　　#反向传播

　　for l in xrange(2, self.num_layers):

　　　　delta = np.dot(delta_w[-l+1].transpose(),delta)*sigmod_prime(zs[-l])

　　　　delta_w[-l] = np.dot(delta, activations[-l-1].transpose())

　　　　delta_b[-l] = delta

　　return delta_w, delta_b

3.如何梯度下降，更新权重和偏置？

通过反向传播获得了更新权重和偏置的增量，进一步进行更新，梯度下降。

def update_mini_batch(self, mini_batch, eta):

　　delta_w = [ np.zeros(w.shape) for w in self.weights ]

　　delta_b = [ np.zeros(b.shape) for b in self.biases ]

　　for x,y in mini_batch:

　　　　(这里针对一个小批量内所有样本，应用反向传播，积累权重和偏置的变化)

　　　　delta_w_p, delta_b_p = self.backprop(x,y)

　　　　delta_w = [ dt_w + dt_w_p for dt_w,dt_w_p in zip(delta_w, delta_w_p)]

　　　　delta_b = [ dt_b + dt_b_p for dt_b,dt_b_p in zip(delta_b, delta_b_p)]

　　self.weights = [ w-(eta/len(mini_batch)*nw) for w,nw in zip(self.weights, delta_w)]

　　self.biases = [ b-(eta/len(mini_batch)*nb) for b,nb in zip(self.biases, delta_b)]

def SGD(self, epochs, training_data, mini_batch_size,eta, test_data=None):

　　if test_data:

　　　　n_tests = len(tast_data)

　　n_training_data = len(training_data)

　　for i in xrange(0, epochs):

　　　　random.shuffle(training_data)

　　　　mini_batches = [ training_data[k:k+mini_batch_size]

　　　　　　　　　　　　for k in xrange(0, n_training_data, mini_batch_size)

　　　　　　　　　　　　]

　　　　for mini_batch in mini_batches:

　　　　　　self.update_mini_batch(mini_batch, eta)

深度学习---手写字体识别程序分析（python）的更多相关文章

深度学习-tensorflow学习笔记(1)-MNIST手写字体识别预备知识
深度学习-tensorflow学习笔记(1)-MNIST手写字体识别预备知识在tf第一个例子的时候需要很多预备知识. tf基本知识香农熵交叉熵代价函数cross-entropy 卷积神经网络 s ...
深度学习-tensorflow学习笔记(2)-MNIST手写字体识别
深度学习-tensorflow学习笔记(2)-MNIST手写字体识别超级详细版这是tf入门的第一个例子.minst应该是内置的数据集. 前置知识在学习笔记(1)里面讲过了这里直接上代码 # -*- ...
pytorch深度学习神经网络实现手写字体识别
利用平pytorch搭建简单的神经网络实现minist手写字体的识别,采用三层线性函数迭代运算,使得其具备一定的非线性转化与运算能力,其数学原理如下: 其具体实现代码如下所示:import torch ...
【OpenCV】opencv3.0中的SVM训练 mnist 手写字体识别
前言: SVM(支持向量机)一种训练分类器的学习方法 mnist 是一个手写字体图像数据库,训练样本有60000个,测试样本有10000个 LibSVM 一个常用的SVM框架 OpenCV3.0 中的 ...
机器学习之路： python 支持向量机 LinearSVC 手写字体识别
使用python3 学习sklearn中支持向量机api的使用可以来到我的git下载源代码:https://github.com/linyi0604/MachineLearning # 导入手写字体 ...
基于kNN的手写字体识别——《机器学习实战》笔记
看完一节<机器学习实战>,算是踏入ML的大门了吧!这里就详细讲一下一个demo:使用kNN算法实现手写字体的简单识别 kNN 先简单介绍一下kNN,就是所谓的K-近邻算法: [作用原理]: ...
第二节，mnist手写字体识别
1.获取mnist数据集,得到正确的数据格式 mnist = input_data.read_data_sets('MNIST_data',one_hot=True) 2.定义网络大小:图片的大小是2 ...
【深度学习系列】PaddlePaddle之手写数字识别
上周在搜索关于深度学习分布式运行方式的资料时,无意间搜到了paddlepaddle,发现这个框架的分布式训练方案做的还挺不错的,想跟大家分享一下.不过呢,这块内容太复杂了,所以就简单的介绍一下padd ...
【深度学习系列】手写数字识别卷积神经--卷积神经网络CNN原理详解(一)
上篇文章我们给出了用paddlepaddle来做手写数字识别的示例,并对网络结构进行到了调整,提高了识别的精度.有的同学表示不是很理解原理,为什么传统的机器学习算法,简单的神经网络(如多层感知机)都可 ...

随机推荐

Java并发编程原理与实战三十一:Future&FutureTask 浅析
一.Futrue模式有什么用?------>正所谓技术来源与生活,这里举个栗子.在家里,我们都有煮菜的经验.(如果没有的话,你们还怎样来泡女朋友呢?你懂得).现在女票要你煮四菜一汤,这汤是鸡汤, ...
Java并发编程原理与实战五：创建线程的多种方式
一.继承Thread类 public class Demo1 extends Thread { public Demo1(String name) { super(name); } @Override ...
在WindowsServer2008服务器上安装SQLServer2008R2 Express版
登录服务器使用远程桌面登录Windows Server 2008 安装前的准备工作下载SQL Server安装程序下载Microsoft SQL Server2008 R2 RTM - Ex ...
#Fixed# easy-animation | Animation for Sass
原文链接:http://www.cnblogs.com/maplejan/p/3659830.html 主要修复3.4版本后变量作用域的问题. 代码如下: /* easy-animation.scss ...
HDU 1242 Rescue （广搜）
题目链接 Problem Description Angel was caught by the MOLIGPY! He was put in prison by Moligpy. The priso ...
js操作控制iframe页面的dom元素
1.代码1 index.html <!DOCTYPE html> <html> <head> <meta charset="UTF-8" ...
http Get和Post请求方式
string postURL ="http://xxxxx.ashx"; List<string> paramName = new List<string&g ...
关于在函数中使用Array.prototype.slice.call而不是直接用slice
arguments是每个函数在运行的时候自动获得的一个近似数组的对象(除了length外没有其他属性),这个arguments对象其实并不是Array,所以没有slice方法. Array.proto ...
在Linode VPS上搭建最新版Transmission
在Linode VPS上搭建最新版Transmission 2015-09-16 by Hansen 原文链接:http://www.hansendong.me/archives/124.html 以 ...
【环境变量】Linux 下三种方式设置环境变量与获取环境变量
1.在Windows 系统下,很多软件安装都需要配置环境变量,比如安装 jdk ,如果不配置环境变量,在非软件安装的目录下运行javac 命令,将会报告找不到文件,类似的错误. 2.那么什么是环境变 ...

深度学习---手写字体识别程序分析（python）

深度学习---手写字体识别程序分析（python）的更多相关文章

随机推荐

热门专题