手算推导BP神经网络

2024-07-26 02:14:04 原文

一、神经元

下图的蓝色区域被称为一个“感知机”(Perceptron), 感知机是对信息进行编码、压缩、集成、融合的计算机智能接口系统。

说白了，就是在输入端输入X1~X7这7个输入值，在感知机中乘以各自的权重矩阵、加上偏置值b后再放入激活函数f，最后输出结果y.

图中黄圈也代表了一个“感知机”，黄圈中进行了1.矩阵点乘后求和，2.加偏置值b，3.经过激活函数变换，这三项操作。

常见的三种激活函数是sigmoid函数(又称S函数)、tanh函数和Relu函数，图像和公式见下：

二、输入层、隐藏层、输出层

先求输出层的误差，而后倒推出隐藏层和输入层的误差：（d为真实值，O为最终预测值）

权重虚拟值：

偏置虚拟值：

三、开始手推公式

对neth1 通过sigmoid激活函数之后，得到outh1，我们先看一下sigmoid函数的长什么样：（其实上面介绍激活函数时也画出来了）

同理可得：

同理：

总损失:

那么到此，结果的总损失已经算出，现在需要反向传播求偏导，以求出每一个参数对最终总损失的‘贡献’，为参数更新做准备。

同理：

从而得到W1更新值：

（注：1. 为学习率，即梯度下降中的步长，为超参数。

2.为什么学习率前是负号？因为目标函数一般都是下凹函数，偏导为正就需左移自变量，为负就需右移自变量）

同理可得到每一个W的更新值：

顺便放在程序上跑一跑，可以发现进行这样的反向传播梯度更新的确会使最终结果越来越接近目标值。

（实际O1=0.01，O2=0.09）

最初的权重矩阵W0(随机赋值)是这样的：

迭代1000次（也就是更新1000次参数后）的权重矩阵W1000：

手算推导BP神经网络的更多相关文章

BP神经网络推导过程详解
BP算法是一种最有效的多层神经网络学习方法,其主要特点是信号前向传递,而误差后向传播,通过不断调节网络权重值,使得网络的最终输出与期望输出尽可能接近,以达到训练的目的. 一.多层神经网络结构及其描述 ...
BP神经网络算法推导及代码实现笔记zz
一. 前言: 作为AI入门小白,参考了一些文章,想记点笔记加深印象,发出来是给有需求的童鞋学习共勉,大神轻拍! [毒鸡汤]:算法这东西,读完之后的状态多半是 --> “我是谁,我在哪?” 没事的 ...
机器学习入门学习笔记：（一）BP神经网络原理推导及程序实现
机器学习中,神经网络算法可以说是当下使用的最广泛的算法.神经网络的结构模仿自生物神经网络,生物神经网络中的每个神经元与其他神经元相连,当它“兴奋”时,想下一级相连的神经元发送化学物质,改变这些神经元的 ...
Andrew BP 神经网络详细推导
Lec 4 BP神经网络详细推导本篇博客主要记录一下Coursera上Andrew机器学习BP神经网络的前向传播算法和反向传播算法的具体过程及其详细推导.方便后面手撸一个BP神经网络. 目录 Lec ...
练习推导一个最简单的BP神经网络训练过程【个人作业/数学推导】
写在前面各式资料中关于BP神经网络的讲解已经足够全面详尽,故不在此过多赘述.本文重点在于由一个"最简单"的神经网络练习推导其训练过程,和大家一起在练习中一起更好理解神经网络训 ...
BP神经网络的直观推导与Java实现
人工神经网络模拟人体对于外界刺激的反应.某种刺激经过人体多层神经细胞传递后,可以触发人脑中特定的区域做出反应.人体神经网络的作用就是把某种刺激与大脑中的特定区域关联起来了,这样我们对于不同的刺激就可以 ...
BP神经网络原理及python实现
[废话外传]:终于要讲神经网络了,这个让我踏进机器学习大门,让我读研,改变我人生命运的四个字!话说那么一天,我在乱点百度,看到了这样的内容: 看到这么高大上,这么牛逼的定义,怎么能不让我这个技术宅男心 ...
机器学习（一）：梯度下降、神经网络、BP神经网络
这几天围绕论文A Neural Probability Language Model 看了一些周边资料,如神经网络.梯度下降算法,然后顺便又延伸温习了一下线性代数.概率论以及求导.总的来说,学到不少知 ...
BP神经网络算法学习
BP(Back Propagation)网络是1986年由Rumelhart和McCelland为首的科学家小组提出,是一种按误差逆传播算法训练的多层前馈网络,是眼下应用最广泛的神经网络模型之中的一个 ...
【机器学习】BP神经网络实现手写数字识别
最近用python写了一个实现手写数字识别的BP神经网络,BP的推导到处都是,但是一动手才知道,会理论推导跟实现它是两回事.关于BP神经网络的实现网上有一些代码,可惜或多或少都有各种问题,在下手写了一 ...

随机推荐

Young's theorem杨氏定理
杨氏定理定理叙述参考百度百科. Young's Theorem: Let \(f\) be a differentiable function of \(n\) variables. If eac ...
【转载】SQL SERVER 存储过程中执行动态Sql语句
MSSQL为我们提供了两种动态执行SQL语句的命令,分别是EXEC和sp_executesql;通常,sp_executesql则更具有优势,它提供了输入输出接口,而EXEC没有.还有一个最大的好处就 ...
一文了解 Dubbo 3 配置工作原理
以下是一个 Dubbo 属性配置的例子 dubbo-spring-boot-samples ## application.properties # Spring boot application sp ...
10.关于synchronized的一切，我都写在这里了
大家好,我是王有志.关注王有志,一起聊技术,聊游戏,从北漂生活谈到国际风云. 之前我们已经通过3篇文章由浅到深的分析了synchronized的用法和原理: synchronized的基础:synch ...
Vue导出模板、使用前端js办法导出表格数据、导入表格前端读取表格数据、导入表格发送后端读取数据
以下是几种用的较多的函数方法,可以参考使用. // 導出1 myExport() { // post請求文件寫法1 const url = 'http://XXXX/XXXX/XXXX/XXXX' c ...
IntelliJ中高效重构的 10 个快捷方式
前言在日常的开发工作中,我们经常需要重构,重构可以让我们写出的代码更上一层楼.所以,我会借助IntelliJ提供的一些功能,帮助我高效进行重构.这里是我推荐10个快捷方式,也是我每天都在使用的,非常 ...
分布式协议与算法-Quorum NWR
1.强一致性与最终一致性 1.1强一致性强一致性能保证写操作完成后,任何后续访问都能读到更新后的值:强一致性可以保证从库有与主库一致的数据.如果主库突然宕机,我们仍可以保证数据完整.但如果从库宕机或 ...
SQLSERVER 快照隔离级别到底怎么理解?
一:背景 1. 讲故事上一篇写完 SQLSERVER 的四个事务隔离级别到底怎么理解? 之后,有朋友留言问什么时候可以把 snapshot 隔离级别给补上,这篇就来安排,快照隔离级别看起来很魔法,不 ...
MyBatis的使用八(动态SQL)
本主要讲述mybatis处理动态sql语句一. 问题引入前端展示的数据表格中,查询条件可能不止一个,如何将用户输入的多个查询条件,拼接到sql语句中呢? DynamicMapper接口声明如下 p ...
2.4.rpx单位有内置的视图容器组件
所有的视图组件,包括view.swiper等,本身不显示任何可视化元素.它们的用途都是为了包裹其他真正显示的组件. # view 视图容器. 它类似于传统html中的div,用于包裹各种元素内容. 如 ...