大家好~我开设了“深度学习基础班”的线上课程,带领同学从0开始学习全连接和卷积神经网络,进行数学推导,并且实现可以运行的Demo程序

线上课程资料:

本节课录像回放1

本节课录像回放2

加QQ群,获得ppt等资料,与群主交流讨论:106047770

本系列文章为线上课程的复盘,每上完一节课就会同步发布对应的文章

本文为第二节课:“判断性别”Demo需求分析和初步设计(下2)的复盘文章

本课程系列文章可进入索引查看:

深度学习基础课系列文章索引

回顾相关课程内容

  • 第二节课:“判断性别”Demo需求分析和初步设计(下1)

    • 为什么引入损失函数?
    • 损失函数的表达式是什么?
    • 有了损失函数,如何具体判断得到一组权重、偏移是合适的呢?
    • 什么是随机梯度下降?
    • 更新权重、偏移的梯度下降公式是什么?

主问题:如何求梯度

  • 对于“判断性别”的Demo,可以是什么函数?

    答:

  • 如何求\(\frac{dE}{dw_{53}}\)?

    答:



    参考上面的公式,可知:

  • 如何求\(\frac{dE}{db_{5}}\)?

    答:与上面类似

  • 如何求\(\frac{dE}{dw_{31}}\)?

    答:

任务:根据梯度下降算法实现训练

  • 标签、特征是什么?

    标签是我们要预测的事物,即男/女;

    特征是输入变量,即身高和体重;

  • 已知4个有标签样本(同时包含特征和标签)用于训练,2个无标签样本用于推理

  • 请根据梯度下降算法,实现NeuralNetwork_train的train函数?

    • 如何判断是否达到了希望的结果(即收敛)?

      答:打印损失函数返回的误差loss,如果小于0.1,则收敛
    • 如何实现?

      答:答案:NeuralNetwork_train_answer
  • 请运行程序

    • 有什么问题?

      第一轮开始的loss就无限大

任务:改进训练,使其收敛

  • 请找出loss无限大的原因?

    答:输出(y5)太大
  • 应该如何改进?

    答:改进激活函数,使用sigmoid替代线性函数:





    它的导数为:

  • 修改代码,运行结果?

    答:修改后的相关代码为:
let _activateFunc = x => {
1. /. (1. +. Js.Math.exp(-.x))
} let _deriv_Sigmoid = x => {
let fx = _activateFunc(x) fx *. (1. -. fx)
}

修改后的完整代码为:NeuralNetwork_train_fix_activate_answer

运行结果:loss一直不变

(补充:完整代码有bug:Neural_forward_answer->_activateFunc应该使用sigmoid函数。修改后的完整代码为:NeuralNetwork_train_fix_activate_answer_fix。修改后的运行结果是loss会先下降到0.25然后就不变了,而不是一直不变)

  • 为什么loss一直不变?

    答:输入太大->隐藏层的激活函数的导数为0->梯度为0->loss不变

  • 应该如何改进?

    答:将样本零均值化

  • 修改代码,运行结果?

    答:修改后的相关代码为:

let _mean = values => {
values->ArraySt.reduceOneParam((. sum, value) => {
sum +. value
}, 0.) /. ArraySt.length(values)->Obj.magic
} let _zeroMean = features => {
let weightMean = features->ArraySt.map(feature => feature.weight)->_mean->Js.Math.floor->Obj.magic
let heightMean = features->ArraySt.map(feature => feature.height)->_mean->Js.Math.floor->Obj.magic features->ArraySt.map(feature => {
weight: feature.weight -. weightMean,
height: feature.height -. heightMean,
})
} let features = features->_zeroMean let state = state->train(features, labels) let featuresForInference = [
{
weight: 89.,
height: 190.,
},
{
weight: 60.,
height: 155.,
},
] featuresForInference->_zeroMean->Js.Array.forEach(feature => {
inference(state, feature)->Js.log
}, _)
这里的内容是错误的,可忽略

运行结果:loss可能会逐渐增大

  • 为什么会出现loss逐渐增大的情况?

    答:学习率太大

    如下图所示:



    因为步长过大,可能会跨过谷底
  • 如何解决?

    答:有两个方法:

    减小学习率,增加轮数;

    使用优化算法动态调整学习率。

    这里使用前者
  • 修改代码,运行结果?

    答:修改后的相关代码为:
let train = (state: state, features: array<feature>, labels: array<label>): state => {
//let learnRate = 0.1
//let epochs = 1000 let learnRate = 0.001
let epochs = 100000
...

修改后的完整代码为:NeuralNetwork_train_fix_zeroMean_answer

运行结果:大部分情况下loss会收敛

(补充:完整代码仍然有同样的bug:Neural_forward_answer->_activateFunc应该使用sigmoid函数。修改后的完整代码为:NeuralNetwork_train_fix_zeroMean_answer_fix。修改后的运行结果是loss基本上都会收敛,所以基本上不会出现“loss可能会逐渐增大”的情况,所以就不需要“减小学习率,增加轮数;”)

总结

  • 请回答所有主问题?
  • 如何根据梯度下降算法实现训练代码?
  • 会出现什么问题?如何解决?

参考资料

深度学习基础课: “判断性别”Demo需求分析和初步设计(下2)的更多相关文章

  1. “判断性别”Demo需求分析和初步设计(中)

    大家好~我开设了"深度学习基础班"的线上课程,带领同学从0开始学习全连接和卷积神经网络,进行数学推导,并且实现可以运行的Demo程序 线上课程资料: 本节课录像回放 加QQ群,获得 ...

  2. 基于深度学习的人脸性别识别系统(含UI界面,Python代码)

    摘要:人脸性别识别是人脸识别领域的一个热门方向,本文详细介绍基于深度学习的人脸性别识别系统,在介绍算法原理的同时,给出Python的实现代码以及PyQt的UI界面.在界面中可以选择人脸图片.视频进行检 ...

  3. 【神经网络与深度学习】【CUDA开发】caffe-windows win32下的编译尝试

    [神经网络与深度学习][CUDA开发]caffe-windows win32下的编译尝试 标签:[神经网络与深度学习] [CUDA开发] 主要是在开发Qt的应用程序时,需要的是有一个使用的库文件也只是 ...

  4. [OpenCV实战]1 基于深度学习识别人脸性别和年龄

    目录 1基于CNN的性别分类建模原理 1.1 人脸识别 1.2 性别预测 1.3 年龄预测 1.4 结果 2 代码 参考 本教程中,我们将讨论应用于面部的深层学习的有趣应用.我们将估计年龄,并从单个图 ...

  5. 【课程学习】课程2:十行代码高效完成深度学习POC

    本文用户记录黄埔学院学习的心得,并补充一些内容. 课程2:十行代码高效完成深度学习POC,主讲人为百度深度学习技术平台部:陈泽裕老师. 因为我是CV方向的,所以内容会往CV方向调整一下,有所筛检. 课 ...

  6. 深度学习与CV教程(2) | 图像分类与机器学习基础

    作者:韩信子@ShowMeAI 教程地址:http://www.showmeai.tech/tutorials/37 本文地址:http://www.showmeai.tech/article-det ...

  7. 深度学习与CV教程(8) | 常见深度学习框架介绍

    作者:韩信子@ShowMeAI 教程地址:http://www.showmeai.tech/tutorials/37 本文地址:http://www.showmeai.tech/article-det ...

  8. 深度学习与CV教程(12) | 目标检测 (两阶段,R-CNN系列)

    作者:韩信子@ShowMeAI 教程地址:http://www.showmeai.tech/tutorials/37 本文地址:http://www.showmeai.tech/article-det ...

  9. paper 53 :深度学习(转载)

    转载来源:http://blog.csdn.net/fengbingchun/article/details/50087005 这篇文章主要是为了对深度学习(DeepLearning)有个初步了解,算 ...

  10. 深度学习与CV教程(4) | 神经网络与反向传播

    作者:韩信子@ShowMeAI 教程地址:http://www.showmeai.tech/tutorials/37 本文地址:http://www.showmeai.tech/article-det ...

随机推荐

  1. 掌握这些,轻松管理BusyBox:inittab文件的配置和作用解析

    BusyBox 是一个轻量级的开源工具箱,其中包含了许多标准的 Unix 工具,例如 sh.ls.cp.sed.awk.grep 等,同时它也支持大多数关键的系统功能,例如自启动.进程管理.启动脚本等 ...

  2. Java数组最常用操作方法(Arrays类)

    最近在写代码的过程中发现我们很多地方都会处理数组,有时只是模糊的记得有API可以调用,每次都查文档很是费事儿,适当的总结希望提高开发速度 一.申明数组 数组的申明十分简单也十分的基础,注意第三种申明方 ...

  3. Android OpenGL ES入门

    1.OpenGL 和OpenGL ES OpenGL(Open Graphics Library)是一种用于渲染2D和3D图形的跨平台编程接口.OpenGL提供了一套标准的函数和接口,使开发人员能够在 ...

  4. 【解决方案】MySQL5.7 百万数据迁移到 ElasticSearch7.x 的思考

    目录 前言 一.一次性全量 二.定时任务增量 三.强一致性问题 四.canal 框架 4.1基本原理 4.2安装使用(重点) 版本说明 4.3引入依赖(测试) 4.4代码示例(测试) 五.文章小结 前 ...

  5. C与Verilog差别

    C没有时钟概念,Verilog有时钟边沿触发. C无建立保持时间要求,Verilog要计算建立保持时间,并进行优化 C与工艺无关,Verilog依赖底层工艺cell,相同代码不同cell差异较大. V ...

  6. 容器网络Cilium:DualStack双栈特性分析

    本文分享自华为云社区<容器网络Cilium入门系列之DualStack双栈特性分析>,作者: 可以交个朋友. 一 . 关于IPV6/IPV4 双栈 目前很多公司开始将自己的业务由ipv4切 ...

  7. 自定义开发odoo14的统计在线用户人数

    在 Odoo 14 中统计在线人数通常涉及到定制开发或者使用特定的模块. 自定义开发:如果没有现成的模块,您可能需要进行一些自定义开发.这通常涉及到扩展Odoo的用户模型,以跟踪用户的登录和登出活动. ...

  8. 【李南江】从零玩转TypeScript

    前言 老套路肯定是 需要知道TS是干啥用的啦. 1.什么是TypeScript(TS)? TypeScript简称TS TS和JS之间的关系其实就是Less/Sass和CSS之间的关系 就像Less/ ...

  9. three.js中帧缓存的使用

    目录 1. 概述 2. 示例 2.1. 代码 2.2. 解析 3. 参考 1. 概述 在网上查阅了一下three.js关于帧缓存的使用,感觉很多都是关于three.js中后处理通道的使用的.后处理通道 ...

  10. 在线编辑Word——插入表格

    Word中可插入表格并进行相关格式化操作用于美化表格设计.本文,将通过使用Spire.Cloud Word在线编辑器展示如何来插入格式化的表格到Word.详细步骤见以下内容: 1. 进入在线编辑Wor ...