机器学习之路：深度学习 tensorflow 神经网络优化算法学习率的设置

在神经网络中，广泛的使用反向传播和梯度下降算法调整神经网络中参数的取值。

梯度下降和学习率：

　　假设用 θ 来表示神经网络中的参数， J(θ) 表示在给定参数下训练数据集上损失函数的大小。

　　那么整个优化过程就是寻找一个参数θ，使得J(θ) 的值最小，也就是求J(θ) 的最小值

　　损失函数J(θ)的梯度 = ∂ J(θ) / ∂ θ

　　此时定义一个学习率 η

　　梯度下降法更新参数的公式为： θ_n+1 = θ_n- η ( ∂ J(θ_n) / ∂ θ_n )

　　将这个公式循环的重复下去，θ的值就从高处逐渐向最低处一小步一小步的移动

举个例子：

　　使用梯度下降使得损失函数函数 J(x) = x²的值尽量小，由二次函数图像开口向上可以知道，二次函数最小值为0，

　　梯度 ▽ = ∂ J(x) / ∂ x = 2x

　　假设初始值为 x= 5, 设置学习率为0.3

　　使用梯度下降更新x的值步骤如下：

　　轮数　　　　　　当前参数x　　　　　　梯度 * 学习率　　　　　　更新后参数

　　1　　　　　　　　5 　　　　　　　　　　2*5*0.3 = 3　　　　　　5-3=2

　　2　　　　　　　　2　　　　　　　　　　2*2*0.3 = 1.2　　　　　 2-1.2 = 0.8

　　3　　　　　　　　0.8　　　　　　　　　2*0.8*0.3 = 0.48　　　　0.8-0.48 = 0.32

　　4　　　　　　　　0.32　　　　　　　　2*0.32*0.3 = 0.192　　　　0.32-0.192=0.128

　　5　　　　　　　　0.128 　　　　　　2*0.128*0.3=0.0768　　　0.128-0.0768=0.0512

　　经过五次迭代x从5变成了0.0512，已经和0非常接近了。

但是梯度下降并不能每次都能获得全局最优解。

　　如果学习率过小，可能会导致陷入局部最优解的情况。如图：

　　如果学习率过大，很可能在最优解两侧来回回荡，永远也到不了最低点。

举个例子：

　　使用梯度下降使得损失函数函数 J(x) = x²的值尽量小，由二次函数图像开口向上可以知道，二次函数最小值为0，

　　梯度 ▽ = ∂ J(x) / ∂ x = 2x

　　假设初始值为 x= 5, 设置学习率为 1

　　使用梯度下降更新x的值步骤如下：

　　轮数　　　　　　当前参数x　　　　　　梯度 * 学习率　　　　　　更新后参数

　　1　　　　　　　　5 　　　　　　　　　　2*5*1= 10　　　　　　5-10 = -5

　　2　　　　　　　　-5　　　　　　　　　　2*-5*1 =-10　　　　　-5+10 = 5

继续下去他仍会来回摆荡，永远无法收敛

可见，学习率过大或者过小都不好。

tensorflow为我们提供了一种灵活的学习率设置方式----指数衰减： tf.train.exponential_decy函数

　　每一轮的学习率 = 学习率 * 衰减系数^(global_steps/decay_steps)

　　随着步数的增加，学习率在变小，并且步数越多，变小的速度越慢

　　learning_rate = tf.train.exponential_decay(学习率， global_step, decay_step, 衰减系数，staircase=True)

　　　　global_step 是当前已经执行多少步了

　　　　decay_step 是下降速度，指的是每隔多少步，学习率指数增长一个

　　例如：

　　　　 tf.train.exponential_decay(0.1， global_step, 100, 0.96，staircase=True)

　　　　初始学习率0.1 每隔100步学习率乘以0.96

　　　　stairecase 为true的时候，以阶梯方式下降，为False时候以平滑曲线下降

机器学习之路：深度学习 tensorflow 神经网络优化算法学习率的设置的更多相关文章

机器学习(Machine Learning)&深度学习(Deep Learning)资料(Chapter 2)
##机器学习(Machine Learning)&深度学习(Deep Learning)资料(Chapter 2)---#####注:机器学习资料[篇目一](https://github.co ...
深度学习---tensorflow简介
个core可以有不同的代码路径.对于反向传播算法来说,基本计算就是矩阵向量乘法,对一个向量应用激活函数这样的向量化指令,而不像在传统的代码里会有很多if-else这样的逻辑判断,所以使用GPU加速非常 ...
吴裕雄--天生自然神经网络人工智能项目：基于深度学习TENSORFLOW框架的图像分类与目标跟踪报告（续四）
2. 神经网络的搭建以及迁移学习的测试 7.项目总结通过本次水果图片卷积池化全连接试验分类项目的实践,我对卷积.池化.全连接等相关的理论的理解更加全面和清晰了.试验主要采用python高级编程语言的 ...
机器学习(Machine Learning)&深度学习(Deep Learning)资料【转】
转自:机器学习(Machine Learning)&深度学习(Deep Learning)资料 <Brief History of Machine Learning> 介绍:这是一 ...
AI学习---深度学习&TensorFlow安装
深度学习深度学习学习目标: 1. TensorFlow框架的使用 2. 数据读取(解决大数据下的IO操作) + 神经网络基础 3. 卷积神经网络的学习 + 验证码识别的案例机器学习与深度学 ...
深度学习-tensorflow学习笔记(1)-MNIST手写字体识别预备知识
深度学习-tensorflow学习笔记(1)-MNIST手写字体识别预备知识在tf第一个例子的时候需要很多预备知识. tf基本知识香农熵交叉熵代价函数cross-entropy 卷积神经网络 s ...
深度学习Tensorflow相关书籍推荐和PDF下载
深度学习Tensorflow相关书籍推荐和PDF下载 baihualinxin关注 32018.03.28 10:46:16字数 481阅读 22,673 1.机器学习入门经典<统计学习方法&g ...
深度学习-tensorflow学习笔记(2)-MNIST手写字体识别
深度学习-tensorflow学习笔记(2)-MNIST手写字体识别超级详细版这是tf入门的第一个例子.minst应该是内置的数据集. 前置知识在学习笔记(1)里面讲过了这里直接上代码 # -*- ...
神经网络优化算法：梯度下降法、Momentum、RMSprop和Adam
最近回顾神经网络的知识,简单做一些整理,归档一下神经网络优化算法的知识.关于神经网络的优化,吴恩达的深度学习课程讲解得非常通俗易懂,有需要的可以去学习一下,本人只是对课程知识点做一个总结.吴恩达的深度 ...

随机推荐

xampp + windows 配置 memcache流程
1.运行xampp服务,打开phpinfo查看信息,如下图: 从上到下,依次为 PHP版本:5.6: architecture:x86: TS:线程安全: vc11 2.牢记以上几个横线内容之后去下载 ...
【iptables】linux网络防火墙-iptables基础详解(重要)
一:前言防火墙,其实说白了讲,就是用于实现Linux下访问控制的功能的,它分为硬件的或者软件的防火墙两种.无论是在哪个网络中,防火墙工作的地方一定是在网络的边缘.而我们的任务就是需要去定义到底防 ...
JDOM生成XML文档的一般方法
由于DOM提供的生成XML的方法不够直观,而且要用到各种繁琐的注解,鉴于此可借助第三方库-----JDOM生成XML文档.具体操作方式如下: import java.io.FileOutputStre ...
GDB调试基础
GDB调试基础 https://lesca.me/archives/gdb-basic-knowledge.html GDB笔记(二):条件断点.命令列表.监视点 https://lesca.me/a ...
20 Organizing Go code 组织go代码
Organizing Go code 16 August 2012 Introduction Go code is organized differently to that of other lan ...
python面向对象（五）之多态
继承在讲多态之前我们再复习下继承,下面是一个例子. Circle 和 Rectangle 继承自 Shape,不同的图形,面积(area)计算方式不同. # shape.py class S ...
MyEclipse文本对比界面样式修改
MyEclipse刚安装好,使用文件对比的时候,发现两边的对比颜色非常浅,不同的地方不容易发现,可以通过以下配置将显示颜色调深一点. 配置效果
java基础41 枚举(类)
1.概述枚举:一些方法在运行时,它需要数据不能是任意的,而必须是一定范围内的值,可以使用枚举解决 2.枚举的格式 enum 类名{ 枚举值 } 例子 package com.dhb.enumerat ...
DEDECMS去除后门隐患和漏洞以及冗余代码的方法
链接:http://jingyan.baidu.com/article/4d58d541195bdb9dd4e9c029.html 工具/原料织梦网站管理系统 sublime编辑器方法/步骤第一 ...
vector 测试
vector 测试 */--> div.org-src-container { font-size: 85%; font-family: monospace; } pre.src { backg ...

机器学习之路： 深度学习 tensorflow 神经网络优化算法 学习率的设置

机器学习之路： 深度学习 tensorflow 神经网络优化算法 学习率的设置的更多相关文章

随机推荐

热门专题

机器学习之路：深度学习 tensorflow 神经网络优化算法学习率的设置

机器学习之路：深度学习 tensorflow 神经网络优化算法学习率的设置的更多相关文章