深度学习基础系列（四）| 理解softmax函数

　　深度学习最终目的表现为解决分类或回归问题。在现实应用中，输出层我们大多采用softmax或sigmoid函数来输出分类概率值，其中二元分类可以应用sigmoid函数。

　　而在多元分类的问题中，我们默认采用softmax函数，具体表现为将多个神经元的输出，映射到0 ~ 1的区间中，按概率高低进行分类，各概率之和为1。

　　某分类的概率数学表达式为：y_i= eⁱ/ ∑_j=1e^j

　　具体来说，假设有四个输出单元，分别为：

　　y₁= e^x1/ (e^x1+ e^x2+ e^x3+ e^x4)，假设其概率为0.4
　　y₂= e^x2/ (e^x1+ e^x2+ e^x3+ e^x4)，假设其概率为0.15
　　y₃= e^x3/ (e^x1+ e^x2+ e^x3+ e^x4)，假设其概率为0.15
　　y₄= e^x4/ (e^x1+ e^x2+ e^x3+ e^x4)，假设其概率为0.3

　　可以看出 y₁ + y₂+ y₃+ y₄ = 1。并且其中某神经元的输出若增加，则其他神经元的输出则减少，反之也成立。

　　最后再看看softmax函数如何求导，令y = e^xⁱ/ ∑e^xk ，分两种情况：

　　1. i为softmax值，我们对e^xi求导，

　　与此相关的基础求导公式：(u/v)^'= (u^'v - uv^') / v² 和 (e^x)^'= e^x，并应用链式法则可得求导过程：

　　　dy/de^xi= ( e^xⁱ/ ∑e^xk)^'

　　　　　　 = (e^xi* ∑e^xk - e^xi* e^xi) / (∑e^xk)²

　　　　　　 = e^xⁱ/ ∑e^xk - (e^xⁱ/ ∑e^xk) * (e^xⁱ/ ∑e^xk)

　　　　　　 = y_xi - y_xi²

　　2. i不为softmax值，我们依然对e^xi求导，其过程为：

　　　dy/de^xi= ( e^x^j/ ∑e^xk)^' 注：i ≠ j

　　　　　　 = (0 * ∑e^xk- e^xj* e^xi) / (∑e^xk)²

　　　　　　 = -1 * (e^xⁱ/ ∑e^xk) * (e^xj/ ∑e^xk)

　　　　　　 = - y_xi* y_xj

深度学习基础系列（四）| 理解softmax函数的更多相关文章

深度学习基础系列（五）| 深入理解交叉熵函数及其在tensorflow和keras中的实现
在统计学中,损失函数是一种衡量损失和错误(这种损失与“错误地”估计有关,如费用或者设备的损失)程度的函数.假设某样本的实际输出为a,而预计的输出为y,则y与a之间存在偏差,深度学习的目的即是通过不断地 ...
深度学习基础系列（九）| Dropout VS Batch Normalization? 是时候放弃Dropout了
Dropout是过去几年非常流行的正则化技术,可有效防止过拟合的发生.但从深度学习的发展趋势看,Batch Normalizaton(简称BN)正在逐步取代Dropout技术,特别是在卷积层.本文将首 ...
深度学习基础系列（七）| Batch Normalization
Batch Normalization(批量标准化,简称BN)是近些年来深度学习优化中一个重要的手段.BN能带来如下优点: 加速训练过程: 可以使用较大的学习率: 允许在深层网络中使用sigmoid这 ...
深度学习基础系列（十一）| Keras中图像增强技术详解
在深度学习中,数据短缺是我们经常面临的一个问题,虽然现在有不少公开数据集,但跟大公司掌握的海量数据集相比,数量上仍然偏少,而某些特定领域的数据采集更是非常困难.根据之前的学习可知,数据量少带来的最直接 ...
深度学习基础（四） Dropout_Improving neural networks by preventing co-adaptation of feature detectors
该笔记是我快速浏览论文后的记录,部分章节并没有仔细看,所以比较粗糙. 从摘要中可以得知,论文提出在每次训练时通过随机忽略一半的feature detectors(units)可以极大地降低过拟合.该方 ...
深度学习基础系列（十）| Global Average Pooling是否可以替代全连接层？
Global Average Pooling(简称GAP,全局池化层)技术最早提出是在这篇论文(第3.2节)中,被认为是可以替代全连接层的一种新技术.在keras发布的经典模型中,可以看到不少模型甚至 ...
深度学习基础系列（一）| 一文看懂用kersa构建模型的各层含义（掌握输出尺寸和可训练参数数量的计算方法）
我们在学习成熟网络模型时,如VGG.Inception.Resnet等,往往面临的第一个问题便是这些模型的各层参数是如何设置的呢?另外,我们如果要设计自己的网路模型时,又该如何设置各层参数呢?如果模型 ...
深度学习基础系列（三）| sigmoid、tanh和relu激活函数的直观解释
常见的激活函数有sigmoid.tanh和relu三种非线性函数,其数学表达式分别为: sigmoid: y = 1/(1 + e-x) tanh: y = (ex - e-x)/(ex + e-x) ...
多线程学习-基础（四）常用函数说明：sleep-join-yield
一.常用函数的使用 (1)Thread.sleep(long millis):在指定的毫秒内让当前正在执行的线程休眠(暂停执行),休眠时不会释放当前所持有的对象的锁.(2)join():主线程等待子线 ...

随机推荐

Linux块设备和字符设备
块设备:系统能够随机无序访问固定大小的数据片的设备,这些数据片称为块.块设备是以固定大小长度来传送资料的,它使用缓冲区暂存数据,时机成熟后从缓存中一次性写入到设备或者从设备中一次性放到缓存区.常见的块 ...
[转载]asp.net mvc: why is Html.CheckBox generating an additional hidden input
http://stackoverflow.com/questions/2697299/asp-net-mvc-why-is-html-checkbox-generating-an-additional ...
【数据库】SQL经典面试题 - 数据库查询 - 子查询应用二
上节课我们通过子查询,完成了查询的最高分学生的需求,今天我们来学习子查询的分类,以及通过子查询来完成工作中经常遇到一些个性化需求. 子查询概念: 一个SELECT语句嵌套在另一个SELECT语句中,子 ...
transform 动画效果
http://www.css88.com/tool/css3Preview/Transform.html transform的含义是:改变,使…变形:转换 transform的属性包括:rotate( ...
jQuery动态给下拉列表添加一个选项(创建DOM对象)
使用的函数:
Redis相关链接
Redis 教程 http://www.runoob.com/redis/redis-data-types.html Python操作redis学习系列之(集合)set,redis set详解 (六) ...
JAVA中分为基本数据类型和引用数据类型区别
一.基本数据类型: byte:Java中最小的数据类型,在内存中占8位(bit),即1个字节,取值范围-128~127,默认值0 short:短整型,在内存中占16位,即2个字节,取值范围-32768 ...
数据库-mysql安装
MySQL 安装所有平台的Mysql下载地址为: MySQL 下载. 挑选你需要的 MySQL Community Server 版本及对应的平台. Linux/UNIX上安装Mysql Linux ...
用戶登陸。防SQL注入，驗證碼不區分大小寫。。
if (string.Compare(TBCheckCode.Text, Session["CheckCodeI"].ToString(), true) == 0) ...
C++ "multiple definition of .. first defined here"
C++ "multiple definition of .. first defined here" 在C++中,有时候需要在不同文件中使用同一个变量.对于这类变量如果处理不当,很 ...

深度学习基础系列（四）| 理解softmax函数

深度学习基础系列（四）| 理解softmax函数的更多相关文章

随机推荐

热门专题