交叉熵

二次代价函数

原理

缺陷

假如我们目标是收敛到0。A点为0.82离目标比较近,梯度比较大，权值调整比较大。B点为0.98离目标比较远,梯度比较小,权值调整比较小。调整方案不合理。

交叉熵代价函数(cross-entropy)

换一个思路，我们不改变激活函数，而是改变代价函数，改用交叉熵代价函数：

原理

用法

实战

import tensorflow as tf

from tensorflow.examples.tutorials.mnist import input_data

tf.compat.v1.disable_eager_execution()

import numpy as np

#载入数据集

mnist=input_data.read_data_sets("MNIST_data",one_hot=True)

#每个批次大小

batch_size=100

#计算一共有多少个批次

n_bath=mnist.train.num_examples // batch_size

print(n_bath)

#定义两个placeholder

x=tf.compat.v1.placeholder(tf.float32,[None,784])

y=tf.compat.v1.placeholder(tf.float32,[None,10])

#创建一个简单的神经网络

W=tf.Variable(tf.zeros([784,10]))

b=tf.Variable(tf.zeros([10]))

prediction=tf.nn.softmax(tf.matmul(x,W)+b)

#交叉熵函数

loss=tf.reduce_mean(tf.nn.softmax_cross_entropy_with_logits(labels=y,logits=prediction))

#梯度下降

train_step=tf.compat.v1.train.GradientDescentOptimizer(0.2).minimize(loss)

#初始化变量

init=tf.compat.v1.global_variables_initializer()

#结果存放在一个布尔型列表中

#返回的是一系列的True或False argmax返回一维张量中最大的值所在的位置，对比两个最大位置是否一致

correct_prediction=tf.equal(tf.argmax(y,1),tf.argmax(prediction,1))

#求准确率

#cast：将布尔类型转换为float，将True为1.0，False为0，然后求平均值

accuracy=tf.reduce_mean(tf.cast(correct_prediction,tf.float32))

with tf.compat.v1.Session() as sess:

    sess.run(init)

    for epoch in range(21):

        for batch in range(n_bath):

            #获得一批次的数据，batch_xs为图片，batch_ys为图片标签

            batch_xs,batch_ys=mnist.train.next_batch(batch_size)

            #进行训练

            sess.run(train_step,feed_dict={x:batch_xs,y:batch_ys})

        #训练完一遍后，测试下准确率的变化

        acc=sess.run(accuracy,feed_dict={x:mnist.test.images,y:mnist.test.labels})

        print("Iter "+str(epoch)+",Testing Accuracy "+str(acc))

输出：明显可以看到有了巨大的变化

拟合

防止过拟合

代码

import tensorflow as tf

from tensorflow.examples.tutorials.mnist import input_data

tf.compat.v1.disable_eager_execution()

import numpy as np

#载入数据集

mnist=input_data.read_data_sets("MNIST_data",one_hot=True)

# 批次的大小

batch_size = 128

n_batch = mnist.train.num_examples // batch_size

x = tf.compat.v1.placeholder(tf.float32, [None,784])

y = tf.compat.v1.placeholder(tf.float32, [None, 10])

keep_prob = tf.compat.v1.placeholder(tf.float32)

# 创建神经网络

W1 = tf.Variable(tf.compat.v1.truncated_normal([784,2000],stddev=0.1))

b1 = tf.Variable(tf.zeros([1, 2000]))

# 激活层

layer1 = tf.nn.relu(tf.matmul(x,W1) + b1)

# drop层

layer1 = tf.nn.dropout(layer1,keep_prob)

# 第二层

W2 = tf.Variable(tf.compat.v1.truncated_normal([2000,500],stddev=0.1))

b2 = tf.Variable(tf.zeros([1, 500]))

layer2 = tf.nn.relu(tf.matmul(layer1,W2) + b2)

layer2 = tf.nn.dropout(layer2,keep_prob)

# 第三层

W3 = tf.Variable(tf.compat.v1.truncated_normal([500,10],stddev=0.1))

b3 = tf.Variable(tf.zeros([1,10]))

prediction = tf.nn.sigmoid(tf.matmul(layer2,W3) + b3)

loss = tf.reduce_mean(tf.nn.softmax_cross_entropy_with_logits(labels=y, logits=prediction))

# 梯度下降法

# train_step = tf.train.GradientDescentOptimizer(0.2).minimize(loss)#得到97的正确率

train_step = tf.compat.v1.train.AdadeltaOptimizer(0.1).minimize(loss)

# 初始化变量

init = tf.compat.v1.global_variables_initializer()

prediction_2 = tf.nn.softmax(prediction)

# 得到一个布尔型列表，存放结果是否正确

correct_prediction = tf.equal(tf.argmax(y,1), tf.argmax(prediction_2,1)) #argmax 返回一维张量中最大值索引

# 求准确率

accuracy = tf.reduce_mean(tf.cast(correct_prediction,tf.float32)) # 把布尔值转换为浮点型求平均数

with tf.compat.v1.Session() as sess:

    sess.run(init)

    for epoch in range(100):

        for batch in range(n_batch):

            # 获得批次数据

            batch_xs, batch_ys = mnist.train.next_batch(batch_size)

            sess.run(train_step, feed_dict={x:batch_xs, y:batch_ys, keep_prob:0.8})

        test_acc = sess.run(accuracy, feed_dict={x:mnist.test.images,y:mnist.test.labels,keep_prob:1.0} )

        train_acc = sess.run(accuracy, feed_dict={x: mnist.train.images, y: mnist.train.labels, keep_prob: 1.0})

        print("Iter " + str(epoch) + ",Testing Accuracy " + str(test_acc) + ",Train Accuracy " + str(train_acc))

Tensorflow-交叉熵&过拟合的更多相关文章

深度学习原理与框架-Tensorflow卷积神经网络-卷积神经网络mnist分类 1.tf.nn.conv2d(卷积操作) 2.tf.nn.max_pool(最大池化操作) 3.tf.nn.dropout(执行dropout操作) 4.tf.nn.softmax_cross_entropy_with_logits(交叉熵损失) 5.tf.truncated_normal(两个标准差内的正态分布)
1. tf.nn.conv2d(x, w, strides=[1, 1, 1, 1], padding='SAME') # 对数据进行卷积操作参数说明:x表示输入数据,w表示卷积核, stride ...
TensorFlow笔记-06-神经网络优化-损失函数,自定义损失函数,交叉熵
TensorFlow笔记-06-神经网络优化-损失函数,自定义损失函数,交叉熵神经元模型:用数学公式比表示为:f(Σi xi*wi + b), f为激活函数神经网络是以神经元为基本单位构成的激 ...
『TensorFlow』分类问题与两种交叉熵
关于categorical cross entropy 和 binary cross entropy的比较,差异一般体现在不同的分类(二分类.多分类等)任务目标,可以参考文章keras中两种交叉熵损失 ...
机器学习之路：tensorflow 深度学习中分类问题的损失函数交叉熵
经典的损失函数----交叉熵 1 交叉熵: 分类问题中使用比较广泛的一种损失函数, 它刻画两个概率分布之间的距离给定两个概率分布p和q, 交叉熵为: H(p, q) = -∑ p(x) log q( ...
TF Boys (TensorFlow Boys ) 养成记（五）： CIFAR10 Model 和 TensorFlow 的四种交叉熵介绍
有了数据,有了网络结构,下面我们就来写 cifar10 的代码. 首先处理输入,在 /home/your_name/TensorFlow/cifar10/ 下建立 cifar10_input.py,输 ...
Tensorflow手写数字识别（交叉熵）练习
# coding: utf-8import tensorflow as tffrom tensorflow.examples.tutorials.mnist import input_data #pr ...
5 TensorFlow实战Google深度学习框架一书中的错误两处（交叉熵定义有误）
第一处: 书中62页定义的交叉熵函数定义有误,虽然这个所谓交叉熵的数值能够减少,但是是不能提升预测性能的,因为定义就错了. 我已经将预测过程可视化,直接将交叉熵改为我的,或者用原书的,就可以看到预测结 ...
TensorFlow 实战（一）—— 交叉熵（cross entropy）的定义
对多分类问题(multi-class),通常使用 cross-entropy 作为 loss function.cross entropy 最早是信息论(information theory)中的概念 ...
经典损失函数：交叉熵（附tensorflow）
每次都是看了就忘,看了就忘,从今天开始,细节开始,推一遍交叉熵. 我的第一篇CSDN,献给你们(有错欢迎指出啊). 一.什么是交叉熵交叉熵是一个信息论中的概念,它原来是用来估算平均编码长度的.给定两 ...
吴裕雄--天生自然 pythonTensorFlow自然语言处理：交叉熵损失函数
import tensorflow as tf # 1. sparse_softmax_cross_entropy_with_logits样例. # 假设词汇表的大小为3, 语料包含两个单词" ...

随机推荐

java基础: ArrayList集合应用, ArrayList增删改查详解,综合java基础实现学生管理系统,
1.ArrayList 集合和数组的区别 : 共同点:都是存储数据的容器不同点:数组的容量是固定的,集合的容量是可变的 1.1 -ArrayList的构造方法和添加方法 public ArrayLi ...
Phthon几个特殊的函数
Python有几个相对特殊的函数,他们并不会提高工作效率,但是会使代码优雅简洁,其中包括lambda, map, reduce, filter, yeild. 第一:lambda,贴些代码体会. 1 ...
利用设计模式消除业务代码中的 if-else
准备工作:假设这样的一个业务场景:有一个自动开票的功能需要实现,在程序里面需要根据账单的类型执行对应的处理逻辑. 以下使用了 Lombok 简化代码!!! 账单类型枚举: /** * @author ...
Java发送企业微信应用消息
1.发送消息与被动回复消息 (1)流程不同:发送消息是第三方服务器主动通知微信服务器向用户发消息.而被动回复消息是用户发送消息之后,微信服务器将消息传递给第三方服务器,第三方服务器接收到消息后,再 ...
自动化运维工具-Ansible之4-变量
自动化运维工具-Ansible之4-变量目录自动化运维工具-Ansible之4-变量变量概述变量的定义和调用变量优先级测试变量优先级测试二变量注册 facts缓存变量概述变量提供 ...
redis基础-Remote Dictionary Server
Redis支持多个数据库,并且每个数据库的数据是隔离的不能共享,并且基于单机才有,如果是集群就没有数据库的概念. Redis默认支持16个数据库(可以通过配置文件支持更多,无上限),可以通过配置dat ...
JavaScript入门-学习笔记(二)
关于js变量变量,就是一个用来存储数据的容器一般来说,我们的变量都是可以得先声明,再使用,就像是一个东西先必须存在,才能看得见摸得着.然而在js里(es5),可以先使用,后声明. a = 100; ...
有哪些适合个人开发的微信小程序
微信小程序提供了一个简单.高效的应用开发框架和丰富的组件及API,帮助开发者在微信中开发具有原生 APP 体验的服务. 微信小程序支持采用云开发模式,无需后台服务,十分的方便快捷,适合个人开发一些工具 ...
Docker-ce Centos8 笔记二：常见问题
阿里云OSS整合
一.对象存储OSS 为了解决海量数据存储与弹性扩容(主要是静态文件的存储例如图片,语音,视频等),项目中我们通常采用云存储的解决方案- 阿里云OSS. 1.开通"对象存储OSS"服 ...

Tensorflow-交叉熵&过拟合

交叉熵

二次代价函数

原理

缺陷

交叉熵代价函数(cross-entropy)

原理

用法

实战

拟合

防止过拟合

代码

Tensorflow-交叉熵&过拟合的更多相关文章

随机推荐

热门专题