TensorFlow多线程输入数据处理框架（三）—

参考书

《TensorFlow：实战Google深度学习框架》（第2版）

通过TensorFlow提供的tf.train.batch和tf.train.shuffle_batch函数来将单个的样例组织成batch的形式输出。

#!/usr/bin/env python

# -*- coding: UTF-8 -*-

# coding=utf-8 

"""

@author: Li Tian

@contact: 694317828@qq.com

@software: pycharm

@file: sample_data_deal2.py

@time: 2019/2/4 11:15

@desc: 通过TensorFlow提供的tf.train.batch和tf.train.shuffle_batch函数来将单个的样例组织成batch的形式输出。

"""

import tensorflow as tf

# 使用tf.train.match_filenames_once函数获取文件列表

files = tf.train.match_filenames_once('./data.tfrecords-*')

# 通过tf.train.string_input_producer函数创建输入队列，输入队列中的文件列表为

# tf.train.match_filenames_once函数获取的文件列表。这里将shuffle参数设为False

# 来避免随机打乱读文件的顺序。但一般在解决真实问题时，会将shuffle参数设置为True

filename_queue = tf.train.string_input_producer(files, shuffle=False)

# 如前面所示读取并解析一个样本

reader = tf.TFRecordReader()

_, serialized_example = reader.read(filename_queue)

features = tf.parse_single_example(

    serialized_example,

    features={

        'i': tf.FixedLenFeature([], tf.int64),

        'j': tf.FixedLenFeature([], tf.int64),

    }

)

# 使用前面的方法读取并解析得到的样例。这里假设Example结构中i表示一个样例的特征向量

# 比如一张图像的像素矩阵。而j表示该样例对应的标签。

example, label = features['i'], features['j']

# 一个batch中样例的个数。

batch_size = 3

# 组合样例的队列中最多可以存储的样例个数。这个队列如果太大，那么需要占用很多内存资源；

# 如果太小，那么出队操作可能会因为没有数据而被阻碍（block），从而导致训练效率降低。

# 一般来说这个队列的大小会和每一个batch的大小相关，下面一行代码给出了设置队列大小的一种方式。

capacity = 1000 + 3 * batch_size

# 使用tf.train.batch函数来组合样例。[example, label]参数给出了需要组合的元素，

# 一般example和label分别代表训练样本和这个样本对应的正确标签。batch_size参数给出了

# 每个batch中样例的个数。capacity给出了队列的最大容量。每当队列长度等于容量时，

# TensorFlow将暂停入队操作，而只是等待元素出队。当元素个数小于容量时，

# TensorFlow将自动重新启动入队操作。

# example_batch, label_batch = tf.train.batch([example, label], batch_size=batch_size, capacity=capacity)

# 使用tf.train.shuffle_batch函数来组合样例。tf.train.shuffle_batch函数的参数

# 大部分都和tf.train.batch函数相似，但是min_after_dequeue参数是tf.train.shuffle_batch

# 函数特有的。min_after_dequeue参数限制了出队时队列中元素的最少个数。当队列中元素太少时，

# 随机打乱样例顺序的作用就不大了。所以tf.train.shuffle_batch函数提供了限制出队时最少元素的个数

# 来保证随机打乱顺序的作用。当出队函数被调用但是队列中元素不够时，出队操作将等待更多的元素入队

# 才会完成。如果min_after_dequeue参数被设定，capacity也应该相应调整来满足性能需求。

example_batch, label_batch = tf.train.shuffle_batch([example, label], batch_size=batch_size, capacity=capacity, min_after_dequeue=30)

with tf.Session() as sess:

    tf.local_variables_initializer().run()

    tf.global_variables_initializer().run()

    coord = tf.train.Coordinator()

    threads = tf.train.start_queue_runners(sess=sess, coord=coord)

    # 获取并打印组合之后的样例。在真实问题中，这个输出一般会作为神经网络的输入。

    for i in range(2):

        cur_example_batch, cur_label_batch = sess.run([example_batch, label_batch])

        print(cur_example_batch, cur_label_batch)

    coord.request_stop()

    coord.join(threads)

运行结果：

1. 使用tf.train.batch函数来组合样例

2. 使用tf.train.shuffle_batch函数来组合样例

3. 两个函数的区别

tf.train.batch函数不会随机打乱顺序，而tf.train.shuffle_batch会随机打乱顺序。

TensorFlow多线程输入数据处理框架（三）——组合训练数据的更多相关文章

TensorFlow多线程输入数据处理框架（四）——输入数据处理框架
参考书 <TensorFlow:实战Google深度学习框架>(第2版) 输入数据处理的整个流程. #!/usr/bin/env python # -*- coding: UTF-8 -* ...
Tensorflow多线程输入数据处理框架
Tensorflow提供了一系列的对图像进行预处理的方法,但是复杂的预处理过程会减慢整个训练过程,所以,为了避免图像的预处理成为训练神经网络效率的瓶颈,Tensorflow提供了多线程处理输入数据的框 ...
TensorFlow多线程输入数据处理框架（二）——输入文件队列
参考书 <TensorFlow:实战Google深度学习框架>(第2版) 一个简单的程序来生成样例数据. #!/usr/bin/env python # -*- coding: UTF-8 ...
Tensorflow多线程输入数据处理框架（一）——队列与多线程
参考书 <TensorFlow:实战Google深度学习框架>(第2版) 对于队列,修改队列状态的操作主要有Enqueue.EnqueueMany和Dequeue.以下程序展示了如何使用这 ...
tensorflow学习笔记——多线程输入数据处理框架
之前我们学习使用TensorFlow对图像数据进行预处理的方法.虽然使用这些图像数据预处理的方法可以减少无关因素对图像识别模型效果的影响,但这些复杂的预处理过程也会减慢整个训练过程.为了避免图像预处理 ...
吴裕雄 python 神经网络——TensorFlow 输入数据处理框架
import tensorflow as tf files = tf.train.match_filenames_once("E:\\MNIST_data\\output.tfrecords ...
吴裕雄--天生自然 pythonTensorFlow图形数据处理：输入数据处理框架
import tensorflow as tf # 1. 创建文件列表,通过文件列表创建输入文件队列 files = tf.train.match_filenames_once("F:\\o ...
（第二章第三部分）TensorFlow框架之读取二进制数据
系列博客链接: (第二章第一部分)TensorFlow框架之文件读取流程:https://www.cnblogs.com/kongweisi/p/11050302.html (第二章第二部分)Tens ...
Hadoop 1.0 和 2.0 中的数据处理框架 - MapReduce
1. MapReduce - 映射.化简编程模型 1.1 MapReduce 的概念 1.1.1 map 和 reduce 1.1.2 shufftle 和排序 MapReduce 保证每个 red ...

随机推荐

JQUERY多选框，单选框，检查选中的值
var str=""; $(":checkbox:checked").each(function(){ if($(this).attr("checke ...
Objective-C之成魔之路【10-继承性】
郝萌主倾心贡献.尊重作者的劳动成果.请勿转载. 假设文章对您有所帮助,欢迎给作者捐赠,支持郝萌主.捐赠数额任意.重在心意^_^ 我要捐赠: 点击捐赠 Cocos2d-X源代码下载:点我传送继承性是面 ...
mysql下distinct和group by区别对比
在数据表中记录了用户验证时使用的书目,现在想取出所有书目,用DISTINCT和group by都取到了我想要的结果,但我发现返回结果排列不同,distinct会按数据存放顺序一条条显示,而group ...
appium server参数
转自: http://m.blog.csdn.net/blog/kittyboy0001/40893979 appium Appium是一个开源的,适用于原生或混合移动应用应用( hybrid mob ...
pyspark mongodb yarn
from pyspark.sql import SparkSession my_spark = SparkSession \ .builder \ .appName("myApp" ...
Spring Boot 访问静态资源
方法1一: 在resources目录下建立static的目录,将静态资源放到此处,可以直接访问访问:127.0.0.1:9010/img/123.png
Codeforces Beta Round #25 (Div. 2 Only)D. Roads not only in Berland
D. Roads not only in Berland time limit per test 2 seconds memory limit per test 256 megabytes input ...
HDU 1081：To The Max
To The Max Time Limit: 2000/1000 MS (Java/Others) Memory Limit: 65536/32768 K (Java/Others) Total ...
计算机学院大学生程序设计竞赛（2015’12）Bitwise Equations
Bitwise Equations Time Limit: 2000/1000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Others ...
tuple built-in function
tuple tips: 1.对于Python中的tuple类型来说,他与其它的序列类型来讲最大的不同就是tuple是不可变的. 2.当你需要创建一个只有一个元素的tuple时,需要在元祖分隔符里面加一 ...

TensorFlow多线程输入数据处理框架（三）——组合训练数据

参考书

运行结果：

TensorFlow多线程输入数据处理框架（三）——组合训练数据的更多相关文章

随机推荐

热门专题