keras训练大量数据的办法

最近在做一个鉴黄的项目，数据量比较大，有几百个G，一次性加入内存再去训练模青型是不现实的。

查阅资料发现keras中可以用两种方法解决，一是将数据转为tfrecord，但转换后数据大小会方法不好；另外一种就是利用generator，先一次加入所有数据的路径，然后每个batch的读入

# 读取图片函数

def get_im_cv2(paths, img_rows, img_cols, color_type=1, normalize=True):

    '''

    参数：

        paths：要读取的图片路径列表

        img_rows:图片行

        img_cols:图片列

        color_type:图片颜色通道

    返回:

        imgs: 图片数组

    '''

    # Load as grayscale

    imgs = []

    for path in paths:

        if color_type == 1:

            img = cv2.imread(path, 0)

        elif color_type == 3:

            img = cv2.imread(path)

        # Reduce size

        resized = cv2.resize(img, (img_cols, img_rows))

        if normalize:

            resized = resized.astype('float32')

            resized /= 127.5

            resized -= 1. 

        imgs.append(resized)

    return np.array(imgs).reshape(len(paths), img_rows, img_cols, color_type)

def get_train_batch(X_train, y_train, batch_size, img_w, img_h, color_type, is_argumentation):

    '''

    参数：

        X_train：所有图片路径列表

        y_train: 所有图片对应的标签列表

        batch_size:批次

        img_w:图片宽

        img_h:图片高

        color_type:图片类型

        is_argumentation:是否需要数据增强

    返回:

        一个generator，x: 获取的批次图片 y: 获取的图片对应的标签

    '''

    while 1:

        for i in range(0, len(X_train), batch_size):

            x = get_im_cv2(X_train[i:i+batch_size], img_w, img_h, color_type)

            y = y_train[i:i+batch_size]

            if is_argumentation:

                # 数据增强

                x, y = img_augmentation(x, y)

            # 最重要的就是这个yield，它代表返回，返回以后循环还是会继续，然后再返回。就比如有一个机器一直在作累加运算，但是会把每次累加中间结果告诉你一样，直到把所有数加完

            yield(np.array(x}, np.array(y))

result = model.fit_generator(generator=get_train_batch(X_train, y_train, train_batch_size, img_w, img_h, color_type, True),

          steps_per_epoch=1351,

          epochs=50, verbose=1,

          validation_data=get_train_batch(X_valid, y_valid, valid_batch_size,img_w, img_h, color_type, False),

          validation_steps=52,

          callbacks=[ckpt, early_stop],

          max_queue_size=capacity,

          workers=1)

参考：https://www.jianshu.com/p/5bdae9dcfc9c

https://keras.io/zh/models/model/

keras训练大量数据的办法的更多相关文章

Keras 训练 inceptionV3 并移植到OpenCV4.0 in C++
1. 训练 # --coding:utf--- import os import sys import glob import argparse import matplotlib.pyplot as ...
keras训练实例-python实现
用keras训练模型并实时显示loss/acc曲线,(重要的事情说三遍:实时!实时!实时!)实时导出loss/acc数值(导出的方法就是实时把loss/acc等写到一个文本文件中,其他模块如前端调用时 ...
keras训练cnn模型时loss为nan
keras训练cnn模型时loss为nan 1.首先记下来如何解决这个问题的:由于我代码中 model.compile(loss='categorical_crossentropy', optimiz ...
scipy笔记—scipy.misc.imresize用法(方便训练图像数据)
scipy.misc.imresize 不同于普通的reshape, imresize不是单纯的改变图像矩阵的维度,而是能将图片重采样为指定像素,这样给深度学习中训练图像数据带来方便. import ...
Solr4.6删除数据的办法
Solr4.6的管理界面上,假设不配置数据导入的功能,将看不到清除数据的button.我表示非常遗憾,正好我们线上没有配置数据导入的功能. 网上搜到的各种清理solr数据的HTTP请求,拿到我的sol ...
Solr4.3---4.6删除数据的办法
Solr4.6的管理界面上,如果不配置数据导入的功能,将看不到清除数据的按钮.我表示很遗憾,正好我们线上没有配置数据导入的功能. 网上搜到的各种清理solr数据的HTTP请求,拿到我的solr4.6上 ...
百度DMLC分布式深度机器学习开源项目（简称“深盟”）上线了如xgboost（速度快效果好的Boosting模型）、CXXNET（极致的C++深度学习库）、Minerva（高效灵活的并行深度学习引擎）以及Parameter Server（一小时训练600T数据）等产品，在语音识别、OCR识别、人脸识别以及计算效率提升上发布了多个成熟产品。
百度为何开源深度机器学习平台? 有一系列领先优势的百度却选择开源其深度机器学习平台,为何交底自己的核心技术?深思之下,却是在面对业界无奈时的远见之举. 5月20日,百度在github上开源了其 ...
keras训练函数fit和fit_generator对比，图像生成器ImageDataGenerator数据增强
1. [深度学习] Keras 如何使用fit和fit_generator https://blog.csdn.net/zwqjoy/article/details/88356094 ps:解决样本数 ...
使用Keras训练大规模数据集
官方提供的.flow_from_directory(directory)函数可以读取并训练大规模训练数据,基本可以满足大部分需求.但是在有些场合下,需要自己读取大规模数据以及对应标签,下面提供一种方法 ...

随机推荐

Delphi组件编辑器
看到Dev中的cxGrid组件的编辑器很强大,于是很想探究一下,跟踪cxGrid的代码比较麻烦,但原理大概知道一二.首先来研究一下设计器双击cxGrid弹出一个编辑窗体,选择窗体中的一个内容后,属性编 ...
lxml的XPath解析
BeautifulSoup 可以将lxml作为默认的解析器使用,同样lxml可以单独使用.下面比较这两者之间优缺点: BeautifulSoup和lxml原理不一样,BeautifulSoup是基于D ...
axios在Vue中的简单应用（一）
1.安装axios: npm install --save axios vue-axios 2.安装qs: qs.stringify(data)可以解决data数据格式问题 npm install - ...
CISCO路由器WAN口动态ISP配置
Building configuration... version 15.0 service timestamps debug datetime msec service timestamps ...
win10安装tensorflow (cpu版)
前提: 下载anaconda,然后创建一个python虚拟环境: 命令: conda create -n tf_cpu python=3.6 # (tf_cpu 是这个虚拟环境的名字) ...
西安邀请赛-E（树链剖分+线段树）
题目链接:https://nanti.jisuanke.com/t/39272 题意:给一棵树,n个结点,树根为1,n-1条边,每个结点有一个权值.进行3种操作: 1 s t:把1和s之间的最短路径上 ...
JCC指令
0.JMP1.JE, JZ 结果为零则跳转(相等时跳转) ZF=12.JNE, JNZ 结果不为零则跳转(不相等时跳转) ZF=03.JS 结果为负则跳转 SF=14.JNS 结果为非负则 ...
TCP/IP 协议是如何保证数据可靠性的？
原文: 网络基础:TCP协议-如何保证传输可靠性 TCP协议传输的特点主要就是面向字节流.传输可靠.面向连接.这篇博客,我们就重点讨论一下TCP协议如何确保传输的可靠性的. 确保传输可靠性的方式TCP ...
Postman之简单使用
前提:已获得接口文档 / 抓包数据 1.启动Postman 直接在这个页面输入数据(不用管其他的地方!!!) 2.按照接口文档填入注意蓝色框中的数据请求方式:POST(几乎都是使用POST/GET ...
JavaSE--异常机制
异常就是程序在运行时出现的不正常情况.发生在运行时期,java程序在运行时期发生的不正常情况,此时java就按照面向对象的思想对不正常现象进行描述和对象的封装.异常的由来:问题也是现实生活中一个具体的 ...

keras训练大量数据的办法

keras训练大量数据的办法的更多相关文章

随机推荐

热门专题