用keras实现基本的文本分类任务

数据集介绍

包含来自互联网电影数据库的50000条影评文本，对半拆分为训练集和测试集。训练集和测试集之间达成了平衡，意味着它们包含相同数量的正面和负面影评，每个样本都是一个整数数组，表示影评中的字词。每个标签都是整数值 0 或 1，其中 0 表示负面影评，1 表示正面影评。

注意事项

如果下载imdb数据集失败，可以在我的Github上下载：https://github.com/MartinLwx/ML-DL
影评文本已转换为整数，其中每个整数都表示字典中的一个特定字词
由于影评的长度必须相同，我们将使用pad_sequences函数将长度标准化
创建验证集

代码

import tensorflow as tf

import keras

import numpy as np

imdb = keras.datasets.imdb

(train_data, train_labels), (test_data, test_labels) = imdb.load_data(num_words=10000)

#填充数据

train_data = keras.preprocessing.sequence.pad_sequences(train_data,

                                                        value=0,

                                                        padding='post',

                                                        maxlen=256)

test_data = keras.preprocessing.sequence.pad_sequences(test_data,

                                                       value=0,

                                                       padding='post',

                                                       maxlen=256)

#构建模型

vocab_size = 10000

model = keras.Sequential()

model.add(keras.layers.Embedding(vocab_size, 16))

model.add(keras.layers.GlobalAveragePooling1D())     #对序列维度求平均值

model.add(keras.layers.Dense(16, activation=tf.nn.relu))

model.add(keras.layers.Dense(1, activation=tf.nn.sigmoid))

model.summary()

model.compile(optimizer=tf.train.AdamOptimizer(),

              loss='binary_crossentropy',

              metrics=['accuracy'])

#创建验证集

x_val = train_data[:10000]

partial_x_train = train_data[10000:]

y_val = train_labels[:10000]

partial_y_train = train_labels[10000:]

history = model.fit(partial_x_train,

                    partial_y_train,

                    epochs=40,

                    batch_size=512,

                    validation_data=(x_val, y_val),

                    verbose=1)	#训练集和测试集正确率分别是：97.87%，88.14%

result = model.evaluate(test_data,test_labels) #返回损失和准确率，我运行的结果是[0.34126000656127931, 0.86899999999999999]

参考

https://www.tensorflow.org/tutorials/keras/basic_text_classification?hl=zh-cn

用keras实现基本的文本分类任务的更多相关文章

万字总结Keras深度学习中文文本分类
摘要:文章将详细讲解Keras实现经典的深度学习文本分类算法,包括LSTM.BiLSTM.BiLSTM+Attention和CNN.TextCNN. 本文分享自华为云社区<Keras深度学习中文 ...
基于keras中IMDB的文本分类 demo
本次demo主题是使用keras对IMDB影评进行文本分类: import tensorflow as tf from tensorflow import keras import numpy a ...
[深度应用]·Keras实现Self-Attention文本分类（机器如何读懂人心）
[深度应用]·Keras实现Self-Attention文本分类(机器如何读懂人心) 配合阅读: [深度概念]·Attention机制概念学习笔记 [TensorFlow深度学习深入]实战三·分别使用 ...
Keras lstm 文本分类示例
#基于IMDB数据集的简单文本分类任务 #一层embedding层+一层lstm层+一层全连接层 #基于Keras 2.1.1 Tensorflow 1.4.0 代码: '''Trains an LS ...
文本分类：Keras+RNN vs传统机器学习
摘要:本文通过Keras实现了一个RNN文本分类学习的案例,并详细介绍了循环神经网络原理知识及与机器学习对比. 本文分享自华为云社区<基于Keras+RNN的文本分类vs基于传统机器学习的文本分 ...
AI - TensorFlow - 示例02：影评文本分类
影评文本分类文本分类(Text classification):https://www.tensorflow.org/tutorials/keras/basic_text_classificatio ...
《Convolutional Neural Networks for Sentence Classification》文本分类
文本分类任务中可以利用CNN来提取句子中类似 n-gram 的关键信息. TextCNN的详细过程原理图见下: keras 代码: def convs_block(data, convs=[3, 3, ...
Pytorch文本分类(imdb数据集)，含DataLoader数据加载，最优模型保存
用pytorch进行文本分类,数据集为keras内置的imdb影评数据(二分类),代码包含六个部分(详见代码) 使用环境: pytorch:1.1.0 cuda:10.0 gpu:RTX2070 (1 ...
中文文本分类之TextRNN
RNN模型由于具有短期记忆功能,因此天然就比较适合处理自然语言等序列问题,尤其是引入门控机制后,能够解决长期依赖问题,捕获输入样本之间的长距离联系.本文的模型是堆叠两层的LSTM和GRU模型,模型的结 ...

随机推荐

iframe跨域解决方案
公司某个功能用的是iframe,由于跨域的原因,我们不能直接设置父级页面iframe的高度,所以用了一个中间页home来完成父级页面iframe的高度设置,这种中间页其实很多时候不好用,因为涉及到页面 ...
openstack-KVM-Memory
一.Memory 1.查看memory信息 free -g cat /proc/meminfo dmesg | grep Memory 2.xml文件中的内存信息: vim /etc/libvirt/ ...
多线程系列之八：Thread-Per-Message模式
一,Thread-Per-Message模式翻译过来就是每个消息一个线程.message可以理解为命令,请求.为每一个请求新分配一个线程,由这个线程来执行处理.Thread-Per-Message ...
多线程系列之二：Single Thread Execution 模式
一,什么是SingleThreadExecution模式?同一时间内只能让一个线程执行处理二,例子 1.不安全的情况用程序模拟三个人频繁地通过一个只允许一个人经过的门.当人通过时,统计人数便会增 ...
Redis启动及密码修改
.cmd启动Redis: redis-server.exe redis.windows.conf #注意指定配置文件来启动 .cmd登陆redis redis-cli.exe -h -a .修改密码 ...
【Python3练习题 010】将一个正整数分解质因数。例如：输入90,打印出90=2*3*3*5。
#参考http://www.cnblogs.com/iderek/p/5959318.html n = num = int(input('请输入一个数字:')) #用num保留初始值 f = [] ...
自定义Attribute类
在我们的项目中有时经常会标识一些类的特性,在下面我们将简短的方式来介绍如何构建自定义的Attribute类. using System; using System.Collections.Generi ...
mysql对身份证号码进行脱敏处理
select * from test 格式:INSERT(str,pos,len,newstr) 解释: str:查询的例 pos:起始位置 len:从起始位置开始被后面newstr替换的长度 new ...
include与__autoload与命名空间namespace与PSR4详解
1. include, require, include_once, require_once include和require是PHP中引入源文件最基本的用法,其他例如__autoload, name ...
使用ultraiso制作启动盘安装windows操作系统
1. 使用ultraiso制作u盘启动盘在电脑上安装ultraiso: 启动ultraiso,文件->打开->选中iso镜像文件菜单栏->启动->写入硬盘映像 a. 便捷启 ...

用keras实现基本的文本分类任务

用keras实现基本的文本分类任务的更多相关文章

随机推荐

热门专题