论文笔记：Towards Diverse and Natural Image Descriptions via a Conditional GAN

论文笔记：Towards Diverse and Natural Image Descriptions via a Conditional GAN

ICCV 2017

Paper: http://openaccess.thecvf.com/content_ICCV_2017/papers/Dai_Towards_Diverse_and_ICCV_2017_paper.pdf

Implementation(Torch): https://github.com/doubledaibo/gancaption_iccv2017

本文的目标是想产生高质量的图像描述语句：more Natural and Diverse !

所以本文采用了 Conditional GAN 来实现这一想法，通过控制 random noise vector Z 来生成具有多样性的语句。

其实模型的整体思路和 seqGAN 是一致的，就是利用 Generator 来产生一个句子，然后交给 Discriminator 来进行判断。

不同之处在于，与 NLP 中的文本生成不同，Image Caption 需要根据图像的内容进行句子的产生，然后就变成了 Conditional GAN 了。文章的写作也是重点体现 CGAN 的作用。

如上图所示，作者也将 random noise Z 添加进去，以控制产生文本的多样性，基于这两个条件，提取特征，输入给 LSTM，每一个时刻输出一个单词，直到遇到表示句子停止的单词符号为止（例如，[End]）。这样就生成了一个句子。

然后作者用 LSTM 提取生成的句子和 Ground Truth 句子的向量，然后塞给 Discriminator，进行判断。

重点来了，因为文本的生成是离散的符号生成问题，原本用于图像生成的 CGAN 并不能直接用于此任务。因为梯度的些许改变，也许并不能改变其输出。

所以，这里需要强化学习技术 Policy Gradient 来进行转换，将判别器的得分输出，转变为智能体的奖赏 r，优化产生器的参数，使其输出的句子能够获得最大的奖励，从而使得最终获得较好的文本生成效果。这样就把文本的生成问题，看做是强化学习中的动作选择问题（Action Selection）。

如上图所示，当给你某一段生成的部分句子，由于交给判别器进行打分，需要完成的一句话。所以，文章采用蒙特卡洛 Rollout 的方法，将句子进行补充完整。然后才交给判别器进行打分，获得奖励信号。根据得到的奖励信号，再进行梯度的调整，进而完成产生器 G 的优化。

所以，期望累积奖赏为：

其梯度为：

其中，$\pi$ 那一项是强化学习中的策略（Policy），将条件 f(I), Z 以及接下来的单词 $S_{1:t-1}$ 作为输入，并且产生一个在拓展词汇表中的条件分布（a conditional distribution over the extended vocabulary），即：产生的所有单词加一个表示语句结束的符号，记为 e。奖励是，该得分是由判别器 E 给出的。

此外，作者也将该模型拓展到产生段落文字的应用场景（利用 Hierarchical LSTM design）。

论文笔记：Towards Diverse and Natural Image Descriptions via a Conditional GAN的更多相关文章

论文笔记：Tracking by Natural Language Specification
Tracking by Natural Language Specification 2018-04-27 15:16:13 Paper: http://openaccess.thecvf.com/ ...
#论文笔记# [pix2pixHD] High-Resolution Image Synthesis and Semantic Manipulation with Conditional GANs
Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu, Andrew Tao, Jan Kautz, and Bryan Catanzaro. "High-Res ...
论文笔记之：Natural Language Object Retrieval
论文笔记之:Natural Language Object Retrieval 2017-07-10 16:50:43 本文旨在通过给定的文本描述,在图像中去实现物体的定位和识别.大致流程图如下 ...
Deep Learning论文笔记之（八）Deep Learning最新综述
Deep Learning论文笔记之(八)Deep Learning最新综述 zouxy09@qq.com http://blog.csdn.net/zouxy09 自己平时看了一些论文,但老感觉看完 ...
Multimodal —— 看图说话（Image Caption）任务的论文笔记（一）评价指标和NIC模型
看图说话(Image Caption)任务是结合CV和NLP两个领域的一种比较综合的任务,Image Caption模型的输入是一幅图像,输出是对该幅图像进行描述的一段文字.这项任务要求模型可以识别图 ...
论文笔记：Mastering the game of Go with deep neural networks and tree search
Mastering the game of Go with deep neural networks and tree search Nature 2015 这是本人论文笔记系列第二篇 Nature ...
Deep Learning论文笔记之（四）CNN卷积神经网络推导和实现（转）
Deep Learning论文笔记之(四)CNN卷积神经网络推导和实现 zouxy09@qq.com http://blog.csdn.net/zouxy09 自己平时看了一些论文, ...
论文笔记之：Visual Tracking with Fully Convolutional Networks
论文笔记之:Visual Tracking with Fully Convolutional Networks ICCV 2015 CUHK 本文利用 FCN 来做跟踪问题,但开篇就提到并非将其看做 ...
Twitter 新一代流处理利器——Heron 论文笔记之Heron架构
Twitter 新一代流处理利器--Heron 论文笔记之Heron架构标签(空格分隔): Streaming-process realtime-process Heron Architecture ...

随机推荐

check failed status == cudnn_status_success (4 vs. 0) cudnn_status_internal_error
Check failed: error == cudaSuccess (30 vs. 0) unknown error 这个有可能是显存不足造成的,或者网络参数不对造成的 check failed ...
war 包tomcat部署和maven的tomcat插件部署的不同
不用插件 1在linux服务器上下载号tomcat 或者上传tomcat 2上传war包,最好创建一个目录房war包,和tomcat 3解压war包,jar -xvf war 或者unzip wa ...
【论文阅读】Deep Mixture of Diverse Experts for Large-Scale Visual Recognition
导读: 本文为论文<Deep Mixture of Diverse Experts for Large-Scale Visual Recognition>的阅读总结.目的是做大规模图像分类 ...
bootstrap 自适应和响应式布局的区别
自适应: 不管屏幕多大,都尽量不换行,而只是横向缩放. 响应式: 屏幕变小了之后,属于同一行的元素受到挤压后,行的右边元素自动换行显式: 屏幕大了后,本属于同一行的元素尽可能的排在同一行内: boo ...
urlib库的使用
urlib库实际上不是很常用,因为其api调用复杂,已被requests模块取代. 1.request发送请求 from urllib import request #默认指定的是get请求 #url ...
使用LVM进行分区扩展的记录
场景:在磁盘分区空间不够的情况下,要扩展分区空间因为使用的是虚拟机,所以可以对原有的硬盘上进行扩展,而不需要新增一个硬盘 1.扩展磁盘并使用fdisk工具进行分区虚拟机关机后对磁盘进行扩展,扩展到 ...
MATLAB多项式运算
序言 none 正文 1. 多项式的表示在Matlab中,多项式用一个行向量表示, 行向量的元素值为多项式系数按幂次的降序排列, 如p(x)=x3-2x-5用P=[1,0,-2,-5]表示. 2. ...
Java中几个常用类
1.1 包装类把八大基本数据类型封装到一个类中,并提供属性和方法,更方便的操作基本数据类型. 包装类的出现并不是用于取代基本数据类型,也取代不了. 包装类位于java.lang包中 Number 类 ...
office word memo
显示左侧目录树 office 和 wps 的差异 wps 的版本:视窗 ->文档结构图 office 的版本: 视图 ->导航窗格
sping_依赖注入的三种方式
1. set注入:通过setxxx()给属性赋值   <bean id = "student" ...

论文笔记：Towards Diverse and Natural Image Descriptions via a Conditional GAN

论文笔记：Towards Diverse and Natural Image Descriptions via a Conditional GAN的更多相关文章

随机推荐

热门专题