seq2seq聊天模型（三）—

注意力seq2seq模型

大部分的seq2seq模型，对所有的输入，一视同仁，同等处理。

但实际上，输出是由输入的各个重点部分产生的。

比如：

（举例使用，实际比重不是这样）

对于输出“晚上”，

各个输入所占比重: 今天-50%，晚上-50%，吃-100%，什么-0%

对于输出“吃”，

各个输入所占比重: 今天-0%，晚上-0%，吃-100%，什么-0%

特别是在seq2seq的看图说话应用情景中

睡觉还握着笔的baby

这里的重点就是baby，笔！通过这些重点，生成描述。

下面这个图，就是attention的关键原理

tensorlfow 代码

encoder 和常规的seq2seq中的encoder一样，只是在attention模型中，不再需要encoder累计的state状态，需要的是各个各个分词的outputs输出。

在训练的时候，将这个outputs与一个权重值一起拟合逼进目标值。

这个权重值，就是各个输入对目标值的贡献占比，也就是注意力机制！

dec_cell = self.cell(self.hidden_size)

attn_mech = tf.contrib.seq2seq.LuongAttention(

    num_units=self.attn_size,  # 注意机制权重的size

    memory=self.enc_outputs,  # 主体的记忆，就是decoder输出outputs

    memory_sequence_length=self.enc_sequence_length,

    #   normalize=False,

    name='LuongAttention')

dec_cell = tf.contrib.seq2seq.AttentionWrapper(

    cell=dec_cell,

    attention_mechanism=attn_mech,

    attention_layer_size=self.attn_size,

    #  attention_history=False, # (in ver 1.2)

    name='Attention_Wrapper')

initial_state = dec_cell.zero_state(dtype=tf.float32, batch_size=batch_size)

# output projection (replacing `OutputProjectionWrapper`)

output_layer = Dense(dec_vocab_size + 2, name='output_projection')

 # lstm的隐藏层size和attention 注意机制权重的size要相同

seq2seq聊天模型（三）—— attention 模型的更多相关文章

seq2seq聊天模型(一)
原创文章,转载请注明出处最近完成了sqe2seq聊天模型,磕磕碰碰的遇到不少问题,最终总算是做出来了,并符合自己的预期结果. 本文目的利用流程图,从理论方面,回顾,总结seq2seq模型, seq ...
深度学习之seq2seq模型以及Attention机制
RNN,LSTM,seq2seq等模型广泛用于自然语言处理以及回归预测,本期详解seq2seq模型以及attention机制的原理以及在回归预测方向的运用. 1. seq2seq模型介绍 seq2se ...
从Seq2seq到Attention模型到Self Attention
Seq2seq Seq2seq全名是Sequence-to-sequence,也就是从序列到序列的过程,是近年当红的模型之一.Seq2seq被广泛应用在机器翻译.聊天机器人甚至是图像生成文字等情境. ...
[转] 图解Seq2Seq模型、RNN结构、Encoder-Decoder模型到 Attention
from : https://caicai.science/2018/10/06/attention%E6%80%BB%E8%A7%88/ 一.Seq2Seq 模型 1. 简介 Sequence-to ...
Seq2Seq模型与 Attention 策略
Seq2Seq模型传统的机器翻译的方法往往是基于单词与短语的统计,以及复杂的语法结构来完成的.基于序列的方式,可以看成两步,分别是 Encoder 与 Decoder,Encoder 阶段就是将输入 ...
文本分类实战（五）—— Bi-LSTM + Attention模型
1 大纲概述文本分类这个系列将会有十篇左右,包括基于word2vec预训练的文本分类,与及基于最新的预训练模型(ELMo,BERT等)的文本分类.总共有以下系列: word2vec预训练词向量 te ...
Attention模型
李宏毅深度学习 https://www.bilibili.com/video/av9770302/?p=8 Generation 生成模型基本结构是这样的, 这个生成模型有个问题是我不能干预数据生成, ...
吴裕雄--天生自然 pythonTensorFlow自然语言处理：Attention模型--训练
import tensorflow as tf # 1.参数设置. # 假设输入数据已经转换成了单词编号的格式. SRC_TRAIN_DATA = "F:\\TensorFlowGoogle ...
SDN三种模型解析
数十年前,计算机科学家兼网络作家Andrew S. Tanenbaum讽刺标准过多难以选择,当然现在也是如此,比如软件定义网络模型的数量也很多.但是在考虑部署软件定义网络(SDN)或者试点之前,首先需 ...

随机推荐

MySQL 子查询（四）子查询的优化、将子查询重写为连接
MySQL 5.7 ref ——13.2.10.10优化子查询十.子查询的优化开发正在进行中,因此从长远来看,没有什么优化建议是可靠的.以下列表提供了一些您可能想要使用的有趣技巧.See also ...
JSON序列化必看以及序列化工具类
1.要序列化的类必须用 [DataContract] 特性标识 2.需要序列化的属性应用 [DataMember] 特性标识,没有该特性则表示不序列化该属性.类亦如此! 3.可以网络上找封装好 ...
Windows 服务安装后自启动
[RunInstaller(true)] public partial class ProjectInstaller : System.Configuration.Install.Installer ...
Vue绑定的table页面在Chrome浏览器左右抖动
现象: 今天Chrome浏览器升级到最新版本(75.0.3770.100),突然发现之前vue页面只要绑定了el-table标签的,都在左右抖动,抖动得眼睛都花了,百度上找半天也没有遇到相同问题的人, ...
[NOIP2018模拟赛10.20A]挂分报告
闲扯先看看了B组,T1 ZROI刚好讲过一个性质原根一般很小的,直接枚举;T2一眼二分然后似乎状压 T3没看然后上来A组题,T1 flow这名字...网络流?! T1题面非常的社会主义核心价值观, ...
改写Unity DropDown 支持多次点击同一选项均回调
[很久前的一个Note,不知道现在的Unity Dropdown是否已经支持该特性] Unity UGUI是开源的: https://bitbucket.org/Unity-Technologies/ ...
【OGG 故障处理】OGG-01028
通过ATSCN 的方式启动REPLICAT 进程的时候报错 GGSCI> START REPLICAT RP_XXXX1, ATCSN 15572172378 GGSCI> VIEW RE ...
MySQL的MHA实现高可用性
MySQL高可用 (1)MMM: Multi-Master Replication Manager for MySQL,Mysql主主复制管理器是一套灵活的脚本程序,基于perl实现,用来对mysql ...
Ajax长连接和SignalR（刷新客户端数据）的区别
ajax实现长连接 <%@ page language="java" import="java.util.*" pageEncoding=" ...
java 接口方法超时异常处理设置超时时间
原文:https://blog.csdn.net/coding_1994/article/details/87728374 使用线程池另起一个线程,可以使用 newFixedThreadPool() ...

seq2seq聊天模型（三）—— attention 模型

注意力seq2seq模型

下面这个图，就是attention的关键原理

tensorlfow 代码

seq2seq聊天模型（三）—— attention 模型的更多相关文章

随机推荐

热门专题