论文选读一: Towards end-to-end reinforcement learning of dialogue agents for information access

Vpegasus 2024-08-29 18:28:47 原文

Towards end-to-end reinforcement learning of dialogue agents for information access

KB-InfoBot

与知识库交互的多轮对话模型，放弃符号式的查询语句，转而在知识库上使用soft后验分布来寻找概率最大的信息。

知识库

知识库的数据是常见的（实体关系 head, relation,tail）三元组，本文将其做了一步转化，将三元组数据库转化成表格形式：行为实体(head)的属性(tail)，列为关系(relation)（这里假定各个关系之间相互独立）。并且假定，其中有些数值遗失。(如下图，为电影数据的转化，其中X表示缺失数据) （另外，在测试阶段，不会测试新的实体）

soft-KB 查找

所谓每个实体的概率，即为基于在t时刻之前的所有用户输入，每个实体被提到的条件概率。相较于符号式的查询（hard-KB lookup)，它可以学习到更好的策略，也可以end2end训练。

总览

Belief Trackers

infoBot 有 M个 belief trackers （每个slot（每类关系）对应一个belief tracker)，belief tracker 将user 输入作为input, 输出（belief state)：一个分布（所有可能的slot值），一个概率（用户是否知道此slot的值）. 因为输出的size过大，为提高效率，这里做了一个summary（应用entropy)。

Dialogue policy

本文使用两种策略，一种是规则式的，另一种则应用神经网络。

Training

训练时，因为强化学习收敛较慢，特别是在随机初始化时，所以最初，本文先用模仿学习（imitation learning),即，开始时，belief tracker与policy network模仿规则agent。

论文选读一: Towards end-to-end reinforcement learning of dialogue agents for information access的更多相关文章

Deep Reinforcement Learning for Dialogue Generation 论文阅读
本文来自李纪为博士的论文 Deep Reinforcement Learning for Dialogue Generation. 1,概述当前在闲聊机器人中的主要技术框架都是seq2seq模型.但 ...
论文笔记系列-Neural Architecture Search With Reinforcement Learning
摘要神经网络在多个领域都取得了不错的成绩,但是神经网络的合理设计却是比较困难的.在本篇论文中,作者使用递归网络去省城神经网络的模型描述,并且使用增强学习训练RNN,以使得生成得到的模型在验证集上 ...
[转]Introduction to Learning to Trade with Reinforcement Learning
Introduction to Learning to Trade with Reinforcement Learning http://www.wildml.com/2018/02/introduc ...
Introduction to Learning to Trade with Reinforcement Learning
http://www.wildml.com/2015/12/implementing-a-cnn-for-text-classification-in-tensorflow/ The academic ...
论文选读二：Multi-Passage Machine Reading Comprehension with Cross-Passage Answer Veriﬁcation
论文选读二:Multi-Passage Machine Reading Comprehension with Cross-Passage Answer Veriﬁcation 目前,阅读理解通常会给出 ...
temporal credit assignment in reinforcement learning 【强化学习经典论文】
Sutton 出版论文的主页: http://incompleteideas.net/publications.html Phd 论文: temporal credit assignment i ...
论文笔记之：Action-Decision Networks for Visual Tracking with Deep Reinforcement Learning
论文笔记之:Action-Decision Networks for Visual Tracking with Deep Reinforcement Learning 2017-06-06 21: ...
Deep Reinforcement Learning for Visual Object Tracking in Videos 论文笔记
Deep Reinforcement Learning for Visual Object Tracking in Videos 论文笔记 arXiv 摘要:本文提出了一种 DRL 算法进行单目标跟踪 ...
论文翻译--StarCraft Micromanagement with Reinforcement Learning and Curriculum Transfer Learning
(缺少一些公式的图或者效果图,评论区有惊喜) (个人学习这篇论文时进行的翻译[谷歌翻译,你懂的],如有侵权等,请告知) StarCraft Micromanagement with Reinforce ...

随机推荐

Log4j2 简介
介绍 Log4j2是Log4j的升级版,与之前的版本Log4j 1.x相比.有重大的改进,修正了Logback固有的架构问题的同事,改进了许多Logback所具有的功能. 特性一.API 分离 Lo ...
编译jmeter5.0源码
jmeter5.0使用过程中,遇到request或者response乱码的情况,想要一次性解决这个问题,需要编译ApacheJMeter_http.jar这个包(lib\ext文件下)里的Reques ...
v-charts简介
一, v-charts简介在使用 echarts 生成图表时,经常需要做繁琐的数据类型转化.修改复杂的配置项,v-charts 的出现正是为了解决这个痛点.基于 Vue2.0 和 echarts 封 ...
war包安装jenkins
转自:https://blog.51cto.com/bigboss/2129358 系统环境: CentOS 7.5 1804 IP:192.168.1.3 关闭selinux.firewalld j ...
【awk】用awk将Fasta文件序列变成一行
awk: awk '/^>/&&NR>1{print "";}{ printf "%s",/^>/ ? $0" &q ...
kbmmemtable sorton 报错： List index out of bounds
同一数据集,不同的排序条件,有的可以,但某一条件,却能100%重现报错. procedure TkbmIndex.InternalFastQuickSort(const L,R:Integer); v ...
ltp-ddt emmc_dd_rw
emmc_dd_rw EMMC_M_FUNC_DD_RW_500M source "common.sh"; install_modules.sh "emmc"; ...
Dell3470无法开机或开机黑屏情况下检测屏幕是否正常
故障现象:Dell3470无法开机,点击开关按键无任何反应故障分析:释放静电后故障依旧.更换电源适配器后故障依旧,初判主板故障,无法确认屏是否正常解决方法:除去拆机单独测试外,Dell售后告知一个 ...
HTML有哪些标签？html常用标签大全
html中标签有很多,每一种标签都有着不同的用处,下面这篇文章php中文网给大家总结html常用的标签,每一种标签都会跟随一个例子,话不多说,让我们来看看具体内容.<font>字体标签,用 ...
oracle 锁表
select b.username,b.sid,b.serial#,logon_time from v$locked_object a,v$session b where a.session_id = ...