论文笔记：Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments

Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments

2017-10-25 16:38:23

　【Project Page】https://blog.openai.com/learning-to-cooperate-compete-and-communicate/

　 4. Method

　　4.1 Multi-Agent Actor Critic

　　该网络框架有如下假设条件：

　　(1) the learned policies can only use local information (i.e. their own observations) at execution time,

　　(2) we do not assume a differentiable model of the environment dynamics, unlike in [24],

　　(3) we do not assume any particular structure on the communication method between agents (that is, we don’t assume a differentiable communication channel).

　　================>>>

　　1. 学习到的策略在执行时，仅仅是利用局部的信息

　　2. 我们不假设环境动态的可微分模型

　　3. 我们不假设 agents 之间任何通信模型上的特定结构

　　本文的模型是以 centralized training with decentralized execution framework 为基础进行的，而这个框架的意思是：以全局的信息进行训练，而实际测试的时候是分散执行的。

　　更具体的来说，我们考虑有 N 个 agent 的游戏，所以，每个 agent i 的期望汇报可以记为：

　　此处的 Q 函数是一个中心化的动作值函数（centralized action-value function），将所有 agent 的动作作为输入，除了某些状态信息 X，然后输出是 the Q-value for agent i。

　　在最简单的情况下，x 可以包含所有 agent 的观测，x = (o1, ... , oN)，但是我们也可以包含额外的状态信息。由于每一个 Q 都是分别学习的，agent 可以拥有任意的奖励结构，包括在竞争设定下的冲突奖励。

　　我们可以将上述 idea 拓展到 deterministic policies。如果我们考虑到 N 个连续的策略，那么梯度可以写作：

　　此处，经验回放池 D 包括 the tuples (x, x', a1, ... , aN, r1, ... , rN)，记录所有 agents 的经验。中心化的动作值函数 Q可以通过如下的方程，进行更新：

　　4.2 Inferring Policies of Other Agents

　　为了移除假设：knowing other agents' policies, 就像公式（6）中所要求的那样。每一个 agent i 可以估计 agent j 的真实策略。这个估计的策略可以通过最大化 agent 选择动作的 log 概率，且加上一个 entropy regularizer：

　　其中，H 是策略分布的熵。有了估计的策略，公式（6）中的 y 可以用估计的值 y^ 来进行计算：

　　其中，\mu’ 代表用来估计策略的 target network。注意到，公式（7）可以完全在线的执行，before updating $Q_i^{\mu}$, the centralized Q function, 我们采取每一个 agent j 的最新的样本，from the replay buffer to perform a single gradient step to update $\phi^j_i$。另外，在上述公式中，我们直接将每个 agent 的动作 log 概率输入到 Q，而不是 sampling。

　　4.3 Agents with Policy Ensembles

论文笔记：Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments的更多相关文章

深度增强学习--Actor Critic
Actor Critic value-based和policy-based的结合实例代码 import sys import gym import pylab import numpy as np ...
【论文笔记系列】AutoML：A Survey of State-of-the-art （下）
[论文笔记系列]AutoML:A Survey of State-of-the-art (上) 上一篇文章介绍了Data preparation,Feature Engineering,Model S ...
深度学习论文笔记：Fast R-CNN
知识点 mAP:detection quality. Abstract 本文提出一种基于快速区域的卷积网络方法(快速R-CNN)用于对象检测. 快速R-CNN采用多项创新技术来提高训练和测试速度,同时 ...
Deep Learning论文笔记之（四）CNN卷积神经网络推导和实现（转）
Deep Learning论文笔记之(四)CNN卷积神经网络推导和实现 zouxy09@qq.com http://blog.csdn.net/zouxy09 自己平时看了一些论文, ...
论文笔记之：Visual Tracking with Fully Convolutional Networks
论文笔记之:Visual Tracking with Fully Convolutional Networks ICCV 2015 CUHK 本文利用 FCN 来做跟踪问题,但开篇就提到并非将其看做 ...
Deep Learning论文笔记之（八）Deep Learning最新综述
Deep Learning论文笔记之(八)Deep Learning最新综述 zouxy09@qq.com http://blog.csdn.net/zouxy09 自己平时看了一些论文,但老感觉看完 ...
Twitter 新一代流处理利器——Heron 论文笔记之Heron架构
Twitter 新一代流处理利器--Heron 论文笔记之Heron架构标签(空格分隔): Streaming-process realtime-process Heron Architecture ...
Deep Learning论文笔记之（六）Multi-Stage多级架构分析
Deep Learning论文笔记之(六)Multi-Stage多级架构分析 zouxy09@qq.com http://blog.csdn.net/zouxy09 自己平时看了一些 ...
Multimodal —— 看图说话（Image Caption）任务的论文笔记（一）评价指标和NIC模型
看图说话(Image Caption)任务是结合CV和NLP两个领域的一种比较综合的任务,Image Caption模型的输入是一幅图像,输出是对该幅图像进行描述的一段文字.这项任务要求模型可以识别图 ...

随机推荐

Linux基础命令---杀死进程killall
killall killall可以根据名字来杀死进程,它会给指定名字的所有进程发送信息.如果没有指定信号名,则发送SIGTERM.信号可以通过名称(例如-HUP或-SIGHUP)或数字(例如-1)或选 ...
校正PHP服务器时间不准的问题
关于怎样解决PHP服务器时间不准的问题,得针对不同的情况进行不同的处理. 下面是经常遇到的情况,及应对办法. 1.PHP服务器时区不对,使用下面代码修正: <?php $timezone = & ...
tomcat2章2
package ex02.pyrmont1; import java.io.File; public class Constants { public static final String WEB_ ...
BUAA 111 圆有点挤
题目描述 gg最近想给女友送两个精美的小礼品:两个底面半径分别为R1和R2的圆柱形宝石,并想装在一个盒子里送给女友. 好不容易找到了一个长方体的盒子,其底面为A*B的矩形,他感觉好像宝石装不进去,但又 ...
[转载]DLL命名规则
程序集是一个部署单元,同时还代表托管代码程序的身份.一般来说一个程序集仅与一个DLL相对应.本节主要讲DLL命名约定,程序集的命名约定与此类似. 要记住,名字空间与DLL和程序集是不同的概念.名字空间 ...
Top 5 Reasons to Get BMW ICOM A2 with Latest Software
Top 5 Reasons to Get BMW ICOM A2 with Latest Software 1.BMW ICOM A2 Hardware Version: V2018.03 2.Sup ...
分页的模块layui
//调用分页模块 var laypage = layui.laypage; //分页的配置项 laypage.render({ elem:"page",//(指向存放分页的容器,值 ...
jboss 报错处理及端口修改
执行文件 ./shutdown.sh -S 后重启jboss 执行 ./run.sh -Djboss.bind.address=192.168.132.129 & 如果一台机器安装多个jbo ...
MySql与MariaDB由来与历程
MySQL数据库 MySQL数据库是一个关系型数据库管理系统,由瑞典MySQL AB公司开发.MySQL是一种关联数据库管理系统,关联数据库将数据保存在不同的表中,而不是将所有数据放在一个大仓库内,这 ...
Tomcat启动报错：[The configuration may be corrupt or incomplete]的解决方案
1,场景说明: 偶然碰见Tomcat启动报错,此时并没有Add任何Web项目: Could not load the Tomcat server configuration at /Servers/T ...

论文笔记：Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments

论文笔记：Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments的更多相关文章

随机推荐

热门专题