深度学习课程笔记（十四）深度强化学习 --- Proximal Policy Optimization (PPO)

深度学习课程笔记（十四）深度强化学习 --- Proximal Policy Optimization (PPO)

2018-07-17 16:54:51

Reference: https://blog.openai.com/openai-baselines-ppo/

Code: https://github.com/openai/baselines

Paper: https://arxiv.org/pdf/1707.06347.pdf

Video Tutorials: https://www.youtube.com/watch?v=OAKAZ hFmYoI&t=1s

Proximal Policy Optimization Algorithms (原文解析) ：

Abstract:

首先要说的是本文提出一种新的 Policy Gradient 的方法，可以在如下两个步骤之间来回迭代进行学习：

1. sampling data through interaction with the environment ; 通过与环境进行交互，进行采样；

2. optimizing a "surrogate" objective function using stochastic gradient ascent. 利用梯度上升的方法进行代替的目标函数（surrgogate objective function）的优化。

传统的 Policy Gradient Method 仅仅能够利用采样得到的 samples 进行一次更新，就要将这些samples扔掉，重新采样，再实现更新。而本文所提出的方法可以进行 multiple epochs of minibatch updates.

Introduction ：

最近深度学习的方法和强化学习的组合，得到了很多新的成果，如：Deep Q-leanring, "Vanilla" policy gradient method, trust region/natural poliicy gradient methods. 但是这些方法其实都是有其各自不足的地方，如：

Deep Q-learning 在很多简单的任务上却失败了，并且 poorly understood,

vanilla policy gradient methods 数据的效率和鲁棒性很差；

TRPO（trust region policy optimization）是一个相对较为复杂，并且不能与其他框架兼容的（not compatiable with architecture that including noise (such as dropout) or parameter sharing (between the policy and value function, or with auxiliary tasks)）.

这篇文章旨在通过引入算法获得 data efficiency，and reliable performance of TRPO，来改善当前算法的情况，与此同时，仅仅采用 first-order optimization. 我们提出 a novel objective with clipped probability ratios，为了优化策略，我们用该 policy 进行采样，然后在采样的数据上进行几个 epoch 的更新。作者的实验证明，本文的方法在几个数据集上都取得了不错的效果。

2. Background：Policy Optimization

2.1 Policy Gradient Methods

2.2 TRPO

深度学习课程笔记（十四）深度强化学习 --- Proximal Policy Optimization (PPO)的更多相关文章

深度学习课程笔记（四）Gradient Descent 梯度下降算法
深度学习课程笔记(四)Gradient Descent 梯度下降算法 2017.10.06 材料来自:http://speech.ee.ntu.edu.tw/~tlkagk/courses_MLDS1 ...
ng-深度学习-课程笔记-1: 介绍深度学习(Week1)
1 什么是神经网络( What is a neural network ) 深度学习一般是指非常非常大的神经网络,那什么是神经网络呢? 以房子价格预测为例,现在你有6个房子(样本数量),你知道房子的大 ...
深度学习课程笔记（十八）Deep Reinforcement Learning - Part 1 (17/11/27) Lectured by Yun-Nung Chen @ NTU CSIE
深度学习课程笔记(十八)Deep Reinforcement Learning - Part 1 (17/11/27) Lectured by Yun-Nung Chen @ NTU CSIE 201 ...
深度学习课程笔记（十六）Recursive Neural Network
深度学习课程笔记(十六)Recursive Neural Network 2018-08-07 22:47:14 This video tutorial is adopted from: Youtu ...
深度学习课程笔记（十五）Recurrent Neural Network
深度学习课程笔记(十五)Recurrent Neural Network 2018-08-07 18:55:12 This video tutorial can be found from: Yout ...
深度学习课程笔记（十三）深度强化学习 --- 策略梯度方法（Policy Gradient Methods）
深度学习课程笔记(十三)深度强化学习 --- 策略梯度方法(Policy Gradient Methods) 2018-07-17 16:50:12 Reference:https://www.you ...
深度学习课程笔记（十）Q-learning (Continuous Action)
深度学习课程笔记(十)Q-learning (Continuous Action) 2018-07-10 22:40:28 reference:https://www.youtube.com/watc ...
深度学习课程笔记（十二） Matrix Capsule
深度学习课程笔记(十二) Matrix Capsule with EM Routing 2018-02-02 21:21:09 Paper: https://openreview.net/pdf ...
深度学习课程笔记（七）：模仿学习（imitation learning）
深度学习课程笔记(七):模仿学习(imitation learning) 2017.12.10 本文所涉及到的模仿学习,则是从给定的展示中进行学习.机器在这个过程中,也和环境进行交互,但是,并没有显 ...

随机推荐

Python基础知识摘要
python字典增,删,改,查 1.增:XXX[新的key] = value 2.删:DEL XXX[key] 3.改:XXX[已经存在的key] = NewValue 4.查:aList.exte ...
PGPDesktop在win7环境下的安装和使用
PGPDesktop在win7环境下的安装和使用 PGP的简介 PGP(Pretty Good Privacy),是一个基于RSA公钥加密体系的邮件加密软件,它提供了非对称加密和数字签名,是目前非常流 ...
sql 表中删除字段重复的行
Id Email UserName1 Taiseer.Joudeh@hotmail.com TaiseerJoudeh2 Hasan.Ahmad@mymail.com ...
Linux 操作系统镜像下载
http://mirror.centos.orghttp://mirrors.163.comhttp://mirrors.suhu.com 例如:下载centos http://mirrors.163 ...
rabbitmq和redis用作消息队列的区别
将redis发布订阅模式用做消息队列和rabbitmq的区别: 可靠性redis :没有相应的机制保证消息的可靠消费,如果发布者发布一条消息,而没有对应的订阅者的话,这条消息将丢失,不会存在内存中:r ...
输入一串字符，检查是否可以组成friend
"""输入一串字符,检查是否可以组成friend""" from collections import Counter def foo(nu ...
springboot 接收post和get请求
接收post请求: @RequestMapping(value = "/api/v1/create_info", method = RequestMethod.POST) publ ...
mysql-day06
##视图 - 什么是视图:在数据库中存在多种对象,表和视图都是数据库中的对象,创建视图时名称不能和表重名,视图实际上就代表一段sql查询语句,也可以理解成视图是一张虚拟的表,此虚拟表中的数据会随着原表 ...
前端 html css
HTML 一个完整的网页是由html(超文本标记语言),css(层叠样式表)JavaScript(动态脚本语言)三部分组成一.html 概念:超文本标记语言,“超文本”就是指页面内可以包含图片.链接 ...
sparkStreaming插入mysql 必须考虑到实时更新老的key
原先使用批次提交更新但数据库无变化,不得不一条一条的插入公司数据量不大还未做数据量大的测试但实时更新是可以的关键sql : insert into area_user_amt (date, ...

深度学习课程笔记（十四）深度强化学习 --- Proximal Policy Optimization (PPO)

深度学习课程笔记（十四）深度强化学习 --- Proximal Policy Optimization (PPO)的更多相关文章

随机推荐

热门专题