Gym

用于研发与比较强化学习算法的工具。

安装

pip install gym

环境

车杆问题，模型栗子CartPole-v0

env.step() ，传入0,1,表示车向左，右给1牛顿的力，现在要平衡这个车。

import gym

env = gym.make('CartPole-v0')

env.reset()

for _ in range(1000):

    env.render()

    env.step(env.action_space.sample()) # take a random action

我们可以尝试一下，01010101，现实生活中，会让这根杆转起来，当然这不是我们平衡这个车的目标咯。

import numpy as np

import random

import gym



env = gym.make('CartPole-v0')

env.reset()

s = 0

for _ in range(1000):

    env.render()

    env.step(s^1)

    s^=1

当然，我们可以切换场景，gym最重要的就是训练环境，有很多，有登山，走路的等等。

为达到我们平衡这个车杆的目标，我们可以设计我们自己的算法，当然我们需要知道当前车的状态，实际上step返回值有四个，包含了深度学习的常用概念。

observation ：环境对象，和你选的环境有关，例如你选的机器人训练环境，他就是机器人的关节等信息。
reward：通过前面的action，你得到的奖励。（大小不一定和模型选择相关）
done：游戏是否结束，（例如杆的角度倾斜太大了）
info：用于调试的信息，然而，官方环境不允许使用。

这就是Gym的经典的"agent-environment loop" （代理环境循环）。如图所示：

这个过程，首先reset()，返回一个环境对象。程序必须接受done方法，当满足done游戏结束标记，程序就退出。

【注】 render()重新绘制环境的一帧

import gym

env = gym.make('CartPole-v0')

for i_episode in range(20):

    observation = env.reset()

    for t in range(100):

        env.render()

        print(observation)

        action = env.action_space.sample()

        observation, reward, done, info = env.step(action)

        if done:

            print("Episode finished after {} timesteps".format(t+1))

            break

【注】这里我们打印了observation环境特性对象。

其含义，小车的位置，小车的速度，木棒的角度，木棒的速度。

Spaces(空间)

每一个环境都有 action_space，observation_space，他们的类型是Space,可以打印出来他们的属性。

import gym

env = gym.make('CartPole-v0')

print(env.action_space)

#> Discrete(2)

print(env.observation_space)

#> Box(4,)

Discrete空间允许随机确定的非负数，在这个案例中就是0,1。Box空间代表问题的n维空间。我们查看一下他的环境特性属性，4个数字。

print(env.observation_space.high)

#> array([ 2.4       ,         inf,  0.20943951,         inf])

print(env.observation_space.low)

#> array([-2.4       ,        -inf, -0.20943951,        -inf])

这有助于通用代码的编写。在车杆问题中，你可以给左右的力，你知道这些数据的含义了吗？幸运的是，你的算法学的越好，你就越少解释这些数据的含义。

Gym的更多相关文章

ACM: Gym 101047M Removing coins in Kem Kadrãn - 暴力
Gym 101047M Removing coins in Kem Kadrãn Time Limit:2000MS Memory Limit:65536KB 64bit IO Fo ...
ACM: Gym 101047K Training with Phuket's larvae - 思维题
Gym 101047K Training with Phuket's larvae Time Limit:2000MS Memory Limit:65536KB 64bit IO F ...
ACM: Gym 101047E Escape from Ayutthaya - BFS
Gym 101047E Escape from Ayutthaya Time Limit:2000MS Memory Limit:65536KB 64bit IO Format:%I6 ...
ACM: Gym 101047B Renzo and the palindromic decoration - 手速题
Gym 101047B Renzo and the palindromic decoration Time Limit:2000MS Memory Limit:65536KB 64 ...
Gym 101102J---Divisible Numbers(反推技巧题)
题目链接 http://codeforces.com/gym/101102/problem/J Description standard input/output You are given an a ...
Gym 100917J---Judgement(01背包+bitset)
题目链接 http://codeforces.com/gym/100917/problem/J Description standard input/outputStatements The jury ...
Gym 100917J---dir -C（RMQ--ST）
题目链接 http://codeforces.com/gym/100917/problem/D problem description Famous Berland coder and IT mana ...
Gym 101102D---Rectangles(单调栈)
题目链接 http://codeforces.com/gym/101102/problem/D problem description Given an R×C grid with each cel ...
Gym 101102C---Bored Judge（区间最大值）
题目链接 http://codeforces.com/gym/101102/problem/C problem description Judge Bahosain was bored at ACM ...
2016"百度之星" - 初赛（Astar Round2A）Gym Class(拓扑排序)
Gym Class Accepts: 849 Submissions: 4247 Time Limit: 6000/1000 MS (Java/Others) Memory Limit: 65 ...

随机推荐

(转)shell--read命令的选项及用法
shell--read命令原文:https://www.cnblogs.com/lottu/p/3962921.html http://blog.csdn.net/skdkjzz/article/d ...
springMVC静态资源访问
springMVC默认是访问不到静态资源的,如css,js等,需要在xml里进行配置保证已经配置好了 web.xml,  <s ...
URAL —— 1255 & HDU 5100——Chessboard ——————【数学规律】
用 k × 1 的矩形覆盖 n × n 的正方形棋盘用 k × 1 的小矩形覆盖一个 n × n 的正方形棋盘,往往不能实现完全覆盖(比如,有时候 n × n 甚至根本就不是 k 的整倍数). 解题 ...
log4net日记文件路径动态配置
在项目开发过程中,部署的服务器越来越多,查看日记的时候需要每台服务器去找日记看,这对运维人员来说是一个很不友好的方式.在此基础上就提出将所有日记统一到一台服务器上进行存放,并按照产生日记的服务器分文件 ...
7、侧边栏：Menu
1.单个侧边栏导航的代码在分析源码的时候已经分析过了,下面只看他的一些应用与方法. /* ---示例代码----*/ <ion-menu [content]="mycontent&q ...
sql时间区间查询性能测试
这个测试针对"一个月"的区间来查询数据.分datetime类型和nvachar类型. 先比较datetime类型: 一.datediff函数 declare @beginTime ...
keepalived+nginx 高可用集群
一.什么是高可用? nginx做负载均衡,能达到分发请求的目的,但是不能很好的避免单点故障. 1.nginx集群单点问题分发器宕机怎么处理? 假如nginx服务器挂掉了,那么所有的服务也会跟着瘫 ...
PHP正则表达式实例汇总
$str = preg_replace("/(<a.*?>)(.*?)(<\/a>)/", '\1<span class="link&quo ...
Windows7中Java64位环境变量配置：javac不是内部命令或外部命令，也不是可运行的程序或批处理文件。
按照默认设置安装完JDK(Java Developement Kits)后,一般默认路径为:C:\Program Files\Java\jdk1.8.0_05_x64\文件夹. 然后配置环境变量:&q ...
自动装配(AutoWire)
根据 autowire 的配置选择装配策略 byName 选择和属性名 name 一致的 bean 进行装配: byType 根据类型选择,如果对应的类型匹配到多个bean,则会报错,如下配置: &l ...

Gym

Gym

安装

环境

Gym的更多相关文章

随机推荐

热门专题