tensorflow增强学习应用于一个小游戏

首先需要安装gym模块，提供游戏的。

1，所需模块

import tensorflow as tf

import numpy as np

import gym

import random

from collections import deque

from keras.utils.np_utils import to_categorical

2，自定义一个简单的3层Dense Model

# 自定义Model

class QNetwork(tf.keras.Model):

    def __init__(self):

        super().__init__()

#         简单的3个Dense

        self.dense1=tf.keras.layers.Dense(24,activation='relu')

        self.dense2=tf.keras.layers.Dense(24,activation='relu')

        self.dense3=tf.keras.layers.Dense(2)

    def call(self,inputs):

        x=self.dense1(inputs)

        x=self.dense2(x)

        x=self.dense3(x)

        return x

    def predict(self,inputs):

        q_values=self(inputs)#调用call

        return tf.argmax(q_values,axis=-1)

3，定义相关参数

# 游戏环境，实例化一个游戏

env=gym.make('CartPole-v1')

model=QNetwork()

# 循环轮数设置小一点，50就可以了

num_episodes=500

num_exploration=100

max_len=1000

batch_size=32

lr=1e-3

gamma=1.

initial_epsilon=1.

final_epsilon=0.01

replay_buffer=deque(maxlen=10000)

epsilon=initial_epsilon

# tensorflow2.0

optimizer=tf.compat.v1.train.AdamOptimizer(learning_rate=lr)

4，训练，测试

for i in range(num_episodes):

    # 初始化环境

    state=env.reset()

#     逐渐衰减，至final_epsilon

    epsilon=max(initial_epsilon*(num_exploration-i)/num_exploration,final_epsilon)

    for t in range(max_len):

#         当前帧绘制到屏幕

        env.render()

#         以epsilon的概率随机行动，epsilon是衰减的，说明游戏动作会越来越稳定

        if random.random()<epsilon:

            action=env.action_space.sample()

        else:

#             从当前状态预测一个动作

            action=model.predict(tf.constant(np.expand_dims(state,axis=0),dtype=tf.float32)).numpy()

            action=action[0]

#         执行一步动作

        next_state,reward,done,info=env.step(action)

#         奖励

        reward=-10.if done else reward

#         缓存

        replay_buffer.append((state,action,reward,next_state,done))

        state=next_state

        if done:

            print('episode %d,epsilon %f,score %d'%(i,epsilon,t))

            break

#         预测batch_size步后执行

        if len(replay_buffer)>=batch_size:

            # 随机获取一个batch的数据

            batch_state,batch_action,batch_reward,batch_next_state,batch_done=\

            [np.array(a,dtype=np.float32) for a in zip(*random.sample(replay_buffer,batch_size))]

#             下一个状态，由此得到的y为真实值

#             预测值与真实值的计算看不太懂

            q_value=model(tf.constant(batch_next_state,dtype=tf.float32))

            y=batch_reward+(gamma*tf.reduce_max(q_value,axis=1))*(1-batch_done)

            with tf.GradientTape() as tape:

#                 loss=tf.losses.mean_squared_error(labels=y,predictions=tf.reduce_sum(

#                     model(tf.constant(batch_state))*tf.one_hot(batch_action,depth=2),axis=1))

                loss=tf.losses.mean_squared_error(y,tf.reduce_sum(

                    model(tf.constant(batch_state))*to_categorical(batch_action,num_classes=2),axis=1))

            grads=tape.gradient(loss,model.variables)

            optimizer.apply_gradients(grads_and_vars=zip(grads,model.variables))

最终会出现一个窗口，平衡游戏不断进行。。。

上面注释部分因为tf.one_hot方法会报错。

tensorflow增强学习应用于一个小游戏的更多相关文章

Pygame：编写一个小游戏标签： pythonpygame游戏 2017-06-20 15:06 103人阅读评论(0)
大学最后的考试终于结束了,迎来了暑假和大四的漫长的"自由"假期.当然要自己好好"玩玩"了. 我最近在学习Python,本意是在机器学习深度学习上使用Python ...
DirectX游戏开发——从一个小游戏開始
本系列文章由birdlove1987编写,转载请注明出处. 文章链接: http://blog.csdn.net/zhurui_idea/article/details/26364129 写在前面:自 ...
使用PixiJS做一个小游戏
PixiJS PixiJS使用WebGL,是一个超快的HTML5 2D渲染引擎.作为一个Javascript的2D渲染器,Pixi.js的目标是提供一个快速的.轻量级而且是兼任所有设备的2D库. 官方 ...
js实现一个小游戏（飞翔的jj）
js实现一个小游戏(飞翔的jj) 源代码+素材图片在我的仓库 <!DOCTYPE html> <html lang="en"> <head> & ...
通过一个小游戏开始接触Python！
之前就一直嚷嚷着要找视频看学习Python,可是一直拖到今晚才开始....好好加油吧骚年,坚持不一定就能有好的结果,但是不坚持就一定是不好的!! 看着视频学习1: 首先,打开IDLE,在IDLE中新建 ...
【h5-egret】如何快速开发一个小游戏
1.环境搭建安装教程传送门:http://edn.egret.com/cn/index.php?g=&m=article&a=index&id=207&terms1_ ...
c++学习笔记---03---从一个小程序说起2
从一个小程序说起2 要求:编写一个程序,要求用户输入一串整数和任意数目的空格,这些整数必须位于同一行中,但允许出现在该行中的任何位置.当用户按下键盘上的"Enter"键时,数据输入 ...
Egret白鹭开发微信小游戏程序跳转功能（由一个小游戏跳转到另一个小游戏）
假设我们要实现的功能是从小游戏A跳转到小游戏B 对于小游戏A: (1)在platform.ts中添加代码如下: /** * 平台数据接口. * 由于每款游戏通常需要发布到多个平台上,所以提取出一个统一 ...
c++学习笔记---02---从一个小程序说起
从一个小程序说起这一讲的主要目的是帮助大家在C语言的背景知识上与C++建立联系. 问题探索问题:对一个整型数组求和. 要求:定义一个存储着 n 个元素的数组,要求用C语言完成这个任务. 赶紧的:大 ...

随机推荐

VS开发框架DevExtreme v19.1全解析！Windows资源管理器UX值得拥有
行业领先的.NET界面控件DevExpress 正式发布了v19.1版本,本文将以系列文章的方式为大家介绍DevExtreme Complete Subscription v19.1中全新发布的文件管 ...
Avro从入门到入土
avro官网 1.Avro历史 Avro是Hadoop的一个数据序列化系统,由Hadoop的创始人Doug Cutting(也是Lucene,Nutch等项目的创始人)开发,设计用于支持大批量数据交换 ...
微信小程序data数组push和remove问题
因为在做一个小程序的demo时.由于不向后台请求数据,所以就涉及到对本地数据的操作,现在就做一些数组的增删 //添加新元素 addItemFn: function () { var { lists } ...
CSS的相关知识——背景，超链接，列表，表格，奇偶选择器
接着上一篇总结一些css的相关知识㈠背景背景属性 1.background-color 背景颜色 rgb函数设置 2.background-image 背景图片 url(“logo.jp ...
python 文件定位
tell()方法告诉你文件内的当前位置, 换句话说,下一次的读写会发生在文件开头这么多字节之后. seek(offset [,from])方法改变当前文件的位置.Offset变量表示要移动的字节数.F ...
hdu 3917 修路与公司最大权闭合图好题
Road constructions Time Limit: 6000/2000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Other ...
CF1155 E.Guess the Root
题目链接:Click here 题目大意:现在有一个至多11项的多项式\(F(x)\),你可以询问至多50个\(x\),黑盒子会告诉你\(F(x)\)的值,你现在要找到一个\(x\)使得\(F(x)= ...
原生Js_实现简单的下拉折叠菜单(添加弹出动画效果)
用javascript实现简单的下拉折叠菜单效果实现步骤 (a)获得各操作的dom对象: (b)在所有菜单按钮对象上添加单击事件: (c)设置所有菜单按钮样式为空,并将当前按钮的样式设置为“acti ...
springBoot 整合 mybatis 项目实战
二.springBoot 整合 mybatis 项目实战前言上一篇文章开始了我们的springboot序篇,我们配置了mysql数据库,但是我们sql语句直接写在controller中并且使用 ...
C++入门经典-例3.11-使用if语句来实现根据输入的字符输出字符串
1:代码如下: // 3.11.cpp : 定义控制台应用程序的入口点. // #include "stdafx.h" #include <iostream> usin ...

tensorflow增强学习应用于一个小游戏

tensorflow增强学习应用于一个小游戏的更多相关文章

随机推荐

热门专题