【RL系列】Multi-Armed Bandit笔记——UCB策略与Gradient策略

本篇主要是为了记录UCB策略与Gradient策略在解决Multi-Armed Bandit问题时的实现方法，涉及理论部分较少，所以请先阅读Reinforcement Learning: An Introduction (Drfit) 的2.7，2.8的内容。为了更深入一点了解UCB策略，可以随后阅读下面这篇文章：

【RL系列】Multi-Armed Bandit笔记补充（二）—— UCB策略

UCB策略需要进行初始化工作，也就是说通常都会在进入训练之前先将每个动作都测试一变，保证每个动作被选择的次数都不为0且都会有一个初始的收益均值和置信上限，一般不会进行冷启动（冷启动的话，需要在开始时有一定的随机动作，会降低动作选择的效率）。我们可以设初始化函数UCBinitial，将其表现为Matlab：

function [Q UCBq] = UCBInitial(Q, Reward, UCBq)

% CurrentR: Current Reward

% CurrentA: Current Action

% RandK: K-Armed Bandit

% Q: Step-size Average Reward

% UCBq: Q + Upper Confidence Bound

RandK = length(Reward);

for n = 1:RandK

    CurrentA = n;

    CurrentR = normrnd(Reward(CurrentA), 1);

    Q(CurrentA) = (CurrentR - Q(CurrentA))*0.1 + Q(CurrentA);

    UCBq(CurrentA) = Q(CurrentA) + c*(2*log(n))^0.5;

end

在训练中，UCB动作选择策略和置信上限值的更新策略可以写为：

% UCBq: Q + Upper Confidence Bound

% TotalCalls(Action): The Cumulative call times of Action

% c: Standard Deviation of reward in theorical analysis

[MAX CurrentA] = max(UCBq);

MAXq(CurrentA) = Q(CurrentA) + c*(2*log(n)/TotalCalls(CurrentA))^0.5;

注意公式里的c应为理论上收益的标准差，但因为收益分布是一个黑箱，所以这个参数只能从实际实验中测试推断出来。这里我们假设收益标准差为1，所以为了实验效果，设c=1

接下来，我们就看一看UCB策略的测试效果吧。这里我们将其与epsilon-greedy策略进行对比（epsilon = 0.1），首先是Average Reward的测试结果：

UCB算法在前1000次的学习中可以得到比epsilon-greedy更高的均值收益评价。那么这是否就代表了UCB策略可以更高概率的选取最优动作？下面我们看Optimal Action Rate的测试结果：

可以发现学习次数较少时，UCB策略可以比epsilon-greedy策略更快的获得较高概率的最优解，但最优动作选择率始终维持在60%左右，是低于epsilon-greedy策略在1000次学习时接近90%的数值的。这也直接的反映出UCB并不适合求解最优。那为什么最优动作选择率不高，但平均收益却较高呢？UCB大概率选择的优先动作通常是排名靠前的动作，也就是说动作选择并不一定是最优，但大概率是最佳的3个或2个动作中的一个，所以UCB也可用作二元分类策略，将表现较好的（大概率选择的动作）分为一类，表现较差的动作分为一类。

我们来看看UCB在分类中的表现，用80%分类准确度来进行评价。如果经过UCB策略学习后得到的估计收益均值中的前5位中有超过或等于4位与实际的收益均值相符的频率，以此近似为分类的准确度。也就是说，如果有10个bandit，我们将其分为两类，收益高的一类（前5个bandit）与收益低的一类（后5个bandit），80%分类准确度可以以此计算：估计的前5个bandit与实际的有超过4个相符的概率。用数学表述出来就是，如果有一个Reward集合R：

$\mathbb{R} = \{ R_1, R_2, ...,R_9, R_{10} \}$

将其分为两类，按数值大小排序，前五名为一类，归为集合G，G是R的子集。通过学习估计出的G，称为A_G 。那么80%分类准确度可以表示为：

$\mathbb{P}(Length(G\cap \bar{G})>3)$

那么我们直接看结论吧：

UCB的80%分类准确度始终在90%上下，而epsilon-greedy却只有50%左右。显然，UCB在这方面做的要好于epsilon-greedy。

【RL系列】Multi-Armed Bandit笔记——UCB策略与Gradient策略的更多相关文章

【RL系列】Multi-Armed Bandit笔记补充（一）
在此之前,请先阅读上一篇文章:[RL系列]Multi-Armed Bandit笔记本篇的主题就如标题所示,只是上一篇文章的补充,主要关注两道来自于Reinforcement Learning: An ...
【RL系列】Multi-Armed Bandit笔记补充（二）
本篇的主题是对Upper Conference Bound(UCB)策略进行一个理论上的解释补充,主要探讨UCB方法的由来与相关公式的推导. UCB是一种动作选择策略,主要用来解决epsilon-gr ...
【RL系列】Multi-Armed Bandit问题笔记
这是我学习Reinforcement Learning的一篇记录总结,参考了这本介绍RL比较经典的Reinforcement Learning: An Introduction (Drfit) .这本 ...
【RL系列】MDP与DP问题
推荐阅读顺序: Reinforcement Learning: An Introduction (Drfit) 有限马尔可夫决策过程动态编程笔记 Dynamic programming in Py ...
【RL系列】从蒙特卡罗方法步入真正的强化学习
蒙特卡罗方法给我的感觉是和Reinforcement Learning: An Introduction的第二章中Bandit问题的解法比较相似,两者皆是通过大量的实验然后估计每个状态动作的平均收益. ...
【RL系列】马尔可夫决策过程——状态价值评价与动作价值评价
请先阅读上两篇文章: [RL系列]马尔可夫决策过程中状态价值函数的一般形式 [RL系列]马尔可夫决策过程与动态编程状态价值函数,顾名思义,就是用于状态价值评价(SVE)的.典型的问题有“格子世界(G ...
(zhuan) 一些RL的文献（及笔记）
一些RL的文献(及笔记) copy from: https://zhuanlan.zhihu.com/p/25770890 Introductions Introduction to reinfor ...
【RL系列】马尔可夫决策过程中状态价值函数的一般形式
请先阅读上一篇文章:[RL系列]马尔可夫决策过程与动态编程在上一篇文章里,主要讨论了马尔可夫决策过程模型的来源和基本思想,并以MAB问题为例简单的介绍了动态编程的基本方法.虽然上一篇文章中的马尔可夫 ...
Hibernate学习笔记二：Hibernate缓存策略详解
一:为什么使用Hibernate缓存: Hibernate是一个持久层框架,经常访问物理数据库. 为了降低应用程序访问物理数据库的频次,从而提高应用程序的性能. 缓存内的数据是对物理数据源的复制,应用 ...

随机推荐

Java项目排查cpu负载高
背景我负责的其中一个项目在空负载的情况下,CPU占用率依然保持着100%左右,线上.测试.开发的服务都一样:是什么导致的呢?在开发环境我查看了请求流量,这个流量可以忽略但CPU占用率一直在60%-1 ...
delect 删除
delete ---整表数据删除 (慎用) delete * from 表名; ---条件删除 delete * from 表名 where 限制条件;
iOS7下Status Bar字体颜色修改
原文来自这里:iOS7下Status Bar字体颜色修改. 旧项目在iOS7上遇到status bar字体颜色需要修改的问题,症状如下:导航栏设置为黑色后,iphone上status bar的字体颜色 ...
浅谈Jquery和常用框架Vue变化
区别 Vue数据与视图的分离 Vue数据驱动视图 Jquery 简单示例: <!DOCTYPE html> <html lang="en"> <hea ...
mysql 8.0.12安装步骤
首先从官网下载压缩包: 解压压缩包到指定目录,在目录下新建my.ini,配置内容如下; [mysqld] # 设置3306端口 port=3306 # 设置mysql的安装目录 basedir ...
Spring Boot在反序列化过程中：jackson.databind.exc.InvalidDefinitionException cannot deserialize from Object value
错误场景用Spring boot写了一个简单的RESTful API,在测试POST请求的时候,request body是一个符合对应实体类要求的json串,post的时候报错. 先贴一段error ...
HTML5中的拖拽与拖放(drag&&drop)
1.drag 当拖动某个元素时,将会依次触发下列事件: 1)dragstart:按下鼠标键并开始移动鼠标时,会触发该事件 2)drag:dragstart触发后,随即便触发drag事件,而且在元素被拖 ...
Spring Boot 多环境部署
再简单的应用系统,通常都有两个环境——开发环境和线上环境.大型的企业应用还会有更多的环境,比如测试环境.准线上环境.演示环境等.应用的版本也可能对应了多个环境,比如1.0版本的演示环境.2.0版本的演 ...
python 基于Anaconda import numpy 报错 Importing the multiarray numpy extension module failed.
在windows中安装了 Anaconda 运行时报错原因是系统环境变量起初并没有引入 E:\Tools\Anaconda\Library\bin 解决办法: 在系统环境变量中加入 E:\To ...
vim ,vi总是卡死，终于找到原因了。
玩了这么多年linux 居然不知道这个..特此记录. 使用vim时,如果你不小心按了 Ctrl + s后,你会发现不能输入任何东西了,像死掉了一般,其实vim并没有死掉,这时vim只是停止向终端输出而 ...

【RL系列】Multi-Armed Bandit笔记——UCB策略与Gradient策略

【RL系列】Multi-Armed Bandit笔记——UCB策略与Gradient策略的更多相关文章

随机推荐

热门专题