推荐算法之E&E

一、定义

E&E就是探索（explore）和利用（exploit)。

Exploit：基于已知最好策略，开发利用已知具有较高回报的item（贪婪、短期回报），对于推荐来讲就是用户已经发现的兴趣，继续加以利用推荐。

优点：充分利用高回报item。

缺点：容易陷入局部最优，可能错过潜在最高回报的item。

Explore：挖掘未知的潜在可能高回报的的item（非贪婪、长期回报），对于推荐来讲，就是探索用户新的未知的兴趣点，防止推荐越来越窄。

优点：可以发现更高回报的item。

缺点：充分利用已有高回报的item机会减少(如果高回报item之前已经找到，再探索肯定就会浪费高回报的机会)

目标：要找到Exploit & Explore的trade-off，以达到累计回报最大化。

如果Exploit占比太高，那么推荐就会越来越窄，最终收益反倒下降；如果Explore占比过高的话，可能大多是用户不太感兴趣的，浪费的机会比较多，综合收益下降更快。

二、MAB(Multi-armed bandit)多臂赌博机问题

一个赌徒，要去摇赌博机，走进赌场一看，一排赌博机，外表一模一样，但是每个赌博机吐钱的概率可不一样，他不知道每个。他不知道每个赌博机吐钱的概率分布是什么，那么想最大化收益该怎么办？这就是MAB问题，又叫多臂赌博机问题。有很多相似问题都属于MAB问题：

1）假设一个用户对不同类别的内容兴趣程度也不同，当推荐系统初次见到这个用户，如何快速地知道用户对每类内容的感兴趣程度呢?这也是推荐系统常常要面对的冷启动问题。

2）假设系统中有若干个广告库存物料，该给用户展示哪个广告，才能获得最高的点击收益呢?是不是每次都挑选收益最高的哪个呢？

这些问题都是关于选择的问题，只要是选择的问题，都可以简化成一个MAB问题。

Bandit算法就是用来解决此类问题的。

三、Bandit算法

Bandit不是一个算法，而是指一类算法。Bandit算法家族如何衡量选择的好坏呢? 它们使用累计遗憾（collect regret）来衡量策略的优劣。

wB(i)是第i次试验时被选中item的回报， w_opt是所有item中的最佳选择item的回报。累计遗憾为T次的选择的遗憾累计，每次选择的遗憾为最优选择回报与本次选择回报之差。

为了简单起见，我们假设每台机器的收益为伯努利收益，即收益要么是0，要么是1。对应到推荐系统中，赌博机即对应我们的物品（item），每次摇臂即认为是该物品的一次展示，我们可以用是否点击来表示收益，点击(win)的收益就是1，没有点击(lose)的收益就是0

比较常用的且效果比较好的Bandit算法主要有Thompson(汤普森)采样算法、UCB(Upper Confidence Bound)算法，后面会单独开讲。

随机推荐

xadmin引入django-rest-framework
一.安装: pip install djangorestframework 安装djangorestframework库 https://github.com/encode/django-rest-f ...
Windows使用CMD命令查看进程和终止进程
TaskList: 列出当前所有运行进程. 使用方法:在命令提示符中输入tasklist 然后回车,会看到类似下面的列表: 映像名称 PID 会话名会话# 内存使用 == ...
微信公众平台iPhone版内测开始了
5月9日晚些时候自媒体人收到了微信公众平台iPhone版的内测邀请,微信公众平台iPhone版可在手机上写图文,快速查看并回复粉丝消息.留言和赞赏,新建群发.查看群发历史和今日数据,这些功能很实用了, ...
home_url()用法小结|wordpress函数
home_url()检索可访问当前站点的URL(推荐将<?php bloginfo('url'); ?>用<?php home_url(); ?>来替代),使用适当的协议返回' ...
重新学习Spring注解——AOP
面向切面编程——思想:在一个地方定义通用功能,但是可以通过声明的方式定义这个功能要以何种方式在何处运用,而无须修改受影响的类. 切面:横切关注点可以被模块化为特殊的类. 优点: 1.每个关注点都集中在 ...
requests-html
目录一介绍二安装三如何使用requests-html 四支持JavaScript 五自定义User-Agent 六模拟表单提交七支持异步请求一介绍 Python上有一个非常著 ...
单例模式-DCL双重锁检查实现及原理刨析
以我的经验为例(如有不对欢迎指正),在生产过程中,经常会遇到下面两种情况: 1.封装的某个类不包含具有具体业务含义的类成员变量,是对业务动作的封装,如MVC中的各层(HTTPRequest对象以Thr ...
redis实现mysql的数据缓存
环境设定base2 172.25.78.12 nginx+phpbase3 172.25.78.13 redis端base4 172.25.78.14 mysql端# 1.在base2(nginx+p ...
RedHat linux服务器对外开放指定端口
为了能够远程访问这台机器上的MySQL,需要开放3306端口: [root@localhost ~]# service iptables status Redirecting to /bin/syst ...
Java 并发系列之二：java 并发机制的底层实现原理
1. 处理器实现原子操作 2. volatile /** 补充: 主要作用:内存可见性,是变量在多个线程中可见,修饰变量,解决一写多读的问题. 轻量级的synchronized,不会造成阻塞.性能比s ...

推荐算法之E&E

推荐算法之E&E的更多相关文章

随机推荐

热门专题