【Linear Models for Binary Classification】林轩田机器学习基石

首先回顾了几个Linear Model的共性：都是算出来一个score，然后做某种变化处理。

既然Linear Model有各种好处（训练时间，公式简单），那如何把Linear Regression给应用到Classification的问题上呢？到底能不能迁移呢？

总结了如下的集中Linear Model的error functions的表达式：

这里都提炼出来了ys这一项，y表示需要更正的方向{+1，-1}，s表示需要更正的幅度（score）

三种error function可以这么理解：

（1）0/1 error : 幅度s固定，y表示方向

（2）square error : y很正或很负，error都非常大(注意这里只需要y很大或很下，error就收不住了)；只有当ys很接近1的时候，error才可能接近0

（3）cross-entropy error : 如果ys很负的话，那么error就无穷大；如果ys很正的话，那么error无限接近0

再画出几种model的error function，可以看到：

（1）square error是不太合适的，ys>>1的时候，error衡量的过了，不合适。

（2）cross-entropy error也不太合适，因为在0到-1之间位于0/1 error下面了

如果想合适的话，可以对cross-entropy进行放缩：把ln换成log2，就OK了。

这里有个Point值得关注，为啥要放缩呢？错误率低不是更好么？

其实这跟目的有关：

（1）首先我们的目的是要用regression来代替classification（为啥要替代？因为PLA/Pocket是NP-hard的问题，不好整；而Linear Model在最优化之后，求解比较容易了），如果regression和classification在性能上差不多，那就可以替代了。

（2）因此，我们把cross-entropy error来scale成0/1 error的upper bound，目的就是让cross-entropy error低的时候，0/1error也低，放缩一下是为了说bound住这个事情。

再简单些就是说，如果实际中linear model用regression给出来的方法分类效果好，那么PLA/Pocket分类效果也好。

接下来对比了PLA、Linear Regression 和 Logistic Regression的方法优缺点：

（1）PLA：线性可分时候很犀利；如果不可分，那就只好Pocket

（2）Linear Regression：最优化可以求出来analytics close solution；但是当|ys|很大的时候，positive direction和negative direction的bound都太松太松了

（3）Logistic Regression：gradient descent可以求解；但是negatvie direction方向bound比较松

总结一些实际经验：linear regression可以作为PLA/Pocket/Logistic Regression的初始值设置。

接下来讲了一种Stochastic Gradient Descent的方法：

（1）原来是所有点在算梯度，然后取平均，再更新w；随机梯度下降，是不用每次算所有点了，每次算一个点，用这个点代替所有点的平均。

（2）敢这么做的原因：是因为 stochastic gradient = true gradient + zero-mean 'noise' directions；因为是zero-mean的noise，所以可以得到average true gradient ≈ average stochastic gradient

（3）SGD方法在logistic regression的应用公式，非常像PLA的公式

（4）从实际情况出发，一般迭代次数达到一定，可以认为SGD已经获得了最佳的结果；ita在实际经验中，一般取值为0.1左右合适。

随后，由binary classification问题延伸到了multiclass的问题，总体来说有两种方法：

1. One-Versus-ALL (OVA) Decomposition

意思就是

（1）每次把一个class和非这个class的当成目标两类，用logistic regression分这两类

（2）分类时输入某个点，然后看这个点上取哪一类的概率最大

这里有一点点儿问题：（2）点中不一定所有类别的概率和是1，虽然实际中影响不大，但是统计学的还是有严谨的方法（multinomial logistic regression）

当类别很多的时候（比如，K=100）那么，每次用logistic regression的时候，正样本和负样本的差别非常大，这样不容易得出正确结果。

为了解决OVA的unbalance问题：每次只取两个类，一共有K类，做C(K,2)次logistic regression就OK了；当给一个输入点的时候，用这C(K，2）个分类器给所有K个类别投票，取票数大的作为输出结果。

这种方法的缺点是：可能效率会低一些（K次变成C(K,2)次）。

但是，如果类别很多，每一类的样本量都差不多的时候，其实OVO的方法不一定比OVA方法效率低。

【Linear Models for Binary Classification】林轩田机器学习基石的更多相关文章

（转载）林轩田机器学习基石课程学习笔记1 — The Learning Problem
(转载)林轩田机器学习基石课程学习笔记1 - The Learning Problem When Can Machine Learn? Why Can Machine Learn? How Can M ...
【Linear Regression】林轩田机器学习基石
这一节开始讲基础的Linear Regression算法. (1)Linear Regression的假设空间变成了实数域 (2)Linear Regression的目标是找到使得残差更小的分割线(超 ...
【 Logistic Regression 】林轩田机器学习基石
这里提出Logistic Regression的角度是Soft Binary Classification.输出限定在0~1之间,用于表示可能发生positive的概率. 具体的做法是在Linear ...
【The VC Dimension】林轩田机器学习基石
首先回顾上节课末尾引出来的VC Bound概念,对于机器学习来说,VC dimension理论到底有啥用. 三点: 1. 如果有Break Point证明是一个好的假设集合 2. 如果N足够大,那么E ...
【Theory of Generalization】林轩田机器学习基石
紧接上一讲的Break Point of H.有一个非常intuition的结论,如果break point在k取到了,那么k+1, k+2,... 都是break point. 那么除此之外,我们还 ...
【Training versus Testing】林轩田机器学习基石
接着上一讲留下的关子,机器学习是否可行与假设集合H的数量M的关系. 机器学习是否可行的两个关键点: 1. Ein(g)是否足够小(在训练集上的表现是否出色) 2. Eout(g)是否与Ein(g)足够 ...
林轩田机器学习基石课程学习笔记5 — Training versus Testing
上节课,我们主要介绍了机器学习的可行性.首先,由NFL定理可知,机器学习貌似是不可行的.但是,随后引入了统计学知识,如果样本数据足够大,且hypothesis个数有限,那么机器学习一般就是可行的.本节 ...
林轩田机器学习基石笔记3—Types of Learning
上节课我们主要介绍了解决线性分类问题的一个简单的方法:PLA.PLA能够在平面中选择一条直线将样本数据完全正确分类.而对于线性不可分的情况,可以使用Pocket Algorithm来处理.本节课将主要 ...
【Linear Support Vector Machine】林轩田机器学习技法
首先从介绍了Large_margin Separating Hyperplane的概念. (在linear separable的前提下)找到largest-margin的分界面,即最胖的那条分界线.下 ...

随机推荐

Selenium入门8 js调用
execute_script 可以执行js和jquery脚本示例如下:修改百度首页的按钮字体颜色,按钮隐藏,按钮显示 #coding=utf-8 # 调用js jquery from seleniu ...
dd-wrt ddns更新失败由于电信提供的ip不是公网ip
由于电信提供的ip地址原来是公网的ip,后来电信通过nat提供一个内网ip,导致ddns更新失败.电话给电信客服10000号,让他们修改回来之后就可以了. 如果ddns更新失败,尤其是原本是正常的,后 ...
DOM笔记（十二）：又谈原型对象
因为之前谢过一篇关于原型对象的笔记:浅谈JavaScript中的原型模式.现在我又重新看到这个话题,对原型有了进一步的理解,所以,又要谈谈原型对象. 一.理解原型对象创建的每一个函数都有一个prot ...
解决robotframework安装时提示wxPython not found问题
背景:想把现在pc的项目做成关键字的形式,可以让功能测试人员也参与到自动化测试中,于是就找到robotframework这个框架,试用下怎么样,在安装时就遇到很多问题,安装的帖子有很多,很详细,如:h ...
【[TJOI2017]DNA】
[题目][https://www.lydsy.com/JudgeOnline/problem.php?id=4892] 好像用\(SAM\)做的都是\(dfs\)啊其实这里也是搜索如果用\(SAM ...
spfa判负权边
spfa判负环如果一个点在spfa中被入队了大于n次那么,我们就能肯定,有负环出现. 因为一个点入队时,他肯定被更新了一次. 所以........ 如果不存在负权环.这个点最多被更新节点数次我们 ...
System.IO 二
接着上篇的来 System.IO FileSystemWatcher 指向这个签名的方法可以监听目录发生了什么事件例如: static void Main(string[] args) ...
ES6初识-解构赋值
数组解构赋值 [a,b]=[1,2]; . 方法返回 function f(){ return [1,2] } let a,b; [a,b]=f();//a=1,b=2 function f1() ...
leetcode第221题（最大正方形）的本地IDE实现及变形
问题描述: 在一个由 0 和 1 组成的二维矩阵内,找到只包含 1 的最大正方形,并返回其面积.PS:本文也对只包含0的最大正方形面积进行了运算示例: 输入: 1 0 1 0 0 1 0 1 1 1 ...
LeetCode111. Minimum Depth of Binary Tree
题目给定一个二叉树,找出其最小深度. 最小深度是从根节点到最近叶子节点的最短路径上的节点数量. 说明: 叶子节点是指没有子节点的节点. 示例: 给定二叉树 [3,9,20,null,null,15, ...

【Linear Models for Binary Classification】林轩田机器学习基石

【Linear Models for Binary Classification】林轩田机器学习基石的更多相关文章

随机推荐

热门专题