SVM是机器学习中神一般的存在,虽然自深度学习以来有被拉下神坛的趋势,但不得不说SVM在这个领域有着举足轻重的地位。本文从Hard SVM 到 Dual Hard SVM再引进Kernel Trick,然后推广到常用的Soft Kernel SVM。

  一、Hard SVM

  SVM本身是从感知机算法演变而来,感知机算法是在一个线性可分的数据集中找到一个分类超平面,尽可能的将数据集划分开,理论上这样的超平面有无数多个,但是从直觉上,我们知道离两侧数据都比较远的超平面更适合用于分类,于是我们选择了一个比较“胖”的边界的超平面作为分类界,这就是SVM。

  我们知道一个超平面wx+b=0w是这个超平面的法向量,则平面外一点到这个平面的距离为:d=1/||W||*|WTx+b|(解析几何的知识)。绝对值符号会导致函数不平滑,又因为数据集是线性可分的,所以我们可以把距离公式改写为:d=1/||W||*yi·(WTxi+b)(具体可以参考感知机)。那么我们就有了最基本的优化对象:

                              maxw,b  margin(b,w)

                        subject to:for every n yi·(WTxi+b)>0

                            margin(b,w) = minw,b d

  我们知道同时放缩一个超平面的系数并不会改变这个超平面,such as 3wx+3b=0=wx+b,所以我们可以假设离我们超平面最近的那个向量到平面的距离为1,即让yi·(WTxi+b)=1,那么原来的优化问题就变为了:

                                   maxw,b  1/||W||

                        subject to:for every n yi·(WTxi+b)>0 (已经满足)

                               mini yi·(WTxi+b)≥1

  最大化问题不是很好解决,我们可以转换为我们熟悉最小化问题:

                                    minw,b  0.5*WT*W

                               subject to:mini   yi·(WTxi+b)≥1

  很明显这是一个二次规划问题,我们有成熟的算法如SMO,来解决这样的问题。

  二、Dual SVM    

  对于一个已经解决的问题,为什么我们还要考虑它的对偶问题?这是因为化作对偶问题后会更容易求解,同样也方便引入Kernel Trick。

  考虑原始SVM问题:      

                                   minw,b  0.5*WT*W

                             subject to:all i   yi·(WTxi+b)≥1

  我们改变其形式,转化为:

                          minw,b(maxall α>0  0.5*WT*W+∑α(1-yi·(WTxi+b)))

  我们发现如果满足了条件α的值会变成0,如果不满足就会变成+∞,以此来约束我们的条件。然后我们从极小极大的问题转换为极大极小的问题。  

     minw,b(maxall α>0  0.5*WT*W+∑α(1-yi·(WTxi+b))) ≥ minw,b(0.5*WT*W+∑α(1-yi·(WTxi+b))

    minw,b(0.5*WT*W+∑α(1-yi·(WTxi+b))≥maxall α>0(minw,b  0.5*WT*W+∑α(1-yi·(WTxi+b)))

  maxall α>0(minw,b  0.5*WT*W+∑α(1-yi·(WTxi+b)))就是我们的Lagrange Dual Problem。这是我们原问题的一个下界,那么什么时候能够取得等号呢?根据拉格朗日对偶问题,当优化函数和条件是凸函数时,对偶问题是原问题的解的充要条件即为KKT 条件。然后我们求解对偶问题的极小问题,对w,b求偏导,令其等于0,得到结果为

                              L(w,b,α)=-0.5*||∑αyx||2+∑α

  我们就可以来解决极大问题了,原始优化问题就可以转化为:

                             maxall α>0 ∑yα = 0 w=∑αyx   -0.5*||∑αyx||2+∑α

  这显然又是一个二次规划问题!所以就可以求解了,然后用KKT条件来求解w,b。这就是对偶问题的求解方案。

  三、Kernel Trick

  当数据不是线性可分的,那么SVM就失去了作用,但是我们可以寻找一种函数将数据映射到更高维的空间中,以此把问题变成一个线性可分的问题,但是这会带来维度的急剧上升,使得模型求解效率大大下降,而Kernel Trick就是为了解决这样的问题而出现的!(下回补完!)

  四、Soft SVM

[机器学习]SVM原理的更多相关文章

  1. 机器学习之支持向量机—SVM原理代码实现

    支持向量机—SVM原理代码实现 本文系作者原创,转载请注明出处:https://www.cnblogs.com/further-further-further/p/9596898.html 1. 解决 ...

  2. 文本分类学习 (五) 机器学习SVM的前奏-特征提取(卡方检验续集)

    前言: 上一篇比较详细的介绍了卡方检验和卡方分布.这篇我们就实际操刀,找到一些训练集,正所谓纸上得来终觉浅,绝知此事要躬行.然而我在躬行的时候,发现了卡方检验对于文本分类来说应该把公式再变形一般,那样 ...

  3. Support Vector Machine (1) : 简单SVM原理

    目录 Support Vector Machine (1) : 简单SVM原理 Support Vector Machine (2) : Sequential Minimal Optimization ...

  4. 机器学习 | 深入SVM原理及模型推导(一)

    本文始发于个人公众号:TechFlow,原创不易,求个关注 今天是机器学习专题的第32篇文章,我们来聊聊SVM. SVM模型大家可能非常熟悉,可能都知道它是面试的常客,经常被问到.它最早诞生于上世纪六 ...

  5. SVM原理与实践

    SVM迅速发展和完善,在解决小样本.非线性及高维模式识别问题中表现出许多特有的优势,并能够推广应用到函数拟合等其他机器学习问题中.从此迅速的发展起来,已经在许多领域(生物信息学,文本和手写识别等)都取 ...

  6. (一)SVM原理

    前言 本文开始主要介绍一下SVM的分类原理以及SVM的数学导出和SVM在Python上的实现.借鉴了许多文章,会在后面一一指出,如果有什么不对的希望能指正. 一. SVM简介 首先看到SVM是在斯坦福 ...

  7. 机器学习——SVM详解(标准形式,对偶形式,Kernel及Soft Margin)

    (写在前面:机器学习入行快2年了,多多少少用过一些算法,但由于敲公式太过浪费时间,所以一直搁置了开一个机器学习系列的博客.但是现在毕竟是电子化的时代,也不可能每时每刻都带着自己的记事本.如果可以掏出手 ...

  8. SVM原理简介

    本文只是简单介绍一下SVM的理论框架,想要详细了解当中细节问题处理可以参看后续章节或者网上各种详细资料.推荐Andrew Ng的斯坦福大学机器学习课程. 年代中期发展起来的基于统计学习理论的一种机器学 ...

  9. SVM原理(1)

    SVM即支持向量机,是一种机器学习内的二类分类方法,是有监督学习方法. 首先我们需要建立一个分类任务: 首先考虑线性可分的情况:(所谓线性可分就是在N维空间上的两类点,可以用N-1个未知数的函数(超平 ...

随机推荐

  1. Java中如何拼接sql或者其他含有变量语句

    本原则是个人感悟(不保证完全正确) 第一条原则,首先将一条完整的字符串写好.(例如是"select * from users where id=(id+1)") 凡是变量都需要在其 ...

  2. java 读取项目外面配置文件的方法

    public static void loadProps(String propertiesUrl) { props = new Properties(); InputStream in = null ...

  3. 在项目中使用CLR规划

    1.创建自己的项目 2.对"解..."→参加→目→C#→数据库→SQL Server项目,例如以下图所看到的: 3.选择操作数据库 4.创建存储过程 5.代码(详见:CLR存储过程 ...

  4. numpy 下的数据结构与数据类型的转换(np.array vs. np.asarray)

    1. np.asarray -- numpy 风格的类型转换 从已有多维数组创建新的多维数组,数据类型可重新设置 >> B = np.asarray(A, dtype='int32') 2 ...

  5. [Scikit-Learn] - introduction

    scikit-learn是一个用于机器学习的 Python 模块,建立在SciPy基础之上. 主要特点: 操作简单.高效的数据挖掘和数据分析 无访问限制,在任何情况下可重新使用 建立在NumPy.Sc ...

  6. Android 异步更新UI----handler+thread

    android应用是单线程模式的. 单线程模式需要记住两条: 一.防止UI线程阻塞 二.确保只在UI线程中访问Android UI工具包 在开发Android应用时必须遵守单线程模型的原则:Andro ...

  7. 一些常用的WebServices

    天气预报Web服务,数据来源于中国气象局 Endpoint  Disco  WSDL IP地址来源搜索 WEB 服务(是目前最完整的IP地址数据) Endpoint  Disco  WSDL 随机英文 ...

  8. Swift 1

    Swift 中函数使用指南 关于Swift中的各种函数的使用的总结 前言 时间久了,好多东西我们就会慢慢忘记,在这里总结一下Swift中函数的使用原则,把大部分的函数使用技巧用代码示例来做了演示,但是 ...

  9. 深入Qt 学习 -- 反射机制(比较简单清楚)

    相对于Java天生的这一特性, C++并不具备;但进入到Qt领域,这一切都变得简单自如了. 从Qt的元对象系统可知,除了提供信号/槽机制的特性之外,它还提供了以下特性: ■ QObject::meta ...

  10. hdu1180奇怪的楼梯……bfs迷阵……wa该16二级,我太渣滓

    #include<iostream> #include<queue> #include<cstring> using namespace std; int row, ...