逻辑回归LR

逻辑回归算法相信很多人都很熟悉，也算是我比较熟悉的算法之一了，毕业论文当时的项目就是用的这个算法。这个算法可能不想随机森林、SVM、神经网络、GBDT等分类算法那么复杂那么高深的样子，可是绝对不能小看这个算法，因为它有几个优点是那几个算法无法达到的，一是逻辑回归的算法已经比较成熟，预测较为准确；二是模型求出的系数易于理解，便于解释，不属于黑盒模型，尤其在银行业，80%的预测是使用逻辑回归；三是结果是概率值，可以做ranking model；四是训练快。当然它也有缺点，分类较多的y都不是很适用。下面我先具体介绍下这个模型。

一、逻辑回归LR介绍

首先要搞清楚当你的目标变量是分类变量时，才会考虑逻辑回归，并且主要用于两分类问题。举例来说医生希望通过肿瘤的大小x1、长度x2、种类x3等等特征来判断病人的这个肿瘤是恶性肿瘤还是良性肿瘤，这时目标变量y就是分类变量（0良性肿瘤，1恶性肿瘤）。显然我们希望像保留像线性回归一样可以通过一些列x与y之间的线性关系来进行预测，但是此时由于Y是分类变量，它的取值只能是0,1,或者0,1,2等等，不可能是负无穷到正无穷，这个问题怎么解决呢？此时引入了一个sigmoid函数，这个函数的性质，非常好的满足了，x的输入可以是负无穷到正无穷，而输出y总是[0,1]，并且当x=0时，y的值为0.5，以一种概率的形式表示. x=0的时候y=0.5 这是决策边界。当你要确定肿瘤是良性还是恶性时，其实我们是要找出能够分开这两类样本的边界，叫决策边界。

而通过sigmoid函数，可以将我们喜欢的线性表示的函数嵌入其中，当theta*x得到的值大于0，则h(x)得到的概率值大于0.5时，表明属于该分类；当theta*x得到的值小于0，则h(x)小于0.5时表示不属于该分类。这样也就形成了我们看到的逻辑回归，具体如下：

其中theta是向量，

二、逻辑回归估计（最小化损失函数loss function）

损失函数是在机器学习中最常出现的概念，用于衡量均方误差[（模型估计值－模型实际值）^2／ n]最小，即预测的准确性，因而需要损失函数最小，得到的参数才最优。（线性回归中的最小二乘估计也是由此而来）但因为逻辑回归的这种损失函数非凸，不能找到全局最低点。因此，需要采用另一种方式，将其转化为求最大似然，如下，具体的推导求解过程可参见博客http://blog.csdn.net/suipingsp/article/details/41822313 另一种较为好理解的方式是，如果Y=1，你胆敢给出一个h(x)很小的概率比如0.01，那么损失函数就会变得很大：

此时的损失函数变成了凸函数，Theta的求解，就是梯度下降法求最小值，此时加入的正则化项，是解决过拟合问题。（过拟合问题：如果我们的模型有非常多的特征，模型很复杂，模型对原始数据的拟合效果很好，但是丧失一般性，对新的待预测变量预测效果很差。（听过寒小阳老师举过一个很好理解的例子，就是这个学生只是强硬的记住题目，并没有掌握规律，高考不一定考的好）怎么解决呢？限制参数寺塔，损失函数加上关于theta的限制，即如果theta太多太大，则就给予惩罚。L2正则化。）

该公式将一直被迭代执行，直至达到收敛（（）在每一步迭代中都减小，如果某一步减少的值少于某个很小的值（）（小于0.001）, 则其判定收敛）或某个停止条件为止（比如迭代次数达到某个指定值或算法达到某个可以允许的误差范围）。转换为向量的处理方法同样可参见上文博客：http://blog.csdn.net/suipingsp/article/details/41822313

三、LR应用经验

如果连续变量，注意做SCALING，缩放单位即标准化。LR对样本分布敏感，所以要注意样本的平衡性（y=1不能太少）样本量足的情况下采用下采样，不足的情况用上采样。

LR对于特征处理非常重要，常用处理手段包括，通过组合特征引入个性化因素(FM,FFM)；注意特征的频度；聚类、HASH。但LR不怕特征大，GBDT比较怕。对于连续变量的离散化，可以用CART查看离散的结果，生成新的特征，再用LR。

LR和FM对于稀疏高维特征处理是无压力的，GBDT对于连续值自己会找到合适的切分点，xgboost也可以处理category类型的feature，无需one-hot，平展开的高维稀疏特征对它没好处。

算法调优方面，选择合适的正则化，正则化系数，收敛阈值e，迭代轮数，调整loss function给定不同权重；bagging或其他方式的模型融合；最优算法选择（‘newton-cg’,’lbfgs’, ‘liblinear’）；bagging或其他模型融合。Sklearn中的LR实际上是liblinear的封装。

LR和SVM对于线性切分都有着比较好的表现，对于非线性切分，必须在原始数据上做一些非线性变换。LR必须做feature mapping，比如把X做个平方项，X1*X2等；SVM则需要利用核函数

模型的评价主要用ROC曲线。ROC（接受者操作特征）曲线实际上是对概率输出设置了一个门槛D，当P(C|x)>D时，事件C为真，而ROC曲线反映了，在一系列可能门槛值下，真正率（ TPR）和假正率(FPR)的值，一个好的模型必须在一个高的真正率（ TPR）和一个低的假正率(FPR)中取得一个折衷水平，ROC曲线下的面积越大越好，最大为1.　

逻辑回归LR的更多相关文章

线性模型之逻辑回归(LR)(原理、公式推导、模型对比、常见面试点)
参考资料(要是对于本文的理解不够透彻,必须将以下博客认知阅读,方可全面了解LR): (1).https://zhuanlan.zhihu.com/p/74874291 (2).逻辑回归与交叉熵 (3) ...
机器学习（四）—逻辑回归LR
逻辑回归常见问题:https://www.cnblogs.com/ModifyRong/p/7739955.html 推导在笔记上,现在摘取部分要点如下: (0) LR回归是在线性回归模型的基础上,使 ...
机器学习方法（五）：逻辑回归Logistic Regression，Softmax Regression
欢迎转载,转载请注明:本文出自Bin的专栏blog.csdn.net/xbinworld. 技术交流QQ群:433250724,欢迎对算法.技术.应用感兴趣的同学加入. 前面介绍过线性回归的基本知识, ...
机器学习-逻辑回归与SVM的联系与区别
(搬运工) 逻辑回归(LR)与SVM的联系与区别 LR 和 SVM 都可以处理分类问题,且一般都用于处理线性二分类问题(在改进的情况下可以处理多分类问题,如LR的Softmax回归用在深度学习的多分类 ...
逻辑回归（LR）总结复习
摘要: 1.算法概述 2.算法推导 3.算法特性及优缺点 4.注意事项 5.实现和具体例子 6.适用场合内容: 1.算法概述最基本的LR分类器适合于对两分类(类0,类1)目标进行分类:这个模型以样 ...
逻辑回归算法的原理及实现(LR)
Logistic回归虽然名字叫"回归" ,但却是一种分类学习方法.使用场景大概有两个:第一用来预测,第二寻找因变量的影响因素.逻辑回归(Logistic Regression, L ...
Python实现LR(逻辑回归)
Python实现LR(逻辑回归) 运行环境 Pyhton3 numpy(科学计算包) matplotlib(画图所需,不画图可不必) 计算过程 st=>start: 开始 e=>end o ...
逻辑回归模型(Logistic Regression, LR)基础
逻辑回归模型(Logistic Regression, LR)基础逻辑回归(Logistic Regression, LR)模型其实仅在线性回归的基础上,套用了一个逻辑函数,但也就由于这个逻辑函 ...
细品 - 逻辑回归（LR）
1. LR的直观表述 1.1 直观表述今天我们来深入了解一个人见人爱,花见花开,工业界为之疯狂,学术界..额,好像学术界用的不多哎.不过没关系,就算学术界用的不多也遮不住它NB的光芒,它就是LR模型 ...

随机推荐

观察者模式（Observer和Observable实现）
package com.wzy.java8.thread; import java.util.Observable; import java.util.Observer; public class D ...
Java程序设计之合租房synchronized(二)
一号和二号合租一间房,里面共用一个卫生间对象,这是要用到synchronized关键字,一号与二号同时使用卫生间时,一个需要wait()等待被唤醒,另外一个使用完之后卫生间对象被释放,这时候刚刚使用的 ...
NYOJ 478
月老的烦恼(1) 描述月老最近遇到了一个很棘手的问题,就是“剩男”“剩女”急速增长,而自己这边又人手不足导致天天都得加班.现在需要你来帮助月老解决这个问题,牵红绳的规则很简单:每个男生都一个编号n( ...
java之多线程二
线程的生命周期: 当线程被创建并被启动时,它既不是一启动就进入了执行状态,在线程的生命周期中,它要经过new(新建),就绪(Runnable),运行(Running),阻塞(Blocked),dead ...
Mysql数据库主从心得整理
管理mysql主从有2年多了,管理过200多组mysql主从,几乎涉及到各个版本的主从,本博文属于总结性的,有一部分是摘自网络,大部分是根据自己管理的心得和经验所写,整理了一下,分享给各位同行,希望对 ...
centos 6x系统下源码安装mysql操作记录
在运维工作中经常部署各种运维环境,涉及mysql数据库的安装也是时常需要的.mysql数据库安装可以选择yum在线安装,但是这种安装的mysql一般是系统自带的,版本方面可能跟需求不太匹配.可以通过源 ...
Membership 重置密码
public ActionResult ChongZhiMiMa() { Membership.GetUser("admin").UnlockU ...
关于网络配置和zmp以及json
1. JSON那一块有点小问题,当我们和手机进行通信的时候,virtualswitch写成本机的地址 192.168.1.100即可. 还有就是 jsonstring.c_str() 后面没有 + 1 ...
[LeetCode] The Skyline Problem
A city's skyline is the outer contour of the silhouette formed by all the buildings in that city whe ...
C/C++实践笔记 007
进制输出自己写一个_itoa 进制转换void main(){ int num = 0; scanf("%d", &num); printf("num=%i&qu ...

逻辑回归LR

逻辑回归LR的更多相关文章

随机推荐

热门专题