logistic regression浅析
最近开始学习机器学习的相关理论知识,准备把自己的整个学习心得整理汇集成博客,一来可以督促自己,二来可以整理思路,对问题有一个更加透彻的理解,三来也可以放在网上和大家分享讨论,促进交流。
由于这次的学习过程主要是以数学理论以及对应的编程为主,因此,整个过程中,我将以Kaggle上的Titanic上的数据作为练习背景。
今天以logistic regression为主,主要包括理论部分以及对应的编程实验结果。
理论部分
logistic regression主要应用于二值分类问题,首先我们需要引入伯努利分布的概念。
- 伯努利分布又称两点分布或者是0-1分布
- 伯努利实验是只有两种可能结果的单次随机实验
- 进行一次伯努利实验,成功(y=1)的概率为p, 失败(y=0)的概率为1-p,则称随机变量y服从伯努利分布
- 伯努利分布的离散概率分布函数可以表达为
- 这里可以参考一下http://blog.csdn.net/michael_r_chang/article/details/39188321,有关于伯努利分布,二项分布,多项分布的基本介绍。
有了上述概念之后,我们可以引入logistic regression的基本概念。logistic regression认为,在我们对两类事物进行分类的时候(如y=1和y=0),若出现特征x,则
上式即所谓的logistic分布或者是sigmoid分布,其一般通式为
注意
logtistic回归的任务是给定一系列的训练样本集合,并假设y=1发生的概率可以由logistic分布来进行表达,求出模型系数
以便进行将来的预测。
上述问题可以通过极大似然估计来进行求解,即
经过负对数变换之后,即可最小化如下公式
利用最速下降算法,在第k次迭代
处的梯度可以表示为
因此系数可以进行如下更新:
实验部分:
- 如果每次只随机选择其中的某一个样本计算梯度并进行模型更新,就是所谓的随机梯度下降算法(stochastic gradient descent)
- 如果每次选择多个样本同时计算梯度并进行模型更新,就是所谓的mini-batch算法
- 如果每次选择所有的样本计算梯度并进行模型更新,就是所谓的batch descent算法
实验中我们将研究batch数目(即将所有的样本均分成多少份进行梯度计算)以及迭代步长对速度的影响

如上图所示,迭代步长和batch数目对收敛速度都有很大的影响,一般来说,迭代步长越大,batch数目越多,速度就越快,但是当迭代步长和batch数目同时过大的时候,算法会出现不稳定的情况,如上图的蓝实线所示。
关于迭代步长的影响很好理解,因为最速下降中,每一次沿着梯度方向走的太短,则需要很多步才可以对模型产生足够的更新,反之,如果每一次沿着梯度方向走得太远,则可能超过了当前所能够走的最大距离,目标函数不一定变小。
关于batch数目的影响,总的来说,是希望利用每一个小样本子集所计算出来的梯度和利用全部样本的所计算出来的梯度方向近似,如此便可以利用相对小的计算量达到足够准确的梯度方向,从而减少计算时间。但是如果batch数目过多,则每个子集中的样本过少,无法进行有效近似,也就是近似梯度方向不够准确和稳定,从而出现上述的不稳定现象。
可以考虑在迭代过程中不断地减小迭代步长和batch数目来进行综合,确保开始的快速减小和后来的算法稳定性。
注意:在利用梯度方向进行更新的时候,最好对计算出来的梯度进行归一化,便于选择迭代步长。
logistic regression浅析的更多相关文章
- 逻辑回归 Logistic Regression
逻辑回归(Logistic Regression)是广义线性回归的一种.逻辑回归是用来做分类任务的常用算法.分类任务的目标是找一个函数,把观测值匹配到相关的类和标签上.比如一个人有没有病,又因为噪声的 ...
- logistic regression与SVM
Logistic模型和SVM都是用于二分类,现在大概说一下两者的区别 ① 寻找最优超平面的方法不同 形象点说,Logistic模型找的那个超平面,是尽量让所有点都远离它,而SVM寻找的那个超平面,是只 ...
- Logistic Regression - Formula Deduction
Sigmoid Function \[ \sigma(z)=\frac{1}{1+e^{(-z)}} \] feature: axial symmetry: \[ \sigma(z)+ \sigma( ...
- SparkMLlib之 logistic regression源码分析
最近在研究机器学习,使用的工具是spark,本文是针对spar最新的源码Spark1.6.0的MLlib中的logistic regression, linear regression进行源码分析,其 ...
- [OpenCV] Samples 06: [ML] logistic regression
logistic regression,这个算法只能解决简单的线性二分类,在众多的机器学习分类算法中并不出众,但它能被改进为多分类,并换了另外一个名字softmax, 这可是深度学习中响当当的分类算法 ...
- Stanford机器学习笔记-2.Logistic Regression
Content: 2 Logistic Regression. 2.1 Classification. 2.2 Hypothesis representation. 2.2.1 Interpretin ...
- Logistic Regression vs Decision Trees vs SVM: Part II
This is the 2nd part of the series. Read the first part here: Logistic Regression Vs Decision Trees ...
- Logistic Regression Vs Decision Trees Vs SVM: Part I
Classification is one of the major problems that we solve while working on standard business problem ...
- Logistic Regression逻辑回归
参考自: http://blog.sina.com.cn/s/blog_74cf26810100ypzf.html http://blog.sina.com.cn/s/blog_64ecfc2f010 ...
随机推荐
- 作业20171019 alpha-1成绩
申诉 对成绩有疑问或不同意见的同学,请在群里[@杨贵福]. 申诉时间截止2017年11月21日 12:00. 总结 普遍成绩有明显上升,归功于1. 团队全都超额完成1次站立会议,多数团队完超额2次; ...
- Flask之WSGI:Werkzeug
WSGI 一个Web应用的本质就是: 浏览器发送一个HTTP请求: 服务器收到请求,生成一个HTML文档: 服务器把HTML文档作为HTTP响应的Body发送给浏览器: 浏览器收到HTTP响应,从HT ...
- 四则运算生成器功能完善&&界面设计——结对项目
结对成员:何小松 && 李入云 一.对结对编程的认识 优点: 1)程序员互相帮助,互相教对方,可以得到能力上的互补. 2)可以让编程环境有效地贯彻Design. 3)增强代码和产品质量 ...
- Linux curl 一例
root@PC-RENGUOQIANG:~# curl http://kermit:kermit@192.168.66.182:8080/activiti-rest/service/repositor ...
- Nginx+Php-fpm运行原理详解
一.代理与反向代理 现实生活中的例子 1.正向代理:访问google.com 如上图,因为google被墙,我们需要vpnFQ才能访问google.com. vpn对于“我们”来说,是可以感知到的(我 ...
- [日常工作] cmd以及bash 直接使用当前目录的方法
1. 从知乎学到了一点.. 2. 之前想在比如f:\a\b 目录下执行cmd命令的时候 总是需要先 f: 再cd目录的方式. 3. 知乎上面学到 发现可以通过在当前目录下面 输入 cmd 或者是 b ...
- linux_shell自定义命令
一.命令可执行文件所在目录 shell命令可执行文件所在目录是保存在环境变量PATH中的,终端输入如下命令查看 PATH 环境变量的内容: $ echo $PATH 我的linux输出如下: /opt ...
- yum install 报错[Errno 14] curl#37 - Couldn't open file /mnt/repodata/repomd.xml
1.然后按照网上的一些修改,先是执行: yum cleam all 然后 yum makecache,问题还是没解决,继续报错. 其实这两条命令就是清空缓存,然后再重新缓存的意思,有时候可能有效. 2 ...
- 关于适用base64对图片进行编码在服务器上性能的相关讨论
周五在写open api的时候 和
- NOIP 2018 游记(退役了!)
一片空白 在霉的不能再霉的18年11月,Noip2018上,倒霉的我也是贼有意思,感冒加身,D2发烧,数组开小…我还能说什么MMP,身体和考试能力真的很重要. ……(省略无数字的心理活动,有空补上~) ...