【十大经典数据挖掘算法】系列

1. 引言

顶级数据挖掘会议ICDM于2006年12月评选出了数据挖掘领域的十大经典算法：C4.5, k-Means, SVM, Apriori, EM, PageRank, AdaBoost, kNN, Naïve Bayes与 CART。以前看过关于这些数据挖掘算法，但对背后数学原理未做过多探究，因而借此整理以更深入地理解这些算法。

本文讨论的kNN算法是监督学习中分类方法的一种。所谓监督学习与非监督学习，是指训练数据是否有标注类别，若有则为监督学习，若否则为非监督学习。监督学习是根据输入数据（训练数据）学习一个模型，能对后来的输入做预测。在监督学习中，输入变量与输出变量可以是连续的，也可以是离散的。若输入变量与输出变量均为连续变量，则称为回归；输出变量为有限个离散变量，则称为分类；输入变量与输出变量均为变量序列，则称为标注[2]。

2. kNN算法

kNN算法的核心思想非常简单：在训练集中选取离输入的数据点最近的k个邻居，根据这个k个邻居中出现次数最多的类别（最大表决规则），作为该数据点的类别。

算法描述

训练集\(T = \lbrace (x_1,y_1),(x_2,y_2), \cdots ,(x_N,y_N) \rbrace\)，其类别\(y_i \in \lbrace c_1,c_2, \cdots ,c_K \rbrace\)，训练集中样本点数为\(N\)，类别数为\(K\)。输入待预测数据\(x\)，则预测类别

\begin{equation}
y = \arg \mathop {\max }\limits_{c_j} \sum\limits_{x_i \in N_k(x)} I(y_i = c_j),\ i = 1,2, \cdots ,N; \ j = 1,2, \cdots ,K
\label{eq:obj}
\end{equation}

其中，涵盖\(x\)的k邻域记作\(N_k(x)\)，当\(y_i = c_j\)时指示函数\(I=1\)，否则\(I=0\)。

分类决策规则

kNN学习模型：输入\(X\)，通过学习得到决策函数：输出类别\(Y=f(X)\)。假设分类损失函数为0-1损失函数，即分类正确时损失函数值为0，分类错误时则为1。假如给\(x\)预测类别为\(c_j\)，即\(f(X)=c_j\)；同时由式子\eqref{eq:obj}可知k邻域的样本点对学习模型的贡献度是均等的，则kNN学习模型误分类率为

\begin{equation}
{1 \over k}\sum\limits_{x_i \in N_k(x)} {I(y_i \ne f(x_i))} = {1 \over k}\sum\limits_{xi \in N_k(x)} {I(y_i \ne c_j)} = 1 - {1 \over k}\sum\limits_{xi \in N_k(x)} {I(y_i = c_j)}
\end{equation}

若要最小化误分类率，则应
\[\mathop {\max }\limits_{{c_j}} \sum\limits_{{x_i} \in {N_k}(x)} I ({y_i} = {c_j})\]

所以，最大表决规则等价于经验风险最小化。

存在问题

k值得选取对kNN学习模型有着很大的影响。若k值过小，预测结果会对噪音样本点显得异常敏感。特别地，当k等于1时，kNN退化成最近邻算法，没有了显式的学习过程。若k值过大，会有较大的邻域训练样本进行预测，可以减小噪音样本点的减少；但是距离较远的训练样本点对预测结果会有贡献，以至于造成预测结果错误。下图给出k值的选取对于预测结果的影响：

前面提到过，k邻域的样本点对预测结果的贡献度是相等的；但距离更近的样本点应有更大的相似度，其贡献度应比距离更远的样本点大。可以加上权值\(w_i = 1/\left\| {x_i - x} \right\|\)进行修正，则最大表决原则变成：
\[\mathop {\max }\limits_{{c_j}} \sum\limits_{{x_i} \in {N_k}(x)} w_i*I ({y_i} = {c_j})\]

3. 参考资料

[1] Michael Steinbach and Pang-Ning Tan, The Top Ten Algorithms in Data Mining.
[2] 李航，《统计学习方法》.

【十大经典数据挖掘算法】kNN的更多相关文章

【十大经典数据挖掘算法】PageRank
[十大经典数据挖掘算法]系列 C4.5 K-Means SVM Apriori EM PageRank AdaBoost kNN Naïve Bayes CART 我特地把PageRank作为[十大经 ...
【十大经典数据挖掘算法】EM
[十大经典数据挖掘算法]系列 C4.5 K-Means SVM Apriori EM PageRank AdaBoost kNN Naïve Bayes CART 1. 极大似然极大似然(Maxim ...
【十大经典数据挖掘算法】AdaBoost
[十大经典数据挖掘算法]系列 C4.5 K-Means SVM Apriori EM PageRank AdaBoost kNN Naïve Bayes CART 1. 集成学习集成学习(ensem ...
【十大经典数据挖掘算法】SVM
[十大经典数据挖掘算法]系列 C4.5 K-Means SVM Apriori EM PageRank AdaBoost kNN Naïve Bayes CART SVM(Support Vector ...
【十大经典数据挖掘算法】Naïve Bayes
[十大经典数据挖掘算法]系列 C4.5 K-Means SVM Apriori EM PageRank AdaBoost kNN Naïve Bayes CART 朴素贝叶斯(Naïve Bayes) ...
【十大经典数据挖掘算法】C4.5
[十大经典数据挖掘算法]系列 C4.5 K-Means SVM Apriori EM PageRank AdaBoost kNN Naïve Bayes CART 1. 决策树模型与学习决策树(de ...
【十大经典数据挖掘算法】k-means
[十大经典数据挖掘算法]系列 C4.5 K-Means SVM Apriori EM PageRank AdaBoost kNN Naïve Bayes CART 1. 引言 k-means与kNN虽 ...
【十大经典数据挖掘算法】Apriori
[十大经典数据挖掘算法]系列 C4.5 K-Means SVM Apriori EM PageRank AdaBoost kNN Naïve Bayes CART 1. 关联分析关联分析是一类非常有 ...
【十大经典数据挖掘算法】CART
[十大经典数据挖掘算法]系列 C4.5 K-Means SVM Apriori EM PageRank AdaBoost kNN Naïve Bayes CART 1. 前言分类与回归树(Class ...

随机推荐

JSP ：运行最简单的 JSP 程序
160916 1. 代码和显示效果 <%@ page contentType="text/html; charset=GB2312" %> <%@ page im ...
Git生成ssh ksy后进行项目管理
1.首先你要有一个git账号,然后在网站上Create a New Repository,填好名称后就建立了一个仓库,之后即会出现一些仓库的配置信息... 2.然后你要下载一个git客户端,也可以是m ...
MVC学习二：基础语法
目录一:重载方法的调用二:数据的传递三:生成控件四:显示加载视图五:强类型视图六:@Response.Write() 和 @Html.Raw()区别七:视图中字符串的输入八:模板页一 ...
ABP理论学习之Swagger UI集成
返回总目录本篇目录介绍安装安装Nuget包配置测试介绍从官方网站上可以看到:"启用了Swagger API,就可以获得交互式文档,生成和发现客户端SDK". 安装 ...
JavaScript的前世今生
和CSS一样,JavaScript在各浏览器下并非完全一致,它所带来的兼容性问题时常困扰着我们,以至于现在“能否处理流行浏览器的兼容性问题”成为了检验一个程序员是否合格的标准之一.了解JavaScri ...
《CLR.via.C#第三版》第二部分第12章节泛型读书笔记(六)
终于讲到泛型了.当初看到这个书名,最想看的就是作者对泛型,委托,反射这些概念的理解.很多人对泛型的理解停留在泛型集合上,刚开始我也是,随着项目越做越多,对待泛型的认识也越来越深刻. 泛型的概念:泛型是 ...
SQL Server 事务日志传输
概述可以使用日志传送将事务日志不间断地从一个数据库(主数据库)发送到另一个数据库(辅助数据库).不间断地备份主数据库中的事务日志,然后将它们复制并还原到辅助数据库,这将使辅助数据库与主数据库基本保持 ...
分析nuget源码，用nuget + nuget.server实现winform程序的自动更新
源起 (个人理解)包管理最开始应该是从java平台下的maven开始吧,因为java的开发大多数是基于开源组件开发的,一个开源包在使用时很可能要去依赖其他的开源包,而且必须是特定的版本才可以.以往在找 ...
Module Zero安装
返回<Module Zero学习目录> 使用模板创建(自动方式) 手动安装核心(领域)层基础设施层展示层这里需要抱歉的是,这里使用的博客园的Markdown语法,代码显示不是很好看 ...
JS实战 · 仿css样式选择器
代码如下: <html> <head> <meta http-equiv="Content-Type" content="text/ ...

【十大经典数据挖掘算法】kNN