K-近邻算法的Python实现：源代码分析

网上介绍K-近邻算法的样例非常多。其Python实现版本号基本都是来自于机器学习的入门书籍《机器学习实战》，尽管K-近邻算法本身非常easy，但非常多刚開始学习的人对其Python版本号的源码理解不够，所以本文将对其源码进行分析。

什么是K-近邻算法？

简单的说，K-近邻算法採用不同特征值之间的距离方法进行分类。所以它是一个分类算法。

长处：无数据输入假定，对异常值不敏感

缺点：复杂度高

好了，直接先上代码，等会在分析：（这份代码来自《机器学习实战》）

def classify0(inx, dataset, lables, k):

    dataSetSize = dataset.shape[0]

    diffMat = tile(inx, (dataSetSize, 1)) - dataset

    sqDiffMat = diffMat**2

    sqDistance = sqDiffMat.sum(axis=1)

    distances = sqDistance**0.5

    sortedDistances = distances.argsort()

    classCount={}

    for i in range(k):

        label = lables[sortedDistances[i]]

        classCount[label] = classCount.get(label, 0) + 1

    sortedClassCount = sorted(classCount.iteritems(),key=operator.itemgetter(1), reverse=True)

    return sortedClassCount[0][0]

该函数的原理是：

存在一个样本数据集合，也称为训练集，在样本集中每一个数据都存在标签。在我们输入没有标签的新数据后，将新数据的每一个特征与样本集中相应的特征进行比較，然后提取最相似（近期邻）的分类标签。

一般我们仅仅选样本数据集中前K 个最相似的数据。最后。出现次数最多的分类就是新数据的分类。

classify0函数的參数意义例如以下：

inx : 是输入没有标签的新数据，表示为一个向量。

dataset: 是样本集。

表示为向量数组。

labels:相应样本集的标签。

k：即所选的前K。

用于产生数据样本的简单函数：

def create_dataset():

    group = array([[1.0, 1.1], [1.0, 1.1], [0, 0], [0, 0.1]])

    labels = ['A', 'A', 'B', 'B']

    return group, labels

注意，array是numpy里面的。

我们须要实现import进来。

from numpy import *

import operator

我们在调用时。

group,labels = create_dataset()

result = classify0([0,0], group, labels, 3)

print result

显然，[0,0]特征向量肯定是属于B 的，上面也将打印B。

知道了这些。刚開始学习的人应该对实际代码还是非常陌生。不急，正文開始了！

源代码分析

dataSetSize = dataset.shape[0]

shape是array的属性，它描写叙述了一个数组的“形状”，也就是它的维度。比方，

In [2]: dataset = array([[1.0, 1.1], [1.0, 1.1], [0, 0], [0, 0.1]])

In [3]: print dataset.shape

(4, 2)

所以，dataset.shape[0] 就是样本集的个数。

diffMat = tile(inx, (dataSetSize, 1)) - dataset

tile(A,rep)函数是基于数组A来构造数组的，详细怎么构造就看第二个參数了。其API介绍有点绕，但简单的使用方法相信几个样例就能明确。

我们看看tile(inx, (4, 1))的结果，

In [5]: tile(x, (4, 1))

Out[5]:

array([[0, 0],

       [0, 0],

       [0, 0],

       [0, 0]])

你看。4扩展的是数组的个数（本来1个。如今4个），1扩展的是每一个数组元素的个数（原来是2个，如今还是两个）。

为证实上面的结论，

In [6]: tile(x,(4,2))

Out[6]:

array([[0, 0, 0, 0],

       [0, 0, 0, 0],

       [0, 0, 0, 0],

       [0, 0, 0, 0]])

和。

In [7]: tile(x,(2,2))

Out[7]:

array([[0, 0, 0, 0],

       [0, 0, 0, 0]])

关于，tile的详细使用方法。请自行查阅API DOC。

得到tile后，减去dataset。

这类似一个矩阵的减法。结果仍是一个 4 * 2的数组。

In [8]: tile(x, (4, 1)) - dataset

Out[8]:

array([[-1. , -1.1],

       [-1. , -1.1],

       [ 0. ,  0. ],

       [ 0. , -0.1]])

结合欧式距离的求法，后面的代码就清晰些，对上面结果平方运算，求和。开方。

我们看看求和的方法，

sqDiffMat.sum(axis=1)

当中。

In [14]: sqDiffmat

Out[14]:

array([[ 1.  ,  1.21],

       [ 1.  ,  1.21],

       [ 0.  ,  0.  ],

       [ 0.  ,  0.01]])

求和的结果是对行求和，是一个N*1的数组。

假设要对列求和，

sqlDiffMat.sum(axis=0)

argsort()是对数组升序排序的。

classCount是一个字典，key是标签。value是该标签出现的次数。

这样。算法的一些详细代码细节就清楚了。

K-近邻算法的Python实现：源代码分析的更多相关文章

用Python从零开始实现K近邻算法
KNN算法的定义: KNN通过测量不同样本的特征值之间的距离进行分类.它的思路是:如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别.K通 ...
python 机器学习（二）分类算法-k近邻算法
一.什么是K近邻算法? 定义: 如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别. 来源: KNN算法最早是由Cover和Hart提 ...
机器学习——KNN算法（k近邻算法）
一 KNN算法 1. KNN算法简介 KNN(K-Nearest Neighbor)工作原理:存在一个样本数据集合,也称为训练样本集,并且样本集中每个数据都存在标签,即我们知道样本集中每一数据与所属分 ...
机器学习实战 - python3 学习笔记（一） - k近邻算法
一. 使用k近邻算法改进约会网站的配对效果 k-近邻算法的一般流程: 收集数据:可以使用爬虫进行数据的收集,也可以使用第三方提供的免费或收费的数据.一般来讲,数据放在txt文本文件中,按照一定的格式进 ...
数据挖掘算法（一）--K近邻算法（KNN）
数据挖掘算法学习笔记汇总数据挖掘算法(一)–K近邻算法 (KNN) 数据挖掘算法(二)–决策树数据挖掘算法(三)–logistic回归算法简介 KNN算法的训练样本是多维特征空间向量,其中每个训 ...
使用K近邻算法改进约会网站的配对效果
1 定义数据集导入函数 import numpy as np """ 函数说明:打开并解析文件,对数据进行分类:1 代表不喜欢,2 代表魅力一般,3 代表极具魅力 Par ...
02机器学习实战之K近邻算法
第2章 k-近邻算法 KNN 概述 k-近邻(kNN, k-NearestNeighbor)算法是一种基本分类与回归方法,我们这里只讨论分类问题中的 k-近邻算法. 一句话总结:近朱者赤近墨者黑! k ...
2.在约会网站上使用k近邻算法
在约会网站上使用k近邻算法思路步骤: 1. 收集数据:提供文本文件.2. 准备数据:使用Python解析文本文件.3. 分析数据:使用Matplotlib画二维扩散图.4. 训练算法:此步骤不适用于 ...
机器学习实战笔记--k近邻算法
#encoding:utf-8 from numpy import * import operator import matplotlib import matplotlib.pyplot as pl ...
从K近邻算法谈到KD树、SIFT+BBF算法
转自 http://blog.csdn.net/v_july_v/article/details/8203674 ,感谢july的辛勤劳动前言前两日,在微博上说:“到今天为止,我至少亏欠了3篇文章 ...

随机推荐

[01]关于TDD、BDD和DDD的一些看法
在实际的项目中,我们可能随时面对各种不同的需求,它的各个方面的要素决定了我们所采用的开发模式. 比如,它的复杂度如何?所有的需求是否足够清晰?开发人员对相关的业务是否足够了解?项目的工期是否合理?种种 ...
Mysql性能优化【转】
mysql的性能优化无法一蹴而就,必须一步一步慢慢来,从各个方面进行优化,最终性能就会有大的提升. Mysql数据库的优化技术对mysql优化是一个综合性的技术,主要包括表的设计合理化(符合3NF ...
寻找道路（NOIP2014）神奇之题。。
原题传送门这道题嘛.. 首先根据题目,我们要先知道哪些点能够到达终点.(反向BFS) 然后我们再求最短路的途中,必须随时判断周围的点是否被第一次BFS标记过.. 所以再来一次BFS. 数组记得清零, ...
error MSB3073 解决方法（转）
原文转自 http://blog.csdn.net/yangjie569889321/article/details/28488151 最近将VC2002 代码移植到VC2010,出现编译错误:1&g ...
shell编程学习笔记【原创】
本文为本人学习笔记,如有转载请注明出处,谢谢一.Bourne Shell 有如下四种变量: 用户自定义变量位置变量,即命令行参数预定义变量环境变量二.位置变量 $ 与键入的命令行一样,包含脚 ...
SQL 数据库函数
字符串函数 lower(字符串表达式) | select lower('ABCDEF')返回 abcdef | 返回大写字符数据转换为小写的字符表达式. upper(字符串表达式) | select ...
Python的扩展接口[2] -> 动态链接库DLL[0] -> 动态链接库及辅助工具
动态链接库 / Dynamic Link Library 目录动态链接库简介函数封装DLL 组件对象模型COM 如何判断.dll文件是COM还是DLL 辅助工具 1 动态链接库简介 / DLL I ...
MySql笔记之修改数据库编码
修改前(系统默认编码) 查看编码命令: show variables like '%char%'; show variables like 'character%'; 两种方法 a) 暂时性修改 SE ...
bzoj2440（莫比乌斯函数）
bzoj2440 题意求第 k 个不是完全平方数(除 1 以外)的正倍数的数. 分析利用二分法求解,二分 x ,判断 x 是否是第 k 个数即可,那么我们就要计算 [1, x] 有几个符合条件的数 ...
Spoj SUBST1 New Distinct Substrings
Given a string, we need to find the total number of its distinct substrings. Input T- number of test ...

K-近邻算法的Python实现 ： 源代码分析

K-近邻算法的Python实现 ： 源代码分析的更多相关文章

随机推荐

热门专题

K-近邻算法的Python实现：源代码分析

K-近邻算法的Python实现：源代码分析的更多相关文章