k近邻法( k-nearnest neighbor)

基本思想：

给定一个训练数据集，对新的输入实例，在训练数据集中找到与该实例最邻近的k个实例，这k个实例的多数属于某个类，就把该输入实例分为这个类

距离度量：

特征空间中两个实例点的距离是两个实例点相似程度的反映，一般常用欧氏距离，更一般的有行内公式$L_p$或者Minkowski距离

\[L_p(x_i,x_j)=(\sum_{l=1}^{n}|x_i^{(l)}-x_j^{(l)}|^p)^{\frac{1}{p}}
\]

当$p=1$时，为曼哈顿距离，$L_1(x_i,x_j)=\sum_{l=1}^{n}|x_i{(l)}-x_j^{(l)}|$
当$p=2$时，为欧式距离，$L_2(x_i,x_j)=(\sum|x_i^{(l)}-x_j{(l)}|²⁾{\frac{1}{2}}$
当$p=\infty$时，它是各个坐标距离的最大值，$L_\infty(x_i,x_j)=max_l|x_i^{(l)}-x_j{(l)}|$

机器学习实战第二章代码

import numpy as np

def classify0(inx,dataSet,labels,k):

    datasize=dataSet.shape[0]

    diffmat=np.tile(inx,(datasize,1))-dataSet

    sqdismat=diffmat**2

    sqdist=sqdismat.sum(axis=1)

    dist=sqdist**0.5

    sortdistpos=dist.argsort()

    labelscount=np.array([0,0,0,0])

    for i in range(k):

        votelabels=labels[sortdistpos[i]]

        labelscount[votelabels]+=1

    returnresult=labelscount.argsort()

    return returnresult[-1]

def dataload(filename):

    file=open(filename)

    ar=file.readlines()

    num=len(ar)

    returnMat=np.zeros((num,3))

    returnLabels=[]

    index=0

    for line in ar:

        line=line.strip()

        linelist=line.split('\t')

        returnMat[index,:]=linelist[0:3]

        returnLabels.append(int(linelist[-1]))

        index+=1

    return returnMat,returnLabels

def autoNorm(dataSet):

    minvals=dataSet.min(0)

    maxvals=dataSet.max(0)

    ranges=maxvals-minvals

    normDataSet=np.zeros(np.shape(dataSet))

    m=dataSet.shape[0]

    normDataSet=dataSet-np.tile(minvals,(m,1))

    normDataSet=normDataSet/np.tile(ranges,(m,1))

    return normDataSet

DataMat,DataLabels=dataload('datingTestSet2.txt')

normDataMat=autoNorm(DataMat)

ratio=0.1

tep=normDataMat.shape[0]

testnum=int(tep*ratio)

print(tep,testnum)

errorcount=0

for i in range(testnum):

    result=classify0(normDataMat[i,:],normDataMat[testnum:tep,:],DataLabels[testnum:tep],3)

    if(result!=DataLabels[i]):

        errorcount+=1

    print(i," the test result is ",result,",the real result is ",DataLabels[i])

print(errorcount)

print("the error ratio is ",errorcount*1.0/testnum)

k近邻法( k-nearnest neighbor)的更多相关文章

K近邻法（K-Nearest Neighbor，KNN）
KNN是一种基本分类与回归方法,本篇只总结分类问题中的KNN. 输入:样本的特征向量,对应于特征空间中的点输出:样本的类别,可取多类算法思想:给定一个样本类别已知的训练数据集,对于新样本,根据其K ...
学习笔记——k近邻法
对新的输入实例,在训练数据集中找到与该实例最邻近的$k$个实例,这$k$个实例的多数属于某个类,就把该输入实例分给这个类. $k$ 近邻法($k$-nearest neighbor, ...
k近邻法（kNN）
<统计学习方法>(第二版)第3章 3 分类问题中的k近邻法 k近邻法不具有显式的学习过程. 3.1 算法(k近邻法) 根据给定的距离度量,在训练集$T$中找出与$x$最邻近的\(k ...
k近邻法
k近邻法(k nearest neighbor algorithm,k-NN)是机器学习中最基本的分类算法,在训练数据集中找到k个最近邻的实例,类别由这k个近邻中占最多的实例的类别来决定,当k=1时, ...
《统计学习方法（李航）》讲义第03章 k近邻法
k 近邻法(k-nearest neighbor,k-NN) 是一种基本分类与回归方法.本书只讨论分类问题中的k近邻法.k近邻法的输入为实例的特征向量,对应于特征空间的点;输出为实例的类别,可以取多类 ...
K近邻法(KNN)原理小结
K近邻法(k-nearst neighbors,KNN)是一种很基本的机器学习方法了,在我们平常的生活中也会不自主的应用.比如,我们判断一个人的人品,只需要观察他来往最密切的几个人的人品好坏就可以得出 ...
scikit-learn K近邻法类库使用小结
在K近邻法(KNN)原理小结这篇文章,我们讨论了KNN的原理和优缺点,这里我们就从实践出发,对scikit-learn 中KNN相关的类库使用做一个小结.主要关注于类库调参时的一个经验总结. 1. s ...
机器学习PR：k近邻法分类
k近邻法是一种基本分类与回归方法.本章只讨论k近邻分类,回归方法将在随后专题中进行. 它可以进行多类分类,分类时根据在样本集合中其k个最近邻点的类别,通过多数表决等方式进行预测,因此不具有显式的学习过 ...
统计学习方法（三）——K近邻法
/*先把标题给写了.这样就能经常提醒自己*/ 1. k近邻算法 k临近算法的过程,即对一个新的样本,找到特征空间中与其最近的k个样本,这k个样本多数属于某个类,就把这个新的样本也归为这个类. 算法 ...
机器学习中 K近邻法(knn)与k-means的区别
简介 K近邻法(knn)是一种基本的分类与回归方法.k-means是一种简单而有效的聚类方法.虽然两者用途不同.解决的问题不同,但是在算法上有很多相似性,于是将二者放在一起,这样能够更好地对比二者的异 ...

随机推荐

[BZOJ1026]windy数
Description windy定义了一种windy数.不含前导零且相邻两个数字之差至少为2的正整数被称为windy数. windy想知道,在A和B之间,包括A和B,总共有多少个windy数? In ...
idea 2017 常用图标
LeetCode——remove-duplicates-from-sorted-list-ii
Question Given a sorted linked list, delete all nodes that have duplicate numbers, leaving only dist ...
Mysql事物的4种隔离级别
SQL标准定义了4种隔离级别,包括了一些具体规则,用来限定事务内外的哪些改变是可见的,哪些是不可见的. 低级别的隔离级一般支持更高的并发处理,并拥有更低的系统开销. 首先,我们使用 test 数据库, ...
angular js实现开关效果
功能:实现点击排序,再点击排倒序. 实现方法如下方法一:定义变量实现点击切换true或false,代码为: $scope.lidata = [ {"name ...
Mysql修改表结构详解
添加字段: alter table `user_movement_log`Add column GatewayId int not null default 0 AFTER `Regionid` (在 ...
HDU 4739 Zhuge Liang's Mines (状态压缩+背包DP)
题意给定平面直角坐标系内的N(N <= 20)个点,每四个点构成一个正方形可以消去,问最多可以消去几个点. 思路比赛的时候暴力dfs+O(n^4)枚举写过了--无意间看到有题解用状压DP(这 ...
CodeForces 297C Splitting the Uniqueness (脑补构造题)
题意 Split a unique array into two almost unique arrays. unique arrays指数组各个数均不相同,almost unique arrays指 ...
grub2 windows版安装
一.BIOS方式,grub2安装查看磁盘情况 E:\grub-2.02-for-windows>wmic diskdrive list brief Caption DeviceID Model ...
虚拟机VirtualBox及轻量级的CentOS
1,先下载虚拟机VirtualBox和centos(下边有链接),将VirtualBox安装在本机 2,管理 --> 导入虚拟电脑 --> 选择本地centos文件 3,点击下一步 - ...