K-近邻算法入门

　　K-近邻算法的直观理解就是：给定一个训练集合，对于新的实例，在训练集合中找到k个与该实例最近的邻居，然后根据“少数服从多数”原则判断该实例归属于哪一类，又称“随大流”

K-近邻算法的三大要素：K值得选取，邻居距离度量，分类决策的制定。

（1）K值选取：通常采用交叉验证选取最优的K值（自己了解）

（2）邻居距离度量：根据不同的应用场景选取相应的距离度量。常见的距离度量有欧几里得距离、曼哈顿距离、马氏距离。同时要注意的是归一化机制。

（3）分类决策制定：一般分为平等投票表决原则和加权投票原则。

import operator

import csv

import math

import random

def loadDataSet(filename,split,trainingSet=[],testSet=[]):

    #读取本地数据#

    with open(filename,'r') as csvfile:

        lines=csv.reader(csvfile)

        dataset=list(lines)

        for x in range(len(dataset)-1):

            for y in range (4):

                dataset[x][y]=float(dataset[x][y])

            if random.random()<split:

                trainingSet.append(dataset[x])

            else:

                testSet.append(dataset[x])

def EuclidDist(instance1,instance2,len):

    #求欧几里得距离#

    distance=0.0

    for x in range(len):

        distance+=pow((instance1[x]-instance2[x]),2)

    return math.sqrt(distance)

def getNeighbors(trainSet,testInstance,k):

    #获取最近邻居#

    distance=[]

    length=len(testInstance)-1

    for x in range(len(trainSet)):

        dist=EuclidDist(testInstance,trainSet[x],length)

        distance.append((trainSet[x],dist))

    distance.sort(key=operator.itemgetter(1))

    #列表的sort（key）方法用来根据关键字排序

    neighbors=[]

    for x in range(k):

        neighbors.append(distance[x][0])

    return neighbors

def getClass(neighbors):

    #分类与评估函数#

     classVotes={}

     for x in range(len(neighbors)):

         instance_class=neighbors[x][-1]

         if instance_class in classVotes:

             classVotes[instance_class]+=1

         else:

             classVotes[instance_class]=1

         sortedVotes=sorted(classVotes.items(),key=operator.itemgetter(1),reverse=True)

     return sortedVotes[0][0]

def getAccuracy(testSet,predictions):

    #预测正确率计算#

    correct=0

    for x in range(len(testSet)):

        if testSet[x][-1]==predictions[x]:

            correct+=1

    return (correct/float(len(testSet)))*100.0

def main():

    trainingSet=[]

    testSet=[]

    split=0.7

    loadDataSet('iris.data.csv',split,trainingSet,testSet)

    print('训练集合：'+repr(len(trainingSet)))

    print('测试集合：'+repr(len(testSet)))

    predictions=[]

    k=3

    for x in range(len(testSet)):

        neighbors=getNeighbors(trainingSet,testSet[x],k)

        result=getClass(neighbors)

        predictions.append(result)

        print('>预测='+repr(result)+',实际='+repr(testSet[x][-1]))

    accuracy=getAccuracy(testSet,predictions)

    print('精确度为：'+repr(accuracy)+'%')

main()

针对此代码中的数据来源为UCI机器学习库中的鸢尾花卉数据集，可以直接获取（https://archive.ics.uci.edu/ml/machine-learning-databases/iris/iris.data），也可以下载我转换好的CSV文件（链接：https://pan.baidu.com/s/1YSLhrPMn3RflGE8VDGGbHQ 提取码：42se ）

本次范例属于“自己动手丰衣足食”，每个函数都自己实现，可以在入门阶段对K-近邻算法流程有个初步认识，在有了一定基础之后，我们就没有必要重造轮子，可以使用常见的机器学习算法，毕竟其专业性远远目前超过我们自己的程序。例如scikit-learn模块。

K-近邻算法入门的更多相关文章

数据挖掘入门系列教程（三）之scikit-learn框架基本使用（以K近邻算法为例）
数据挖掘入门系列教程(三)之scikit-learn框架基本使用(以K近邻算法为例) 简介 scikit-learn 估计器加载数据集进行fit训练设置参数预处理流水线结尾数据挖掘入门系 ...
Python3入门机器学习 - k近邻算法
邻近算法,或者说K最近邻(kNN,k-NearestNeighbor)分类算法是数据挖掘分类技术中最简单的方法之一.所谓K最近邻,就是k个最近的邻居的意思,说的是每个样本都可以用它最接近的k个邻居来代 ...
算法入门系列2：k近邻算法
用官方的话来说,所谓K近邻算法(k-Nearest Neighbor,KNN),即是给定一个训练数据集,对新的输入实例,在训练数据集中找到与该实例最邻近的K个实例(也就是上面所说的K个邻居), 这K个 ...
第四十六篇入门机器学习——kNN - k近邻算法（k-Nearest Neighbors）
No.1. k-近邻算法的特点 No.2. 准备工作,导入类库,准备测试数据 No.3. 构建训练集 No.4. 简单查看一下训练数据集大概是什么样子,借助散点图 No.5. kNN算法的目的是,假如 ...
基本分类方法——KNN(K近邻)算法
在这篇文章 http://www.cnblogs.com/charlesblc/p/6193867.html 讲SVM的过程中,提到了KNN算法.有点熟悉,上网一查,居然就是K近邻算法,机器学习的入门 ...
K近邻算法：机器学习萌新必学算法
摘要:K近邻(k-NearestNeighbor,K-NN)算法是一个有监督的机器学习算法,也被称为K-NN算法,由Cover和Hart于1968年提出,可以用于解决分类问题和回归问题. 1. 为什么 ...
机器学习实战笔记--k近邻算法
#encoding:utf-8 from numpy import * import operator import matplotlib import matplotlib.pyplot as pl ...
k近邻算法的Java实现
k近邻算法是机器学习算法中最简单的算法之一,工作原理是:存在一个样本数据集合,即训练样本集,并且样本集中的每个数据都存在标签,即我们知道样本集中每一数据和所属分类的对应关系.输入没有标签的新数据之后, ...
从K近邻算法谈到KD树、SIFT+BBF算法
转自 http://blog.csdn.net/v_july_v/article/details/8203674 ,感谢july的辛勤劳动前言前两日,在微博上说:“到今天为止,我至少亏欠了3篇文章 ...
机器学习之K近邻算法（KNN）
机器学习之K近邻算法(KNN) 标签: python 算法 KNN 机械学习苛求真理的欲望让我想要了解算法的本质,于是我开始了机械学习的算法之旅 from numpy import * import ...

随机推荐

C#泛型约束（转载）
六种类型的约束: T:结构类型参数必须是值类型.可以指定除 Nullable 以外的任何值类型.有关更多信息,请参见使用可空类型(C# 编程指南). T:类类型参数必须是引用类型,包括任何类.接口 ...
Spring 事务传播行为的使用
...
Unity 游戏框架搭建 2018 (一) 架构、框架与 QFramework 简介
约定还记得上版本的第二十四篇的约定嘛?现在出来履行啦~ 为什么要重制? 之前写的专栏都是按照心情写的,在最初的时候笔者什么都不懂,而且文章的发布是按照很随性的一个顺序.结果就是说,大家都看完了,都还 ...
彻底弄懂JS原型与继承
本文由浅到深,循序渐进的将原型与继承的抽象概念形象化,且每个知识点都搭配相应的例子,尽可能的将其通俗化,而且本文最大的优点就是:长(为了更详细嘛). 一.原型首先,我们先说说原型,但说到原型就得从函 ...
ora.ctssd OBSERVER
[grid@ydb1 ~]$ crsctl status res -t -init ora.ctssd 1 ONLINE ONLINE ydb1 ...
paxos协议(1)-朴素paxos
前言学习paxos协议,最困惑我的两点是: 1. 朴素paxos是怎么样的?这部分主要是原理: 2. paxos协议是怎么运用到分布式系统解决问题的.因为很多博客的开篇说paxos协议可以运用在很多 ...
IO流C++
1.iostream处理控制台IO #include<iostream> #include<string> using namespace std; istream& ...
在软件webstorm中给img标签加入class报错显示错误selector matches unknow element
如题,怎么也搞不懂,在其他软件没出过这种问题,偏偏在webstorm中,显示class选择器未匹配到元素:哪位大神知道怎么解决这个问题.
[译]C语言实现一个简易的Hash table(6)
上一章中,我们实现了Hash表中的插入.搜索和删除接口,我们在初始化hash表时固定了大小为53,为了方便扩展,本章将介绍如何修改hash表的大小. 设置Hash表大小现在,我们的hash表是固定大 ...
BigData：值得了解的十大数据发展趋势
当今,世界无时无刻不在发生着变化.对于技术领域而言,普遍存在的一个巨大变化就是为大数据(Big data)打开了大门,并应用大数据技相关技术来改善各行业的业务并促进经济的发展.目前,大数据的作用已经上 ...

K-近邻算法入门

K-近邻算法入门的更多相关文章

随机推荐

热门专题