1、KNN

简介：knn算法是监督学习中分类方法的一种。它又被叫k近邻算法，是一个概念极其简单而分类效果又很优秀的分类算法。

核心思想：在训练集中选出离输入的数据最近的k个数据，根据这k个数据的类别判断输入数据的类别，k个数据的类别判断方法可以是k个中出现次数最多的类别，也可以根据距离计算权重，再选出权重最大的类别，等等。

准确率的制约：k值的大小和判断类别的方法

2、数据源

分别给出两类由正太分布随机的200个点，并将两类一前一后合并，最后以矩阵的形式存放入dataset；

x1 = numpy.round(numpy.random.normal(115, 10, 100),2)

y1 = numpy.round(numpy.random.normal(95, 6,100),2)

x2 = numpy.round(numpy.random.normal(70, 10, 100),2)

y2 = numpy.round(numpy.random.normal(99, 6, 100),2)

a=[]

b=[]

for i in range(100):

                  a.append([x1[i],y1[i]])

for i in range(100):

                  b.append([x2[i],y2[i]])

c=a+b

dataset=array(c)

给出两类正太分布数据分别分成'*'和'o'两类，以列表形式存放入labels；

labels=[]

for i in range(100):

                  labels.append('*')

for i in range(100):

                  labels.append('o')

小编自定义两个待分类的数据，也以矩阵的形式存放入；

x=[82,94]

x=array(x)

y=[90,100]

y=array(y)

3、实现过程

*以完整代码展示算法实现

# -*- coding:utf-8 -*-

import numpy

from numpy import *

import random

import pylab as pl

import operator

pl.figure(1)

pl.figure(2)

#计算样本的距离，预测类别

def classify(testdata,traindata,labels,k):

     #testdate:待分类数集；traindate:分好类的数集；

     #tile(a,(b,c)):将a的内容在行上复制b遍，列上复制c遍

     trasize=traindata.shape[0]  #得到其维数

     tradis1=tile(testdata,(trasize,1))-traindata

     tradis2=tradis1**2

     tradis3=tradis2.sum(axis=1)

     tradis=tradis3**0.5 #计算样本与训练数据的距离

     sortdis=tradis.argsort()#排序

     classcount={}#建立空字典

     for i in range(k):#通过循环寻找k个近邻

                  votelabel=labels[sortdis[i]]

                  classcount[votelabel]=classcount.get(votelabel,0)+1

     sortedclasscount=sorted(classcount.items(),key=operator.itemgetter(1),reverse=True)

     return sortedclasscount[0][0]#返回占最大比例的类别

x1 = numpy.round(numpy.random.normal(115, 10, 100),2)

y1 = numpy.round(numpy.random.normal(95, 6,100),2)

x2 = numpy.round(numpy.random.normal(70, 10, 100),2)

y2 = numpy.round(numpy.random.normal(99, 6, 100),2)

a=[]

b=[]

for i in range(100):

                  a.append([x1[i],y1[i]])

for i in range(100):

                  b.append([x2[i],y2[i]])

c=a+b

dataset=array(c)   #将列表转化为矩阵

labels=[]

for i in range(100):

                  labels.append('*')

for i in range(100):

                  labels.append('o')

x=[82,94]

x=array(x)

y=[90,100]

y=array(y)

k=10

labelX=classify(x,dataset,labels,k)

labelY=classify(y,dataset,labels,k)

pl.figure(1)

pl.plot(x1,y1,'*')

pl.plot(x2,y2,'o')

pl.plot(82,94,'.')

pl.plot(96,100,'.')

pl.xlabel('X')

pl.ylabel('Y')

pl.figure(2)

pl.plot(x1,y1,'*')

pl.plot(x2,y2,'o')

pl.plot(82,94,labelX)

pl.plot(96,100,labelY)

pl.show()

4、实现结果

未分类钱前的图像如下，一类正态分布的点用星表示，另一类用圆表示，待分类的两点用点表示；

分类后的图像如下，两点归类看其形状改变；

5、写代码后的心得

引入的数据一定要看清其类别，在这里就要注意列表与矩阵的转化；
append([x1[i],y1[i]])括号里又加中括号是因为append一次只能添入一个元素
将列表转化为矩阵用array
矩阵的平方是将矩阵内每个元素平方，与线性代数不同

python机器学习（2：KNN算法）的更多相关文章

使用python模拟实现KNN算法
一.KNN简介 1.KNN算法也称为K邻近算法,是数据挖掘分类技术之一.所谓K最近邻,就是k个最近的邻居的意思,说的是每个样本都可以用它最接近的k个邻居来代表. 2.KNN算法的核心思想是如果一个样本 ...
菜鸟之路——机器学习之KNN算法个人理解及Python实现
KNN(K Nearest Neighbor) 还是先记几个关键公式距离:一般用Euclidean distance E(x,y)√∑(xi-yi)2 .名字这么高大上,就是初中学的两点间的距离 ...
机器学习之KNN算法
1 KNN算法 1.1 KNN算法简介 KNN(K-Nearest Neighbor)工作原理:存在一个样本数据集合,也称为训练样本集,并且样本集中每个数据都存在标签,即我们知道样本集中每一数据与所属 ...
机器学习：k-NN算法（也叫k近邻算法）
一.kNN算法基础 # kNN:k-Nearest Neighboors # 多用于解决分裂问题 1)特点: 是机器学习中唯一一个不需要训练过程的算法,可以别认为是没有模型的算法,也可以认为训练数据集 ...
python机器学习的常用算法
Python机器学习学习意味着通过学习或经验获得知识或技能.基于此,我们可以定义机器学习(ML)如下 - 它可以被定义为计算机科学领域,更具体地说是人工智能的应用,其为计算机系统提供了学习数据和从经 ...
机器学习笔记--KNN算法2-实战部分
本文申明:本系列的所有实验数据都是来自[美]Peter Harrington 写的<Machine Learning in Action>这本书,侵删. 一案例导入:玛利亚小姐最近寂寞了, ...
Python简单实现KNN算法
__author__ = '糖衣豆豆' from numpy import * from os import listdir import operator #从列方向扩展 #tile(a,(size ...
JavaScript机器学习之KNN算法
译者按: 机器学习原来很简单啊,不妨动手试试! 原文: Machine Learning with JavaScript : Part 2 译者: Fundebug 为了保证可读性,本文采用意译而非直 ...
机器学习笔记--KNN算法1
前言 Hello ,everyone. 我是小花.大四毕业,留在学校有点事情,就在这里和大家吹吹我们的狐朋狗友算法---KNN算法,为什么叫狐朋狗友算法呢,在这里我先卖个关子,且听我慢慢道来. 一 K ...
机器学习入门-Knn算法
knn算法不需要进行训练, 耗时,适用于多标签分类情况 1. 将输入的单个测试数据与每一个训练数据依据特征做一个欧式距离. 2. 将求得的欧式距离进行降序排序,取前n_个 3. 计算这前n_个的y值的 ...

随机推荐

{转} MJPG流媒体在HTML5的呈现方案
最近碰到的需求:监控探头视频呈现到html页面上. 视频源协议:HLS; 视频源格式:Motion JPEG 简称 MJPG; 其中Motion JPEG(M-JPEG或MJPEG,Motion Jo ...
nfs自动挂载
服务器端 /etc/exports /mnt *(rw,sync,no_root_squash,anonuid=500,anongid=500)systemctl restart nfs 客户端挂载 ...
寒假day14
今天去医院看脸了,回来继续写论文.
同行评审|keywords
审稿流程: 初审直接被拒,editor开组会讨论的结果论文水平低不符合刊物宗旨和要求同行评审: 单盲评审双盲评审:限制审稿人倾向公开评审PNAS Analyse search result ...
移动端— Touch事件轮播图
虽然以前也写过手机端页面 .当时用的jquery moblie 框架.啥也不懂就知道复制粘贴出效果不敢改内部样式.现在呢了解手机端原理一些基本的概念视口缩放后 .再去想以前写的页面 ...
Java中常用的API（一）——Object
概述如果要问Java为什么是用起来非常舒服的语言,那很大一部分的功劳就是JavaAPI的.API定义了许多封装好的类和方法供我们使用,来处理特定的问题,所以学习常用的API是非常重要的. 同时,面向 ...
neo4jcypher基本语句
create (:患者)-[rl:likes]-> (dept:Dept ) ///////////////关系 (STARTNODE)MATCH (video1:YoutubeVideo1)- ...
NodeJS框架一览
NodeJS 框架一览 Express 当你使用Node.js构建web应用程序时, Express通常被视为事实上的Web服务器.它的哲学(一个可以使用中间件包扩展的简约核心)是大多数Node.js ...
同步nginx日志到s3 bulket
1.此处用的是增量同步 #!/bin/bash rm -rf /var/log/nginx/access.log.*.* local_host="`hostname --i`" a ...
openvino资源
Intel OpenVINO介紹及樹莓派.Linux的安裝 https://chtseng.wordpress.com/2019/01/21/intel-openvino%E4%BB%8B%E7%B4 ...

python机器学习（2：KNN算法）

1、KNN

python机器学习（2：KNN算法）的更多相关文章

随机推荐

热门专题