K-临近算法(KNN)

K nearest neighbour

1、k-近邻算法原理

简单地说，K-近邻算法采用测量不同特征值之间的距离方法进行分类。

优点：精度高、对异常值不敏感、无数据输入假定。
缺点：时间复杂度高、空间复杂度高。
适用数据范围：数值型和标称型。

工作原理

存在一个样本数据集合，也称作训练样本集，并且样本集中每个数据都存在标签，即我们知道样本集中每一数据与所属分类的对应关系。输人没有标签的新数据后，将新数据的每个特征与样本集中数据对应的特征进行比较，然后算法提取样本集中特征最相似数据（最近邻）的分类标签。一般来说，我们只选择样本数据集中前K个最相似的数据，这就是K-近邻算法中K的出处,通常K是不大于20的整数。最后，选择K个最相似数据中出现次数最多的分类，作为新数据的分类。

欧几里得距离(Euclidean Distance)

欧氏距离是最常见的距离度量，衡量的是多维空间中各个点之间的绝对距离。公式如下：

2、在scikit-learn库中使用k-近邻算法

分类问题：from sklearn.neighbors import KNeighborsClassifier
回归问题：from sklearn.neighbors import KNeighborsRegressor

1）用于分类(用鸢尾花作为示例)

导包，机器学习的算法KNN、数据鸢尾花

# scikit-learning 提供数据样本，可以供我们研究机器学习模型

# 可以使用load方法加载datasets中的各种数据

from sklearn import datasets

import matplotlib.pyplot as plt

iris = datasets.load_iris()  # load是获取本地的数据集 iris就是鸢尾花数据集

data = iris.data  # 特征值

target = iris.target  # 目标值

target_names = iris.target_names  # 目标的名字

feature_names = iris.feature_names  # 特征的名字

df = DataFrame(data,columns=feature_names)

df.plot()

画图研究前两个特征和分类之间的关系（二维散点图只能展示两个维度）

# 取出 前两个特征 特征0 作为横轴 特征1作为纵轴

X_train = data[:,:2]

y_train = target

plt.scatter(X_train[:,0],X_train[:,1],c=target)  # 特征0作为点的横坐标 特征1作为点的纵坐标 target值作为点的颜色映射

plt.xlabel(feature_names[0])

plt.ylabel(feature_names[1])

定义KNN分类器

真正判断分类的时候肯定是用所有的4个特征效果更好
这里只用两个特征来判断分类也可以但是效果肯定不如4个的好
这里之所以用两个是为了画图给大家展示效果

# 获取模型

from sklearn.neighbors import KNeighborsClassifier

# 使用两个特征来训练模型

# n_neighbors可以自己根据经验给定 一般给的是奇数（偶数容易造成 两种分类一样多的情况）

knn = KNeighborsClassifier(n_neighbors=7)

第一步，训练数据

knn.fit(X_train,y_train)

第二步预测数据：所预测的数据，自己创造，就是上面所显示图片的背景点

生成预测数据

# 要 取遍 平面 上 所有点

# 首先 x的范围内要取遍 y的范围内也要取遍

x = np.arange(X_train[:,0].min()-0.5,X_train[:,0].max()+0.5,0.02)  # 取遍x轴

y = np.arange(X_train[:,1].min()-0.5,X_train[:,1].max()+0.5,0.02)  # 取遍y轴

# 交叉 取遍 整个平面

X,Y = np.meshgrid(x,y)  # 返回两个 ndarray 第一个是 平面上所有点的x座标 第二个是平面上所有点的y座标

# c_函数 可以使行 变列 （我们使用这个函数 就可以 把X,Y里面的值 组合成座标点）

X_test = np.c_[X.flatten(),Y.flatten()]  # 使用reshape去变形也可以

plt.scatter(X_test[:,0],X_test[:,1])# 查看是否确定是取遍平面中的所有点

# 模型预测出来的结果 一般叫y_

y_ = knn.predict(X_test)

y_

以图形化的效果展示结果

plt.scatter(X_test[:,0],X_test[:,1],c=y_)

from matplotlib.colors import ListedColormap

# ListedColormap([])  # 创建颜色映射对象

cm1 = ListedColormap(

['#FFAAAA','#AAFFAA','#AAAAFF']

)

cm2 = ListedColormap(

['#FF0000','#00FF00','#0000FF']

)

plt.scatter(X_test[:,0],X_test[:,1],c=y_,cmap=cm1)  # c是color 会根据 传入的不同数值 去填充不同的颜色

plt.scatter(X_train[:,0],X_train[:,1],c=target,cmap=cm2)

plt.xlabel(feature_names[0])

plt.ylabel(feature_names[1])

plt.title('很棒的分类图',fontproperties='KaiTi',fontsize=45,color='r')

K-临近算法(KNN)的更多相关文章

秒懂机器学习---k临近算法（KNN）
秒懂机器学习---k临近算法(KNN) 一.总结一句话总结: 弄懂原理,然后要运行实例,然后多解决问题,然后想出优化,分析优缺点,才算真的懂 1.KNN(K-Nearest Neighbor)算法的 ...
[Machine-Learning] K临近算法-简单例子
k-临近算法算法步骤 k 临近算法的伪代码,对位置类别属性的数据集中的每个点依次执行以下操作: 计算已知类别数据集中的每个点与当前点之间的距离: 按照距离递增次序排序: 选取与当前点距离最小的k个点 ...
机器学习（Machine Learning）算法总结-K临近算法
一.算法详解 1.什么是K临近算法 Cover 和 Hart在1968年提出了最初的临近算法属于分类(classification)算法邻近算法,或者说K最近邻(kNN,k-NearestNeig ...
K临近算法
K临近算法原理 K临近算法(K-Nearest Neighbor, KNN)是最简单的监督学习分类算法之一.(有之一吗?) 对于一个应用样本点,K临近算法寻找距它最近的k个训练样本点即K个Neares ...
k近邻算法(KNN)
k近邻算法(KNN) 定义:如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别. from sklearn.model_selection ...
k邻近算法(KNN)实例
一 k近邻算法原理 k近邻算法是一种基本分类和回归方法. 原理:K近邻算法,即是给定一个训练数据集,对新的输入实例,在训练数据集中找到与该实例最邻近的K个实例,这K个实例的多数属于某个类,就把该输入实 ...
<机器学习实战>读书笔记--k邻近算法KNN
k邻近算法的伪代码: 对未知类别属性的数据集中的每个点一次执行以下操作: (1)计算已知类别数据集中的点与当前点之间的距离: (2)按照距离递增次序排列 (3)选取与当前点距离最小的k个点 (4)确定 ...
机器学习(四) 分类算法--K近邻算法 KNN (上)
一.K近邻算法基础 KNN------- K近邻算法--------K-Nearest Neighbors 思想极度简单应用数学知识少 (近乎为零) 效果好(缺点?) 可以解释机器学习算法使用过程中 ...
一看就懂的K近邻算法(KNN)，K-D树，并实现手写数字识别！
1. 什么是KNN 1.1 KNN的通俗解释何谓K近邻算法,即K-Nearest Neighbor algorithm,简称KNN算法,单从名字来猜想,可以简单粗暴的认为是:K个最近的邻居,当K=1 ...
机器学习(四) 机器学习(四) 分类算法--K近邻算法 KNN (下)
六.网格搜索与 K 邻近算法中更多的超参数七.数据归一化 Feature Scaling 解决方案:将所有的数据映射到同一尺度八.scikit-learn 中的 Scaler preprocess ...

随机推荐

Flask主要知识点
Flask是一个基于Python开发并且依赖jinja2模板和Werkzeug WSGI服务的一个微型框架,对于Werkzeug本质是Socket服务端,其用于接收http请求并对请求进行预处理,然后 ...
合作开发工具——freeze和pipreqs
以后在合作开发的过程中,难免会用到别人开发到一半或者将自己开发的项目交给别人,在转交项目的时候需要让别人知道本项目中用到了哪些模块,这时可以用到一条命令来帮助我们. pip3 freeze # 获取环 ...
(转)git 忽略规则
对于经常使用Git的朋友来说,.gitignore配置一定不会陌生.废话不说多了,接下来就来说说这个.gitignore的使用. 首先要强调一点,这个文件的完整文件名就是".gitignor ...
师兄带你轻松入门GitHub
小白:师兄,师兄,我最近总是听到Github,看起来好高大上那,可是不懂是做什么得那? 师兄:你知道微博吧,Github就是程序员的微博,你可以在这里看到全世界最优秀的程序员在做什么. 小白:师兄就是 ...
STM32的型号的命名规则
每种STM32的产品都由16个字母或数字构成的编号标示,用户向ST订货时必须使用这个编号指定需要的产品.这16个字符分为8个部分,下面通过一个例子说明它们的意义: STM32 F C T xxx ST ...
【javascript】script标签的async异步解析
<script src="script.js"></script> 没有 defer 或 async,浏览器会立即加载并执行指定的脚本,“立即”指的是在渲染 ...
Python events
Events不同线程之间同步对象参数说明: # 实例化event对象 event = threading.Event() # 等待检测标志位被设定,标志位设置后就不阻塞了 # 客户机线程可以等待设置 ...
linux svn客户端安装
yum install -y subversion svn checkout使用示例: 先创建一个目录,例如:mkdir test 检出到test目录下 svn checkout svn://192. ...
[c/c++] programming之路（18）、动态分配内存malloc
一.图解堆栈 #include<stdio.h> #include<stdlib.h> #include<Windows.h> void main0(){ **]; ...
剑指offer（22）从上往下打印二叉树
题目描述从上往下打印出二叉树的每个节点,同层节点从左至右打印. 题目分析从下打印就是按层次打印,其实也就是树的广度遍历. 一般来说树的广度遍历用队列,利用先进先出的特点来保存之前节点,并操作之前的 ...

K-临近算法(KNN)

K-临近算法(KNN)

1、k-近邻算法原理

工作原理

欧几里得距离(Euclidean Distance)

2、在scikit-learn库中使用k-近邻算法

1）用于分类(用鸢尾花作为示例)

K-临近算法(KNN)的更多相关文章

随机推荐

热门专题