机器学习随笔01 - k近邻算法

算法名称: k近邻算法 (kNN: k-Nearest Neighbor)

问题提出: 根据已有对象的归类数据，给新对象(事物)归类。

核心思想:

将对象分解为特征，因为对象的特征决定了事对象的分类。
度量每个特征的程度，将其数字化。
所有特征值构成元组，作为该对象的坐标。
计算待检测对象和所有已知对象的距离，选择距离最接近的k个已知对象 (k近邻中的k来源于此)。
这k个对象中出现次数最多的分类就是待检测对象的分类。

重要前提: 需要有一批已经正确归类了的对象存在。也就是通常说的训练数据。

重要优势:

精度高,
对训练数据中的异常值不敏感

重大缺陷:

计算量大，由于每次的运算结果都对以后的判定无帮助，所以每次判定都需要利用所有的数据重新计算。
存储量大，由于每次都要重新计算，所有需要一直带着训练数据。

现实范例: 给电影分类。

算法过程:

特征化:为简化问题，假设电影只有两个分类:爱情片和动作片。那么我们可以将电影分解为两个特征:接吻和打斗.
特征数字化: 统计每部电影,包括待检测的电影,中接吻和打斗的次数，假设分别为x和y.
坐标化: 每部电影的接吻次数和达到次数就是该电影的坐标(x,y)
计算距离: dist=sqrt((x0-x1)**2+(y0-y1)**2)
k近邻:选dist最小的k个
如果这k部电影中爱情片多，那么待检测电影就是爱情片，否则为动作片。

扩展范例: 手写识别

列出这个范例的原因是，乍一看，手写识别和对象归类没有关系。但是实际上是有关系的。为了简化问题，我们把范围缩小一点，变成手写识别数字。通过回答下面几个问题，就能知道如何套用kNN算法了。

已知对象和待检测对象是什么? 回答: 已知对象：系统中存储的预先采集到的手写输入内容，待检测对象：用户的每一次手写输入内容。
输入内容具体是什么? 如何特征化? 回答: 将输入面看做一个二维矩阵，笔迹扫过的地方是1，其它地方是0。这个矩阵得有大小，可以自己确定，比如32*64, 64*128等. 特征就是这个矩阵中的所有位置。也就是说，这个矩阵包含多少个点，就算有多少个特征。
每个特征的值是什么? 既然特征表示的是矩阵中特定位置的点，那么特征的值就是这个位置的矩阵元素，为0或者为1
如何构成坐标? 回答:将矩阵所有行按顺序连接起来，构成一个巨长的行，这就是对象的坐标

扩展思维:

特征权重化，算法的核心过程，没有考虑特征的重要程度。

更多信息，请参考:https://en.wikipedia.org/wiki/K-nearest_neighbors_algorithm

机器学习随笔01 - k近邻算法的更多相关文章

02机器学习实战之K近邻算法
第2章 k-近邻算法 KNN 概述 k-近邻(kNN, k-NearestNeighbor)算法是一种基本分类与回归方法,我们这里只讨论分类问题中的 k-近邻算法. 一句话总结:近朱者赤近墨者黑! k ...
机器学习03：K近邻算法
本文来自同步博客. P.S. 不知道怎么显示数学公式以及排版文章.所以如果觉得文章下面格式乱的话请自行跳转到上述链接.后续我将不再对数学公式进行截图,毕竟行内公式截图的话排版会很乱.看原博客地址会有更 ...
机器学习实战笔记--k近邻算法
#encoding:utf-8 from numpy import * import operator import matplotlib import matplotlib.pyplot as pl ...
机器学习 Python实践-K近邻算法
机器学习K近邻算法的实现主要是参考<机器学习实战>这本书. 一.K近邻(KNN)算法 K最近邻(k-Nearest Neighbour,KNN)分类算法,理解的思路是:如果一个样本在特征空 ...
《机器学习实战》-k近邻算法
目录 K-近邻算法 k-近邻算法概述解析和导入数据使用 Python 导入数据实施 kNN 分类算法测试分类器使用 k-近邻算法改进约会网站的配对效果收集数据准备数据:使用 Python ...
机器学习：1.K近邻算法
1.简单案例:预测男女,根据身高,体重,鞋码 import numpy as np import matplotlib import sklearn from skleran.neighbors im ...
《机器学习实战》——K近邻算法
三要素:距离度量.k值选择.分类决策原理: (1) 输入点A,输入已知分类的数据集data (2) 求A与数据集中每个点的距离,归一化,并排序,选择距离最近的前K个点 (3) K个点进行投票,票数最 ...
GridSearchCV网格搜索得到最佳超参数, 在K近邻算法中的应用
最近在学习机器学习中的K近邻算法, KNeighborsClassifier 看似简单实则里面有很多的参数配置, 这些参数直接影响到预测的准确率. 很自然的问题就是如何找到最优参数配置? 这就需要用到 ...
机器学习之K近邻算法（KNN）
机器学习之K近邻算法(KNN) 标签: python 算法 KNN 机械学习苛求真理的欲望让我想要了解算法的本质,于是我开始了机械学习的算法之旅 from numpy import * import ...

随机推荐

a.vim 插件
引用自 https://blog.csdn.net/zhangsming/article/details/42652695 vim插件之快速切换头(.h)/源(.c,.cpp,.cc)文件——a.v ...
python——元组和字典类型简明理解
元组类型: 元祖创建: 不需要括号可以但是一个元素就当成了字符串类型了 >>> tup1="a"; >>> type(tup1) <cla ...
Sphinx 与全文索引
全文索引创建过程第一步:将源文档传给分词组件(Tokenizer) 分词组件做了以下事情: 将文档分成一个一个的单词去除标点符号去除停词:英文(the / a / this / that ... ...
编织织物的knit course direction and knit wale direction
来自:http://www.definetextile.com/2013/04/course-wale.html
多个css样式合并到一个“目录”css文件中
执行访问jsp后发现没有效果同样的代码,在html中效果对比如下: 具体原因:不清楚,暂时记着~~~在jsp中不支持@import这种css样式的引用
iptables随笔
iptables 分为四表五链四表: filter表 nat 表 mangle 表 raw 表五链 INPUT 链 OUTPUT 链 FORWARD 链 PREROUTING(路由前) POSTR ...
angular中使用ckplayer播放器
原文地址:https://www.cnblogs.com/jying/p/9519557.html ,转载请说明出处. ckplayer官网:http://www.ckplayer.com 使用ckp ...
python 网络编程 tcp和udp 协议
1. 网络通信协议 osi七层,tcp\ip五层 tcp\ip五层 arp协议:通过IP地址找到mac地址 2.tcp和udp的区别 tcp协议:面向连接,消息可靠,相对udp来讲,传输速度慢,消息是 ...
echo不换行的实现
1. echo的参数中, -e表示开启转义, /c表示不换行: echo -e "please input a value:/c" 2. -n不换行: echo -n " ...
http://ctf.bugku.com/challenges#%E9%80%86%E5%90%91%E5%85%A5%E9%97%A8:bugku--逆向入门
文件是: 分析挺简单,主要是data urls知识点. 首先使用peid检测是否加壳,发现它居然是jpg文件.使用notepad++查看,结果如下. 嗯,百度一下子,知道了data ...

机器学习随笔01 - k近邻算法

机器学习随笔01 - k近邻算法的更多相关文章

随机推荐

热门专题