机器学习实战（1）- KNN

KNN：k近邻算法-在训练样本中找到与待测样本距离相近的N个样本，并用这N个样本中所属概率最大的类别作为待测样本的类别。

算法步骤：

1、对训练中的样本数据的不同属性进行归一化处理。

2、计算待测样本到训练样本集中的距离。（欧拉距离或曼哈顿距离）；

3、找到N个距离最小的样本属于不同类别的概率。

4、取最大的概率作为待测样本的类别。

例子1：相亲

相亲考虑的条件：

1）每年飞行公里

2）每周打的游戏时长

3）每周消耗的ice cream

态度用1,2,3表示：1表示little like 2表示much like 3表示pass

数据集路径https://github.com/pbharrin/machinelearninginaction

matlab 代码：大神请给优化。。。。。

clc,clear;

%1)加载数据

TEST = load('datingTestSet2.txt');

r1 = find(TEST(:,4) == 1);

r2 = find(TEST(:,4) == 2);

r3 = find(TEST(:,4) == 3);

% 1)绘制原始数据

plot3(TEST(r1,1),TEST(r1,2),TEST(r1,3),'.b');

hold on

plot3(TEST(r2,1),TEST(r2,2),TEST(r2,3),'.g');

hold on

plot3(TEST(r3,1),TEST(r3,2),TEST(r3,3),'.r');

xlabel('plane');

ylabel('game');

zlabel('ice');

%对不同属性的数据归一化处理

maxr1 = max(TEST(:,1))

minr1 = min(TEST(:,1));

maxr2 = max(TEST(:,2))

minr2 = min(TEST(:,2));

maxr3 = max(TEST(:,3));

minr3 = min(TEST(:,3));

length = size(TEST(:,1))

TESTB = zeros(length,3);

TESTB(:,1) = (TEST(:,1) - minr1) ./ (maxr1 - minr1);

TESTB(:,2) = (TEST(:,2) - minr2) ./ (maxr2 - minr2);

TESTB(:,3) = (TEST(:,3) - minr3) ./ (maxr3 - minr3);

% 待测数据

DATA = [1000,10,0.5];

DATA(1,1) = (DATA(1,1)- minr1) / (maxr1- minr1);

DATA(1,2) = (DATA(1,2)- minr2) / (maxr2- minr2);

DATA(1,3) = (DATA(1,3)- minr3) / (maxr3- minr3);

% 计算距离 N =5

data = repmat(DATA,[length,1]);

dis = TESTB -data;

dis = dis .* dis;

dis = dis * [1;1;1];

sortData = sort(dis);

ndata = sortData(5,1);

list = find(dis <= ndata);

result = TEST(list,4);

a1 = find(result == 1)

a2 = find(result == 2)

a3 = find(result == 3)

if(size(a1,1) > size(a2,1))

    if(size(a1,1)>size(a3,1))

       disp(' little like');

    else

        disp('pass');

    end

else

    if(size(a2,1)>size(a3,1))

       disp(' much like');

    else

        disp('pass');

    end

end

python 3代码：函数都不怎么会用磨磨唧唧的写了一些实现。

import numpy as npy

import matplotlib

import matplotlib.pyplot as plt

import copy

# 读取文件

#手动转换文件，复制到excel让python能正确读取。

data = npy.loadtxt('data.txt',delimiter = ',');

likeindex = npy.where(data[:,3] == 1);

muchlikeindex = npy.where(data[:,3]==2);

passindex = npy.where(data[:,3] == 3);

# 绘制图形(不会绘制三维的)

fig = plt.figure()

ax = fig.add_subplot(111)

ax.scatter(data[likeindex,0],data[likeindex,1],data[likeindex,3],c ='b');

ax.hold('on')

ax.scatter(data[muchlikeindex,0],data[muchlikeindex,1],data[muchlikeindex,3],c ='g',marker ='*');

ax.plot()

plt.show()

# 数据归一化

length = len(data[:,0]);

maxr = npy.zeros((3,1));

minr = npy.zeros((3,1));

for i in range(0,3) :

    maxr[i,0] =  npy.max(data[:,i]);

    minr[i,0] =  npy.min(data[:,i]);

normalData = npy.zeros((length,3));

# 待测数据                

test = npy.matrix([1056560,60,12]);

for i in range(0,3):

    normalData[:,i] = (data[:,i] - minr[i,0]) / (maxr[i,0] - minr[i,0]);

test[0,0] =(test[0,0] - minr[0,0]) / (maxr[0,0] - minr[0,0]);

test[0,1]=(test[0,1] - minr[0,0]) / (maxr[0,0] - minr[0,0]);

test[0,2] =(test[0,2] - minr[0,0]) / (maxr[0,0] - minr[0,0]);

# 测试数据与训练数据的距离

testarry = npy.tile(test,(length,1));

dis2 = (normalData - testarry);

dis = npy.multiply(dis2,dis2);

one = npy.mat([[1],[1],[1]]);

dis = dis*one;

# 深度copy 原数据

org = copy.copy(dis);

datat = dis.T;

datat.sort()

door = datat[0,5]; # k =5

nearindex =  npy.where(org[:,0] < door);

print (nearindex)  # 这个nearindex 不知道为啥会有两行                      

#用索引计算 所属类别的频率

机器学习实战（1）- KNN的更多相关文章

算法代码[置顶] 机器学习实战之KNN算法详解
改章节笔者在深圳喝咖啡的时候突然想到的...之前就有想写几篇关于算法代码的文章,所以回家到以后就奋笔疾书的写出来发表了前一段时间介绍了Kmeans聚类,而KNN这个算法刚好是聚类以后经常使用的匹配技 ...
机器学习实战之 KNN算法
现在机器学习这么火,小编也忍不住想学习一把.注意,小编是零基础哦. 所以,第一步,推荐买一本机器学习的书,我选的是Peter harrigton 的<机器学习实战>.这本书是基于pyt ...
机器学习实战1-1 KNN电影分类遇到的问题
为什么电脑排版效果和手机排版效果不一样~ 目前只学习了python的基础语法,有些东西理解的不透彻,希望能一边看<机器学习实战>,一边加深对python的理解,所以写的内容很浅显,也许还会 ...
《机器学习实战》KNN算法实现
本系列都是参考<机器学习实战>这本书,只对学习过程一个记录,不做详细的描述! 注释:看了一段时间Ng的机器学习视频,感觉不能光看不练,现在一边练习再一边去学习理论! KNN很早就之前就看过 ...
机器学习实战之kNN算法
机器学习实战这本书是基于python的,如果我们想要完成python开发,那么python的开发环境必不可少: (1)python3.52,64位,这是我用的python版本 (2)numpy 1.1 ...
机器学习实战笔记——KNN约会网站
''' 机器学习实战——KNN约会网站优化 ''' import operator import numpy as np from numpy import * from matplotlib.fon ...
机器学习实战笔记——KNN
机器学习实战——读书笔记书籍奉上
基于Python的机器学习实战：KNN
1.KNN原理: 存在一个样本数据集合,也称作训练样本集,并且样本集中每个数据都存在标签,即我们知道样本集中每一个数据与所属分类的对应关系.输入没有标签的新数据后,将新数据的每个特征与样本集中数据对应 ...
吴裕雄--天生自然python机器学习实战：K-NN算法约会网站好友喜好预测以及手写数字预测分类实验
实验设备与软件环境硬件环境:内存ddr3 4G及以上的x86架构主机一部系统环境:windows 软件环境:Anaconda2(64位),python3.5,jupyter 内核版本:window ...
机器学习实战之KNN
KNN也称K-近邻算法,简单来说,KNN采用测量不同特征值之间的距离的方法进行分类. 优点:精度高,对异常值不敏感,无数据输入假定. 确定:时间复杂度.空间复杂度较高适用数据范围:数值型和标称型工 ...

随机推荐

[洛谷P5323][BJOI2019]光线
题目大意:有$n$层玻璃,每层玻璃会让$a\%$的光通过,并把$b\%$的光反射.有一束光从左向右射过,问多少的光可以透过这$n$层玻璃题解:事实上会发现,可以把连续的几层玻璃合成一层玻璃,但是要注 ...
Docker2 docker commit方法镜像制作
一.前期准备 1.下载一个centos镜像,进入容器,安装wget docker pull centos docker run -it centos bash [root@web1 ~]# docke ...
JSP 9大隐式对象和四个作用域的范围
Java中九大隐式对象说明输入/输出对象: request response out 作用域通信对象: session application pageContext Servlet ...
js --桥接模式
定义: 将抽象部分与它的实现部分分离,使他们都可以独立的变化. 也就是说,桥接模式里面有两个角色: - 扩充抽象类 - 具体实现类在写桥接模式之前,想在写一下关于抽象的理解.我觉得抽象这个概念过于抽 ...
JAVA - Windows下JDK默认安装的配置参数
JDK版本1.8 JAVA_HOME C:\Program Files\Java\jdk1.8.0_60 CLASSPATH .;%%JAVA_HOME%%\lib;%%JAVA_HOME%%\lib ...
在编译内核的最后阶段出现sdhci_esdhc_imx_pdata未定义的错误
遇到下面这种错误在网上查找资料后,发现一篇好文,提出了良好的找错误的策略: (1)利用grep命令查看该变量在何处使用: (2)查看相应的头文件是否在Kconfig中被定义且在make menuco ...
二十二、mysql索引原理详解
背景使用mysql最多的就是查询,我们迫切的希望mysql能查询的更快一些,我们经常用到的查询有: 按照id查询唯一一条记录按照某些个字段查询对应的记录查找某个范围的所有记录(between a ...
Android笔记（六十）Android总结：四大组件——BroadcastReceiver篇
什么是BroadcastReceiver BroadcastReceiver是Android体系的四大组件之一,本质上是一种全局的监听器,用于监听系统全局的广播消息,正式因为其本质为全局监听,因此可以 ...
Linux 进程IO杂项
Linux 进程IO杂项本文结合一个 pwn 例题,在分析例题的过程中穿插介绍相关知识. 例题来源:PWNABLE.KR 网站,Toddler's Bottle 小节,习题 input. 例题内容: ...
【HICP Gauss】数据库数据库管理(调优启动流程)-4
数据库参数: 创建数据库调优数据库其他---->控制资源使用控制数据库内部机制设置重要属性参数数据保存在cfg/Zengine.ini 文件中参数保存使用 key=value的保存形 ...

机器学习实战（1）- KNN

机器学习实战（1）- KNN的更多相关文章

随机推荐

热门专题