机器学习实战K-近邻算法

今天开始学习机器学习，第一章是K-近邻算法，有不对的地方请指正

大概总结一下近邻算法写分类器步骤：

1. 计算测试数据与已知数据的特征值的距离，离得越近越相似

2. 取距离最近的K个已知数据的所属分类

3. 最后统计K个值的分类分别出现的概率，返回最多的一个属性，即为测试数据的所属分类

4. 至于怎么把文本转换成numpy的类型，需要学习numpy模块的相关知识，附上

numpy学习连接 http://old.sebug.net/paper/books/scipydoc/numpy_intro.html

#-*- coding:utf-8 *-*-

from numpy import *

import operator   #计算模块

import matplotlib

import matplotlib.pyplot as plt

import time

import random

from mpl_toolkits.mplot3d import Axes3D

from os import listdir

import time

def createDataSet():

    group = array([[1.0,1.1],[1.0,1.0],[0,0],[0,0.1]])

    labels = ['A','A','B','B']

    return group,labels

#A,B分类

def classify0(inX, dataSet, labels, k):

    dataSetSize = dataSet.shape[0]

    diffMat = tile(inX,(dataSetSize,1)) - dataSet #tile函数把inx复制datasetsize行1列

    sqDiffMat = diffMat**2

    #print "sqDiffMat : ",sqDiffMat

    sqDistance = sqDiffMat.sum(axis = 1)

    distance = sqDistance**0.5

    #print "distance : ",distance

    sortedDistIndicies = distance.argsort()  #返回从小到大的元素的下标，比如[1 3 2 4].argsort()返回[0 2 1 3]

    #print "****",sortedDistIndicies

    classCount = {}

    for i in range(k):

        voteIlabel = labels[sortedDistIndicies[i]]   #统计各个现有值所属的特征向量

        #print sortedDistIndicies[i],voteIlabel

        classCount[voteIlabel] = classCount.get(voteIlabel,0)+1  #统计各个特征向量出现的次数

    sortedClassCount = sorted(classCount.iteritems(),key = operator.itemgetter(1),reverse = True)

    #operator.itemgetter()从小到大排序

    #print "sortedClassCount : ",sortedClassCount

    return sortedClassCount[0][0]

group,labels =  createDataSet()

#print classify0([0,0], group, labels, 3)

# # a = [('b',2),('a',1),('c',0)]

# a=[('b',2),('a',2),('a',1),('c',0)]

# b = sorted(a,key =  operator.itemgetter(0)) #优先根据第一个元素排序

# print b

# b = sorted(a,key =  operator.itemgetter(1)) #优先根据第二个元素排序

# print b

# b = sorted(a,key =  operator.itemgetter(1,0)) #优先根据第二个元素排序，当第二个元素相等的情况下根据第一个元素排序

# print b

#解析数据

def file2matrix(filename):

    with open(filename) as f:

        lines = f.readlines()

        matrixNumber = len(lines)

        print 'the all lines is :',matrixNumber

        #matrix = zeros((matrixNumber,3),dtype = 'int') #生成空的n行3列的矩阵

        matrix = zeros((matrixNumber,2))

        vector = []

        index = 0     #矩阵索引

        for line in lines:

            line = line.strip()

            data = line.split("\t")

            matrix[index:] = data[0:2]   #把提取出来的复制到矩阵里面

            vector.append(int((data[-1])))  #最后一个特征值作为特征向量

            index+=1

        return matrix,vector

#生成文本数据

def createdata(filename):

    with open(filename,'w') as f:

        for i in range(1000):

            r1 = int(random.random()*1000)

            r2 = 0

            if(0<=r1<=200):

                r2 = 1

            if(200<r1<=400):

                r2 = 2

            if(400<r1<=600):

                r2 = 3

            if(600<r1<=800):

                r2 = 4

            if(800<r1<=1000):

                r2 = 5

            r1 = str(r1)

            r2 = str(r2)

            #r2 = str(int(random.random()*10))

            r3 = str(int(random.random()*10))

            f.writelines(r3+'\t'+r1+'\t'+r2+'\n')

#createdata(r'D:\test_packages\knntest.txt')

'''

datat,labels = file2matrix(r'D:\test_packages\knntest.txt')

print datat

# print datat[:,1] #纵向的第二列

# print datat[:][1] #横向的第二列

print labels

fig = plt.figure()  #生成容器

plt.title('favorite table data')

ax = fig.add_subplot(1,1,1,projection='3d') #3D模型

ax.scatter(datat[:,0],datat[:,1],datat[:,2],array(labels),array(labels),array(labels))  #使用datat的第二列和第三列作为X轴和Y轴的值

ax.legend()

plt.show()

fig = plt.figure()

ax = fig.add_subplot(1,1,1) #把容器划分为1行1列，图像画在第一格,背景颜色为axisbg = ‘’

ax.scatter(datat[:,1],datat[:,2],array(labels),array(labels))  #使用datat的第二列和第三列作为X轴和Y轴的值

#ax.grid(True) #是否显示网格

# plt.show()

plt.show()

'''

#归一化，(old-min)/(max-min)

def autoNormal(dataSet):

    maxVals = dataSet.max(0)  #纵向找到每一个样本的最大特征值

    minVals = dataSet.min(0)

    ranges = maxVals - minVals #计算差值

    normalValue = zeros(shape(dataSet))

    m = dataSet.shape[0]

    normalValue = dataSet - tile(minVals,(m,1))   #计算(old-min)

    normalValue = normalValue/tile(ranges,(m,1))

    return normalValue,ranges,minVals

#归一化特征值之后

datat,labels = file2matrix(r'D:\test_packages\knntest.txt')

normalValue,ranges,minVals = autoNormal(datat)

print normalValue

fig = plt.figure()

ax = fig.add_subplot(1,1,1) #把容器划分为1行1列，图像画在第一格,背景颜色为axisbg = ‘’

ax.scatter(normalValue[:,0],normalValue[:,1],array(labels),array(labels))  #使用datat的第二列和第三列作为X轴和Y轴的值

#ax.grid(True) #是否显示网格

# plt.show()

plt.show()

#约会网站测试函数

def datinggTest():

    datat,labels = file2matrix(r'D:\test_packages\knntest.txt')

    normal,ranges,minvals = autoNormal(datat)

    testData = 0.5  #10%用来测试，90%用来训练

    testNumber = normal.shape[0]  #总行数

    numberTestValues = int(testNumber*testData)  #测试行数

    error = 0.0

    for i in range(numberTestValues):

        labelValue = classify0(normal[i,:], normal[numberTestValues:testNumber,:], labels[numberTestValues:testNumber], 3)

        if (labelValue != labels[i]):

            error+=1.0

            print "this time is error the error is %s, the right is %s"%(labelValue,labels[i])

        else:

            print "all right ,the number is %s, the right is %s"%(labelValue,labels[i])

    error_result = ((error/float(numberTestValues)))

    print "your error_result is %s"%(error_result)

    print 'error is :',error

datinggTest()

#把二进制文件转化为np.array

def img2Vector(filename):

    with open(filename) as f:

        vector = zeros((1,1024))

        for i in range(32):

            line = f.readline()

            for j in range(32):

                vector[0,32*i+j] = line[j]

    return vector

vector = img2Vector(r'D:\test_packages\trainingDigits\0_0.txt')

print vector[0,11:17]

#手写数字识别系统测试代码

def handwritingClassTest():

    startTime = time.ctime()

    handLabels = []

    trainFile = listdir(r'D:\test_packages\trainingDigits')

    m = len(trainFile)

    trainMat = zeros((m,1024))

    for i in range(m):

        fileName = trainFile[i]

        file = fileName.split('.')[0]

        classNumber = file.split('_')[0]

        handLabels.append(classNumber)

        trainMat[i,:] = img2Vector(r'D:\test_packages\trainingDigits\%s'%fileName)

    testFiles = listdir(r'D:\test_packages\testDigits')

    nTest = len(testFiles)

    error = 0.0

    for i in range(nTest):

        fileName = testFiles[i]

        file = fileName.split('.')[0]

        classNumber = file.split('_')[0]

        testMat = img2Vector(r'D:\test_packages\testDigits\%s'%fileName)

        testLabels = classify0(testMat, trainMat, handLabels, 3)

        if (testLabels != classNumber):

            error+=1.0

            print 'error , error number is %s, the right number is %s'%(testLabels,classNumber)

        else:

            print 'right'

    error = error/float(nTest)

    stopTime = time.ctime()

    print 'all right ,the error_result is %s'%(error)

    print 'the process start at %s'%(startTime)

    print 'the process stop at %s'%(stopTime)

handwritingClassTest()

机器学习实战K-近邻算法的更多相关文章

机器学习实战-k近邻算法
写在开头,打算耐心啃完机器学习实战这本书,所用版本为2013年6月第1版在P19页的实施kNN算法时,有很多地方不懂,遂仔细研究,记录如下: 字典按值进行排序首先仔细读完kNN算法之后,了解其是用 ...
机器学习之K近邻算法（KNN）
机器学习之K近邻算法(KNN) 标签: python 算法 KNN 机械学习苛求真理的欲望让我想要了解算法的本质,于是我开始了机械学习的算法之旅 from numpy import * import ...
【机器学习】k近邻算法（kNN）
一.写在前面本系列是对之前机器学习笔记的一个总结,这里只针对最基础的经典机器学习算法,对其本身的要点进行笔记总结,具体到算法的详细过程可以参见其他参考资料和书籍,这里顺便推荐一下Machine Le ...
第四十六篇入门机器学习——kNN - k近邻算法（k-Nearest Neighbors）
No.1. k-近邻算法的特点 No.2. 准备工作,导入类库,准备测试数据 No.3. 构建训练集 No.4. 简单查看一下训练数据集大概是什么样子,借助散点图 No.5. kNN算法的目的是,假如 ...
机器学习之K近邻算法
K 近邻 (K-nearest neighbor, KNN) 算法直接作用于带标记的样本,属于有监督的算法.它的核心思想基本上就是近朱者赤,近墨者黑. 它与其他分类算法最大的不同是,它是一种&quo ...
[机器学习实战] k邻近算法
1. k邻近算法原理: 存在一个样本数据集,也称作训练样本集,并且样本集中每个数据都存在标签,即我们知道样本集中每一数据与所属分类的对应关系.输入没有标签的新数据后,将新数据的每个特征与样本集中数据对 ...
【机器学习】K近邻算法——多分类问题
给定一个训练数据集,对新的输入实例,在训练数据集中找到与该实例最邻近的K个实例,这K个实例的多数属于某个类,就把该类输入实例分为这个类. KNN是通过测量不同特征值之间的距离进行分类.它的的思路是:如 ...
机器学习2—K近邻算法学习笔记
Python3.6.3下修改代码中def classify0(inX,dataSet,labels,k)函数的classCount.iteritems()为classCount.items(),另外p ...
机器学习03：K近邻算法
本文来自同步博客. P.S. 不知道怎么显示数学公式以及排版文章.所以如果觉得文章下面格式乱的话请自行跳转到上述链接.后续我将不再对数学公式进行截图,毕竟行内公式截图的话排版会很乱.看原博客地址会有更 ...
机器学习实战 - python3 学习笔记（一） - k近邻算法
一. 使用k近邻算法改进约会网站的配对效果 k-近邻算法的一般流程: 收集数据:可以使用爬虫进行数据的收集,也可以使用第三方提供的免费或收费的数据.一般来讲,数据放在txt文本文件中,按照一定的格式进 ...

随机推荐

C++内存布局详解
一个由C/C++编译的程序除了存放函数二进制代码的程序代码段(code段)外,数据占用的内存大致分为以下几个部分: 1.栈区(stack) 存放局部变量.函数参数.返回数据.返回地址等.系统自动分配释 ...
文档API生成神器SandCastle使用心得
一.功能描述关于Sandcastle网上的参考资料相对较少,Google出来很多资料都是全英文的,相对于我这种英语渣渣看起来还是很费劲的. 言简意赅,Sandcastle主要功能是能够将C#类生成类 ...
css中使用变量
2017年3月,微软宣布 Edge 浏览器将支持 CSS 变量.这个重要的 CSS 新功能,所有主要浏览器已经都支持了. 声明css变量的时候,变量名前面要加两根连词线(--).变量名大小写敏感,-- ...
OpenSSL中的大数接口与基于其的自用RSA加密接口设计
本文记录了初次接触OpenSSL中的大数模块,重温了RSA加密流程,使用OpenSSL的接口包装成自用RSA加密接口,并且利用自己的接口演示了Alice与Bob通过RSA加密进行通讯的一个示例. 概览 ...
nrm的安装、定义和用法
因为npm包管理工具是属于国外的,所以在中国使用它下载东西的时候比较慢.这时我们就想用国内的淘宝镜像.也有别的,所以当你想切换下载源的时候就会用到nrm了. ###首先,nrm是什么呢? 开发的npm ...
探究JVM和GC
1．Java堆中各代分布: 图1:Java堆中各代分布 Young:主要是用来存放新生的对象. Old:主要存放应用程序中生命周期长的内存对象. Permanent:是指内存的永久保存区域,主要存放C ...
201521123082 《Java程序设计》第10周学习总结
201521123082 <Java程序设计>第10周学习总结标签(空格分隔): java 1. 本周学习总结 1.1 以你喜欢的方式(思维导图或其他)归纳总结异常与多线程相关内容. A ...
24点游戏详细截图介绍以及原型、Alpha、Beta对比
原型设计图片展示功能与界面设计 1.登录注册 2.手机号验证 3.24点游戏 4.粉色系女生界面 Alpha 图片展示功能与界面设计 1.24点游戏 2.背景音乐 3.可查看多种可能的答案 4. ...
201521123022 《Java程序设计》第五周学习总结
1. 本周学习总结 1.1 尝试使用思维导图总结有关多态与接口的知识点. 2. 书面作业 1.代码阅读:Child压缩包内源代码 1.1 com.parent包中Child.java文件能否编译通过? ...
[BT5]信息收集1-1 Dnsenum
0.工具介绍 The purpose of Dnsenum is to gather as much information as possible about a domain. The progr ...

机器学习实战K-近邻算法

机器学习实战K-近邻算法的更多相关文章

随机推荐

热门专题