K-近邻算法

(一)定义：如果一个样本在特征空间中的k个最相似的样本中的大多数属于某一个类别，则该样本也属于这个类别。

(二)相似的样本，特征之间的值应该是相近的，使用k-近邻算法需要做标准化处理。否则预测出来的效果很差。

(三)算法的优缺点：

　　优点：比较简单，易于实现，无需估计参数，无需训练。

　　缺点：计算量大，内存开销大，必须指定k值，k值若选取不当则分类精度不能保证。

(四)适用场景：适用于小数据场景，几千~几万个样本。

实例：

from sklearn.model_selection import train_test_split

from sklearn.neighbors import KNeighborsClassifier

from sklearn.preprocessing import StandardScaler

import pandas as pd

def knnCls():

    """

    k-邻近算法

    :return:

    """

    # 读取数据

    data=pd.read_csv('训练集数据文件的路径')

    # 处理数据

    # 1.根据查询的条件，选择特定范围的数据样本

    data=data.query("x>1.0 & x<1.25 & y>2.5 & y<2.75")

    # 处理时间数据  把时间戳变成有年月日时分秒的格式

    time_value=pd.to_datetime(data['time'],unit='s')

    # 把日期格式转化为字典

    time_value=pd.DatetimeIndex(time_value)

    # 构造一些特征

    data['day']=time_value.day    # data里面的特征多一个

    data['hour'] = time_value.hour

    data['weekday'] = time_value.weekday

    # 把时间戳特征删除

    data = data.drop(['time'],axis=1)   # 删除time这一列

    # 取出数据当中的特征值和目标值

    y=data['place_id']

    x=data.drop(['place_id'],axis=1)

    # 进行数据的分割，划分训练集和测试集数据

    x_train,x_test,y_train,y_test=train_test_split(x,y,test_size=0.25)

    # 特征工程（标准化）

    std=StandardScaler()

    # 对测试集和训练集的特征值进行标准化

    x_train=std.fit_transform(x_train)

    x_test=std.fit_transform(x_test)

    # 进行算法流程

    knn=KNeighborsClassifier(n_neighbors=5)

    # fit ,predict,score

    knn.fit(x_train,y_train)

    # 得出预测结果

    y_predict=knn.predict(x_test)

    # 得出准确率

    print(knn.score(x_test, y_test))   # 通过第一个参数x_test可以算出预测的目标值

    return None

if __name__=='__main__':

    knnCls()

机器学习笔记(五) K-近邻算法的更多相关文章

机器学习03：K近邻算法
本文来自同步博客. P.S. 不知道怎么显示数学公式以及排版文章.所以如果觉得文章下面格式乱的话请自行跳转到上述链接.后续我将不再对数学公式进行截图,毕竟行内公式截图的话排版会很乱.看原博客地址会有更 ...
02机器学习实战之K近邻算法
第2章 k-近邻算法 KNN 概述 k-近邻(kNN, k-NearestNeighbor)算法是一种基本分类与回归方法,我们这里只讨论分类问题中的 k-近邻算法. 一句话总结:近朱者赤近墨者黑! k ...
机器学习随笔01 - k近邻算法
算法名称: k近邻算法 (kNN: k-Nearest Neighbor) 问题提出: 根据已有对象的归类数据,给新对象(事物)归类. 核心思想: 将对象分解为特征,因为对象的特征决定了事对象的分类. ...
机器学习 Python实践-K近邻算法
机器学习K近邻算法的实现主要是参考<机器学习实战>这本书. 一.K近邻(KNN)算法 K最近邻(k-Nearest Neighbour,KNN)分类算法,理解的思路是:如果一个样本在特征空 ...
《机器学习实战》-k近邻算法
目录 K-近邻算法 k-近邻算法概述解析和导入数据使用 Python 导入数据实施 kNN 分类算法测试分类器使用 k-近邻算法改进约会网站的配对效果收集数据准备数据:使用 Python ...
机器学习：1.K近邻算法
1.简单案例:预测男女,根据身高,体重,鞋码 import numpy as np import matplotlib import sklearn from skleran.neighbors im ...
《机器学习实战》——K近邻算法
三要素:距离度量.k值选择.分类决策原理: (1) 输入点A,输入已知分类的数据集data (2) 求A与数据集中每个点的距离,归一化,并排序,选择距离最近的前K个点 (3) K个点进行投票,票数最 ...
GridSearchCV网格搜索得到最佳超参数, 在K近邻算法中的应用
最近在学习机器学习中的K近邻算法, KNeighborsClassifier 看似简单实则里面有很多的参数配置, 这些参数直接影响到预测的准确率. 很自然的问题就是如何找到最优参数配置? 这就需要用到 ...
机器学习实战笔记--k近邻算法
#encoding:utf-8 from numpy import * import operator import matplotlib import matplotlib.pyplot as pl ...

随机推荐

Django基础模板案例
想要用django 访问一个页面同时传参数过去.在页面中接受参数案例:附代码 #创建一个项目项目名字是 yhl_test django-admin startproject yhl_test ...
VMTurbo采用红帽企业虚拟化软件
VMTurbo公司正处于虚拟化的开始阶段,并将继续向虚拟世界迈进.该公司已宣布官方支持Red Hat 公司的Enterprise Virtualization 3.1.VMTurbo公司采用Red H ...
ibatis 常用标签
prepend:自动在前面加上:自动新手:自动预:自动前置 property:属性 compareValue:指定的常数,值 //判断不相等: <isNotEqual prepend=" ...
Apache 调用不同的 PHP 版本
# cd /etc/apache2/mods-enabled 建立 /etc/apache2/mods-available/ 之下的 php7.2.load php7.2.conf 两个文件的符号 ...
Greeplum 系列（一） Greenplum 架构
Greeplum 系列(一) Greenplum 架构 Greenplum 可进行海量并行处理 (Massively Parallel Processing) 一.Greenplum 体系架构 Gre ...
Java Thread系列（三）线程安全
Java Thread系列(三)线程安全一.什么是线程安全线程安全概念:当多个线程访问某一个类(对象或方法)时,这个类始终都能表现出正确的行为,那么这个类(对象或方法)就是线程安全的. 线程安全来 ...
想成为一名成功的UX设计师吗？做好这13件事情吧
以下内容由Mockplus团队翻译整理,仅供学习交流,Mockplus是更快更简单的原型设计工具. 丢掉那些阻碍你前进的东西每个人对成功的定义都不同.如果想在重要事情上取得成功,学会给予才是关键.只 ...
VueX-状态管理器
一.VueX功能与解决的问题 1.中央状态管理器的功能: 1.1.可以管理共享状态1.2.提供一个可修改状态的方法1.3.提供状态获取的方法1.4.状态更改后,有通知机制 2.中央状态管理器解决的问 ...
Linux的系统引导
启动引导: 1.主机加电自检,加载BIOS信息 2.读取MBR的引导文件[grub lilo] 3.引导linux内核 4.运行第一个进程init pid=1 5.进入相应的运行级别[0-6] 6.运 ...
CocoaPods安装和使用教程[转]
目录 CocoaPods是什么? 如何下载和安装CocoaPods? 如何使用CocoaPods? 场景1:利用CocoaPods,在项目中导入AFNetworking类库场景2:如何正确编译运行一 ...

机器学习笔记(五) K-近邻算法

K-近邻算法

机器学习笔记(五) K-近邻算法的更多相关文章

随机推荐

热门专题