k-近邻算法

算法介绍

定义：如果一个样本在特征空间中的k个最相似（即特征空间中最邻近）的样本中的大多数属于某一类别，则该样本也属于这个类别。
计算距离公式：欧式距离（两点之间距离）
需要做标准化处理，防止某一类特征值权重过大
Sklearn API
- sklearn.neighbors.KNeighborsClassifier
- n 的取值会影响最终结果

算法实例（Facebook Check in）

解决思路

分类：
- 特征值： x,y 坐标，定位准确性，年，日，时，周
- 目标值：入住位置的id
处理： 0<x<10 0<y<10
- 由于数据量大，节省时间，x,y 缩小
- 时间戳进行(年，月，日，周，时分秒），当做新特征
- 少于指定签到人数的位置删除

from sklearn.neighbors import KNeighborsClassifier

from sklearn.preprocessing import StandardScaler

from sklearn.model_selection import train_test_split

import pandas as pd

def knncls():

    """

    K-近邻预测用户签到位置

    :return: None

    """

    # 读取数据

    data = pd.read_csv('./train.csv')

    # print(data.head(10))

    # 处理数据

    # 1.缩小数据

    data = data.query('x >1.0 & x < 1.25 & y > 2.5 & y < 2.75')

    # 2. 处理时间数据

    time_value = pd.to_datetime(data['time'], unit='s')

    # print(time_value)

    # 3. 构造一些特征, 把日期格式转换为字典格式

    time_value = pd.DatetimeIndex(time_value)

    data['day'] = time_value.day

    data['weekday'] = time_value.weekday

    data['hour'] = time_value.hour

    # 4.把时间戳特征删除

    data = data.drop(['time'],axis=1)

    # print(data)

    # 5.把签到数量少于n个的目标位置删除

    place_count = data.groupby('place_id').count() # 统计place_id次数,变成行索引

    tf = place_count[place_count.row_id > 3].reset_index() # row_id 具体次数，reset_index 把place_id生成新的一列

    data = data[data['place_id'].isin(tf.place_id)] # 筛选place_id

    # print(data)

    # 6.取出数据中的特征值和目标值

    y = data['place_id']

    x = data.drop(['place_id', 'row_id'], axis=1) # 去掉row_id 可以增加精度

    # 7.分割训练集和测试集

    x_train, x_test, y_train, y_text = train_test_split(x, y, test_size=0.25)

    # 8.特征工程（标准化）

    std = StandardScaler()

    x_train = std.fit_transform(x_train)

    x_test = std.transform(x_test)

    # 进行算法流程 fit, predict, score  #超参数

    knn = KNeighborsClassifier(n_neighbors=5)

    knn.fit(x_train, y_train)

    # 得出预测结果

    y_predict = knn.predict(x_test)

    print('预测的目标签到位置为：', y_predict)

    # 得出准确率

    print('预测的准确率为：', knn.score(x_test, y_text))

    return None

if __name__ == '__main__':

    knncls()

总结

问题

k值取多大，有什么影响？
- k值取很小：容易受异常点影响
- k值取很大：容易受K值数量（类别）波动
性能问题

优缺点

优点：简单，易于理解实现，无需估计参数，无需训练
缺点：
- 懒惰算法，对测试样本分类时的计算量打，内存开销大
- 必须指定K值，k值选择不当则分类精度不能保证
使用场景：小数据（几千~几万），基本不常用

06_K-近邻算法的更多相关文章

机器学习实战笔记--k近邻算法
#encoding:utf-8 from numpy import * import operator import matplotlib import matplotlib.pyplot as pl ...
机器学习实战笔记(Python实现)-01-K近邻算法(KNN)
--------------------------------------------------------------------------------------- 本系列文章为<机器 ...
KNN近邻算法
K近邻(KNN,k-NearestNeighbor)分类算法是数据挖掘分类技术中最简单的方法之一.所谓K最近邻,就是k个最近的邻居的意思,说的是每个样本都可以用它最接近的k个邻居来代表.kNN算法的核 ...
k近邻算法的Java实现
k近邻算法是机器学习算法中最简单的算法之一,工作原理是:存在一个样本数据集合,即训练样本集,并且样本集中的每个数据都存在标签,即我们知道样本集中每一数据和所属分类的对应关系.输入没有标签的新数据之后, ...
基本分类方法——KNN(K近邻)算法
在这篇文章 http://www.cnblogs.com/charlesblc/p/6193867.html 讲SVM的过程中,提到了KNN算法.有点熟悉,上网一查,居然就是K近邻算法,机器学习的入门 ...
从K近邻算法谈到KD树、SIFT+BBF算法
转自 http://blog.csdn.net/v_july_v/article/details/8203674 ,感谢july的辛勤劳动前言前两日,在微博上说:“到今天为止,我至少亏欠了3篇文章 ...
机器学习之K近邻算法（KNN）
机器学习之K近邻算法(KNN) 标签: python 算法 KNN 机械学习苛求真理的欲望让我想要了解算法的本质,于是我开始了机械学习的算法之旅 from numpy import * import ...
k近邻算法
k 近邻算法是一种基本分类与回归方法.我现在只是想讨论分类问题中的k近邻法.k近邻算法的输入为实例的特征向量,对应于特征空间的点,输出的为实例的类别.k邻近法假设给定一个训练数据集,其中实例类别已定. ...
KNN K~近邻算法笔记
K~近邻算法是最简单的机器学习算法.工作原理就是:将新数据的每一个特征与样本集中数据相应的特征进行比較.然后算法提取样本集中特征最相似的数据的分类标签.一般来说.仅仅提取样本数据集中前K个最相似的数据 ...
机器学习03：K近邻算法
本文来自同步博客. P.S. 不知道怎么显示数学公式以及排版文章.所以如果觉得文章下面格式乱的话请自行跳转到上述链接.后续我将不再对数学公式进行截图,毕竟行内公式截图的话排版会很乱.看原博客地址会有更 ...

随机推荐

Ubuntu 19.10 发布 | 云原生生态周报 Vol. 24
作者 | 木苏.进超.冬岛.元毅.心水.衷源业界要闻 1.云原生编程语言 Pulumi 1.0 pulumi ,一款中立的开源云开发平台,Pulumi 支持多语言.混合云环境.完全可扩展.初期支持 ...
boost::multi_index 多索引容器
#include "stdafx.h" #include <string> #include <boost/multi_index_container.hpp&g ...
pytest5-使用conftest.py实现多文件共享fixture
一个测试工程下是可以有多个conftest.py的文件,一般在工程根目录放一个conftest.py起到全局作用.在不同的测试子目录也可以放conftest.py,作用范围只在该层级以及以下目录生效. ...
day07整理(内置方法\循环判断)
目录一.上节课回顾 (一)if判断 1.单分支结构 2.双分支结构 3.多分支结构 (二)for循环 1.for + break 2.for + continue 3.for循环嵌套 (三)robu ...
Core3.0的安装与坑坑坑！！！
Core3的 SDK下载地址是:https://dotnet.microsoft.com/download/dotnet-core/3.0 ! 不要下载preview8!!!,请先下载 previe ...
数据结构（四十六）插入排序（1.直接插入排序（O(n²)） 2.希尔排序（O(n3/2)））
一.插入排序的基本思想从初始有序的子集合开始,不断地把新的数据元素插入到已排列有序子集合的合适位置上,使子集合中数据元素的个数不断增多,当子集合等于集合时,插入排序算法结束.常用的插入排序算法有直 ...
jupyter qtconsole 的安装
Jupyter qtconsole最近开始研究人工智能算法,发现了一款基于python的科学计算的神器,jupyter qtconsole,简直就是ipython的加强版,每个命令都直接显示帮助信息, ...
java的静态代理、jdk动态代理和cglib动态代理
Java的代理就是客户端不再直接和委托类打交道,而是通过一个中间层来访问,这个中间层就是代理.使用代理有两个好处,一是可以隐藏委托类的实现:二是可以实现客户与委托类之间的解耦,在不修改委托类代码的情况 ...
Bash 通配符、正则表达式、扩展正则表达式
BASH中的通配符(wildcard) *:任意长度的任意字符. ?:任意单个字符 []:匹配范围 [^]:排除匹配范围 [:alnum:]:所有字母和数字 [:alpha:]:所有字母 [:digi ...
几种部署Goku API Gateway的方式，最快一分钟可使用上网关
本文将介绍几种部署Goku API Gateway的方式,最快一分钟可使用上为网关,详情请看全文. 什么是Goku API Gateway? Goku API Gateway (中文名:悟空 API ...

06_K-近邻算法

k-近邻算法

算法介绍

算法实例 （Facebook Check in）

解决思路

总结

问题

优缺点

06_K-近邻算法的更多相关文章

随机推荐

热门专题

算法实例（Facebook Check in）