机器学习入门-DBSCAN聚类算法

DBSCAN 聚类算法又称为密度聚类，是一种不断发张下线而不断扩张的算法，主要的参数是半径r和k值

DBSCAN的几个概念：

核心对象：某个点的密度达到算法设定的阈值则其为核心点，核心点的意思就是一个点在半径r的范围内，如果存在k个值，那么这个点就成为核心对象

直接密度可达：若点p在q的邻域内，且q是核心，则p-q称为直接密度可达

密度可达：若有q1, q2...qk,对任意qi与qi-1是直接密度可达，从q1和qk则是密度可达

边界点：属于一个类的非核心点，不能再发展下线

噪声点：不属于任意一类簇的点，从一个核心点出发是密度不可达

工作流程

参数D：数据数据集

参数R：指定半径

Minpts：密度阈值

停止条件：所有的点都遍历结束后停止，即所有的点都不是核心点

第一步：标记所有的对象为未遍历的点

第二步：随机选择一个初始点

第三步：如果R的领域内，有k个点的话，就创建一个新簇，将p添加到这个簇里C

第四步：遍历这个簇里的p个点，如果p为unvisited标记为visited，把这些对象添加到N，如果p不是任何簇的成员，把p添加到C

第五步：如果存在任意点不属于任何一个簇，即为噪声点

第六步：直到遍历完所有的点

这是一种不断遍历和发展下线的过程

优势：

不需要指定簇的个数

可以发现任意形状的簇

擅长找到离群点

两个参数就够了

劣势：

高维数据有些困难（可以做降维）

参数难以选择（参数对结果的影响很大）

sklearn效率很慢（数据削减策略），由于数据量很大，我们可以去除一部分相似的数据

代码：使用sklearn中的DBSCAN进行计算，使用scatter_matrix进行画图

第一步：数据导入

第二步：特征提取

第三步：模型训练和测试

第四步：使用轮廓系数进行评估

第五步：使用scatter_matrix画出两两变量的散点图

import pandas as pd

import numpy as np

import matplotlib.pyplot as plt

# 第一步导入数据

data = pd.read_csv('data.txt', sep=' ')

# 第二步提取特征

X = data[['calories', 'sodium', 'alcohol', 'cost']]

# 设置颜色列表

colors = np.array(['red', 'blue', 'green', 'black'])

from sklearn.cluster import DBSCAN

from pandas.tools.plotting import scatter_matrix

from sklearn.metrics import silhouette_score

# 3.模型训练和测试

labels = DBSCAN(eps=10, min_samples=2).fit(X).labels_

# 4. 输出轮廓系数得分

score = silhouette_score(X, labels)

# 5. 画scatter_matrix图

scatter_matrix(X, c=colors[labels], s=50, figsize=(10, 10))

plt.show()

机器学习入门-DBSCAN聚类算法的更多相关文章

机器学习之DBSCAN聚类算法
可以看该博客:https://www.cnblogs.com/aijianiula/p/4339960.html 1.知识点 """ 基本概念: 1.核心对象:某个点的密 ...
机器学习六--K-means聚类算法
机器学习六--K-means聚类算法想想常见的分类算法有决策树.Logistic回归.SVM.贝叶斯等.分类作为一种监督学习方法,要求必须事先明确知道各个类别的信息,并且断言所有待分类项都有一个类别 ...
机器学习入门:K-近邻算法
机器学习入门:K-近邻算法先来一个简单的例子,我们如何来区分动作类电影与爱情类电影呢?动作片中存在很多的打斗镜头,爱情片中可能更多的是亲吻镜头,所以我们姑且通过这两种镜头的数量来预测这部电影的主题. ...
【机器学习】机器学习入门08 - 聚类与聚类算法K-Means
时间过得很快,这篇文章已经是机器学习入门系列的最后一篇了.短短八周的时间里,虽然对机器学习并没有太多应用和熟悉的机会,但对于机器学习一些基本概念已经差不多有了一个提纲挈领的了解,如分类和回归,损失函数 ...
5.机器学习——DBSCAN聚类算法
1.优缺点优点: (1)聚类速度快且能够有效处理噪声点和发现任意形状的空间聚类: (2)与K-MEANS比较起来,不需要输入要划分的聚类个数: (3)聚类簇的形状没有偏倚: (4)可以在需要时输入过 ...
【Python机器学习实战】聚类算法（2）——层次聚类(HAC)和DBSCAN
层次聚类和DBSCAN 前面说到K-means聚类算法,K-Means聚类是一种分散性聚类算法,本节主要是基于数据结构的聚类算法--层次聚类和基于密度的聚类算法--DBSCAN两种算法. 1.层次聚类 ...
5.无监督学习-DBSCAN聚类算法及应用
DBSCAN方法及应用 1.DBSCAN密度聚类简介 DBSCAN 算法是一种基于密度的聚类算法: 1.聚类的时候不需要预先指定簇的个数 2.最终的簇的个数不确定DBSCAN算法将数据点分为三类: 1 ...
机器学习入门KNN近邻算法(一)
1 机器学习处理流程: 2 机器学习分类: 有监督学习主要用于决策支持,它利用有标识的历史数据进行训练,以实现对新数据的表示的预测 1 分类分类计数预测的数据对象是离散的.如短信是否为垃圾短信,用 ...
【Python机器学习实战】聚类算法（1）——K-Means聚类
实战部分主要针对某一具体算法对其原理进行较为详细的介绍,然后进行简单地实现(可能对算法性能考虑欠缺),这一部分主要介绍一些常见的一些聚类算法. K-means聚类算法 0.聚类算法算法简介聚类算法算 ...

随机推荐

MySQL--限制用户使用资源
在MySQL 5.7及后续版本中,可以按照账号来限制每个账号实际具有的资源限制. 语法: GRANT WITH option, 如: GRANT SELECT ON test.* TO user1@l ...
oracel SQL多表查询优化
SQL优化 1.执行路径:ORACLE的这个功能大大地提高了SQL的执行性能并节省了内存的使用:我们发现,单表数据的统计比多表统计的速度完全是两个概念.单表统计可能只要0.02秒,但是2张表联合统计就 ...
atitit.加入win 系统服务 bat批处理程序服务的法总结instsrv srvany java linux
atitit.加入win 系统服务 bat批处理程序服务的法总结instsrv srvany java linux 系统服务不同于普通视窗系统应用程式.不可能简简单单地通过执行一个EXE就启动视窗系 ...
RAC7——vip的理解
VIP特点: 1 VIP是在clusterware安装最后阶段,通过脚本VIPCA创建的: 2 VIP作为一个Nodeapps类型的CRS Resource注册到OCR中,并由CRS维护状态: 3 V ...
Java中 @Override 的作用
@Override是伪代码,表示重写(当然不写也可以),不过写上有如下好处: 可以当注释用,方便阅读: 编译器可以给你验证@Override下面的方法名是否是你父类中所有的,如果没有则报错.例如,你如 ...
JUC原子类之原子操作数据类型
根据修改的数据类型,可以将JUC包中的原子操作类可以分为4类. 基本类型: AtomicInteger, AtomicLong, AtomicBoolean ; 数组类型: AtomicInteger ...
linux 线程的同步二（互斥锁和条件变量）
互斥锁和条件变量为了允许在线程或进程之间共享数据,同步时必须的,互斥锁和条件变量是同步的基本组成部分. 1.互斥锁互斥锁是用来保护临界区资源,实际上保护的是临界区中被操纵的数据,互斥锁通常用于保护 ...
ERROR 2059 (HY000): Authentication plugin 'caching_sha2_password' cannot be loaded
问题: 连接Docker启动的mysql出现:ERROR 2059 (HY000): Authentication plugin 'caching_sha2_password' cannot be l ...
Python基础学习笔记，进阶学习笔记出处
参考虫师-博客 http://www.cnblogs.com/fnng/category 随笔分类相关文章
关于Qt配置编译器的问题
PC系统:win10 安装了:Visual Studio 2017 Community ; Qt 5.8.0 运行Qt程序时,出现以下错误: 原因:来自知乎只安装了VS2017(MSVC 15.0) ...

机器学习入门-DBSCAN聚类算法

机器学习入门-DBSCAN聚类算法的更多相关文章

随机推荐

热门专题