密度聚类 - DBSCAN算法

　　参考资料：python机器学习库sklearn——DBSCAN密度聚类, Python实现DBScan

import numpy as np

from sklearn.cluster import DBSCAN

from sklearn import metrics

from sklearn.datasets.samples_generator import make_blobs

from sklearn.preprocessing import StandardScaler

# #############################################################################

# 产生样本数据

centers = [[1, 1], [-1, -1], [1, -1]]  # 生成聚类中心点

X, labels_true = make_blobs(n_samples=750, centers=centers, cluster_std=0.4,random_state=0) # 生成样本数据集

X = StandardScaler().fit_transform(X) # StandardScaler作用：去均值和方差归一化。且是针对每一个特征维度来做的，而不是针对样本。

# 参数设置

aa = []

for i in range(X.shape[0]-1):

    for j in range(i+1,X.shape[0]):

        aa.append(np.power(X[i]-X[j], 2).sum())

plt.hist(aa, bins=10, density=1, edgecolor ='k', facecolor='g', alpha=0.75) 

# 调参#############################################################################

t0 = time.time()

optimum_parameter = [0,0,0]

for r in np.linspace(0.1, 0.3, 5):

    for min_samples in range(5,12):

        db = DBSCAN(eps=r, min_samples=min_samples).fit(X)

        score = metrics.silhouette_score(X, db.labels_)

        print('(%0.2f, %d) 轮廓系数: %0.3f'%(r, min_samples, score))

        if score > optimum_parameter[2]: optimum_parameter=[r, min_samples, score]

print('最佳参数为：eps=%0.2f, min_samples=%d, 轮廓系数=%0.3f'%(optimum_parameter[0], optimum_parameter[1], optimum_parameter[2]))

print('调参耗时：', time.time()-t0)

# #############################################################################

# 调用密度聚类  DBSCAN

db = DBSCAN(eps=0.3, min_samples=9).fit(X)

# print(db.labels_)  # db.labels_为所有样本的聚类索引，没有聚类索引为-1

# print(db.core_sample_indices_) # 所有核心样本的索引

core_samples_mask = np.zeros_like(db.labels_, dtype=bool)  # 设置一个样本个数长度的全false向量

core_samples_mask[db.core_sample_indices_] = True #将核心样本部分设置为true

labels = db.labels_

# 获取聚类个数。（聚类结果中-1表示没有聚类为离散点）

n_clusters_ = len(set(labels)) - (1 if -1 in labels else 0)

# 模型评估

print('估计的聚类个数为: %d' % n_clusters_)

print("同质性: %0.3f" % metrics.homogeneity_score(labels_true, labels))  # 每个群集只包含单个类的成员。

print("完整性: %0.3f" % metrics.completeness_score(labels_true, labels))  # 给定类的所有成员都分配给同一个群集。

print("V-measure: %0.3f" % metrics.v_measure_score(labels_true, labels))  # 同质性和完整性的调和平均

print("调整兰德指数: %0.3f" % metrics.adjusted_rand_score(labels_true, labels))

print("调整互信息: %0.3f" % metrics.adjusted_mutual_info_score(labels_true, labels))

print("轮廓系数: %0.3f" % metrics.silhouette_score(X, labels))

# #############################################################################

# Plot result

import matplotlib.pyplot as plt

# 使用黑色标注离散点

unique_labels = set(labels)

colors = [plt.cm.Spectral(each) for each in np.linspace(0, 1, len(unique_labels))]

for k, col in zip(unique_labels, colors):

    if k == -1:  # 聚类结果为-1的样本为离散点

        # 使用黑色绘制离散点

        col = [0, 0, 0, 1]

    class_member_mask = (labels == k)  # 将所有属于该聚类的样本位置置为true

    xy = X[class_member_mask & core_samples_mask]  # 将所有属于该类的核心样本取出，使用大图标绘制

    plt.plot(xy[:, 0], xy[:, 1], 'o', markerfacecolor=tuple(col),markeredgecolor='k', markersize=14)

    xy = X[class_member_mask & ~core_samples_mask]  # 将所有属于该类的非核心样本取出，使用小图标绘制

    plt.plot(xy[:, 0], xy[:, 1], 'o', markerfacecolor=tuple(col),markeredgecolor='k', markersize=6)

plt.title('Estimated number of clusters: %d' % n_clusters_)

plt.show()

密度聚类 - DBSCAN算法的更多相关文章

31(1).密度聚类---DBSCAN算法
密度聚类density-based clustering假设聚类结构能够通过样本分布的紧密程度确定. 密度聚类算法从样本的密度的角度来考察样本之间的可连接性,并基于可连接样本的不断扩张聚类簇,从而获得 ...
聚类——密度聚类DBSCAN
Clustering 聚类密度聚类——DBSCAN 前面我们已经介绍了两种聚类算法:k-means和谱聚类.今天,我们来介绍一种基于密度的聚类算法——DBSCAN,它是最经典的密度聚类算法,是很多算 ...
吴裕雄 python 机器学习——密度聚类DBSCAN模型
import numpy as np import matplotlib.pyplot as plt from sklearn import cluster from sklearn.metrics ...
密度聚类 DBSCAN
刘建平:DBSCAN密度聚类算法 https://www.cnblogs.com/pinard/p/6208966.html API 的说明: https://www.jianshu.com/p/b0 ...
31(2).密度聚类---Mean-Shift算法
Mean-Shift 是基于核密度估计的爬山算法,可以用于聚类.图像分割.跟踪等领域.
基于密度聚类的DBSCAN和kmeans算法比较
根据各行业特性,人们提出了多种聚类算法,简单分为:基于层次.划分.密度.图论.网格和模型的几大类. 其中,基于密度的聚类算法以DBSCAN最具有代表性. 场景一假设有如下图的一组数据, 生成数据 ...
机器学习（十）—聚类算法（KNN、Kmeans、密度聚类、层次聚类）
聚类算法任务:将数据集中的样本划分成若干个通常不相交的子集,对特征空间的一种划分. 性能度量:类内相似度高,类间相似度低.两大类:1.有参考标签,外部指标:2.无参照,内部指标. 距离计算:非负性, ...
机器学习（六）K-means聚类、密度聚类、层次聚类、谱聚类
本文主要简述聚类算法族.聚类算法与前面文章的算法不同,它们属于非监督学习. 1.K-means聚类记k个簇中心,为\(\mu_{1}\),\(\mu_{2}\),...,\(\mu_{k}\),每个 ...
DBSCAN密度聚类算法
DBSCAN(Density-Based Spatial Clustering of Applications with Noise,具有噪声的基于密度的聚类方法)是一种很典型的密度聚类算法,和K-M ...

随机推荐

如何在文本编辑器中实现时间复杂度O(n/m)的搜索功能？ BM算法
//字符串匹配 public class StringCmp { //约定:A主串长 n ,B模式串长m.要求:在A串中找到B串匹配的下标 //BM算法:从B串和A串尾部开始比较,希望一次将B串向后 ...
java8-12-Optional类
Optional类 java.util.Optional 是一个容器类避免空指针 NPE 能够快速定位空指针常用方法: Optional.of(T t) : 创建一个 Optio ...
new和delete创建和释放动态数组
1.动态创建和释放一维数组 #include<iostream> using namespace std; int main() { int n; cin>>n; //分配动态 ...
Cpp 二叉树
#include<vector> #include<iostream> using namespace std; //二叉树的一个节点结构 struct BinaryTreeN ...
2019-2020-1 20199305《Linux内核原理与分析》第六周作业
系统调用的三层机制(下) (一)给MenuOS增加命令 (1)打开虚拟机,首先用rm -rf menu指令删除当前的menu目录,然后用git clone重新克隆一个新版本的menu,进入menu,运 ...
Apriori关联分析详解
------------恢复内容开始------------ 一. Apriori关联分析概述选择物品之间的关联规则也就是要找出物品之间的关系,要找到这种关系有两步找出频繁一起出现的物品集的集合, ...
新书上线：《Spring Boot+Spring Cloud+Vue+Element项目实战：手把手教你开发权限管理系统》，欢迎大家买回去垫椅子垫桌脚
新书上线大家好,笔者的新书<Spring Boot+Spring Cloud+Vue+Element项目实战:手把手教你开发权限管理系统>已上线,此书内容充实.材质优良,乃家中必备垫桌脚 ...
【51nod1253】Kundu and Tree（容斥+并查集）
点此看题面大致题意: 给你一棵树,每条边为黑色或红色, 求有多少个三元组\((x,y,z)\),使得路径\((x,y),(x,z),(y,z)\)上都存在至少一条红色边. 容斥我们可以借助容斥思想 ...
趣谈Linux操作系统学习笔记：第二十六讲
一.内核页表和用户态页表不同,在系统初始化的时候,我们就要创建内核页表了我们从内核页表的根swapper_pg_dir开始找线索,在linux-5.1.3/arch/x86/include/asm ...
spring cloud 2.x版本 Gateway自定义过滤器教程
前言本文采用Spring cloud本文为2.1.8RELEASE,version=Greenwich.SR3 本文基于前两篇文章eureka-server.eureka-client.eureka ...

密度聚类 - DBSCAN算法

密度聚类 - DBSCAN算法的更多相关文章

随机推荐

热门专题