sklearn中的指标都在sklearn.metric包下，与聚类相关的指标都在sklearn.metric.cluster包下，聚类相关的指标分为两类：有监督指标和无监督指标，这两类指标分别在sklearn.metric.cluster.supervised和sklearn.metric.cluster.unsupervised包下。聚类指标大部分都是有监督指标，无监督指标较少。

无监督指标和有监督指标应该充分配合起来：无监督指标很好，有监督指标很差，表明这个问题可能不是单靠聚类就能解决的；无监督指标很差，有监督指标很好，表明有监督指标很可能是不靠谱的，数据标注有问题。

sklearn.metric.cluster.__init__.py把所有的聚类指标都引入进来了。

实际上，sklearn.metric包把cluster下的指标全部引进来了，所以可以直接使用sklearn.metric而不必关心sklearn.metric.cluster.

from .supervised import adjusted_mutual_info_score

from .supervised import normalized_mutual_info_score

from .supervised import adjusted_rand_score

from .supervised import completeness_score

from .supervised import contingency_matrix

from .supervised import expected_mutual_information

from .supervised import homogeneity_completeness_v_measure

from .supervised import homogeneity_score

from .supervised import mutual_info_score

from .supervised import v_measure_score

from .supervised import fowlkes_mallows_score

from .supervised import entropy

from .unsupervised import silhouette_samples

from .unsupervised import silhouette_score

from .unsupervised import calinski_harabaz_score

from .bicluster import consensus_score

预备知识

在了解这些聚类指标前，需要一些预备知识才能读懂代码。

COO

稀疏矩阵的一种格式，保存行、列、数三项。

contingency_matrix共现矩阵

from sklearn import metrics

from sklearn.metrics.cluster.supervised import contingency_matrix

labels_true = np.array([0, 2, 2, 3, 2, 1])

labels_pred = np.array([0, 2, 2, 2, 1, 2])

contingency = contingency_matrix(labels_true, labels_pred, sparse=True)

输出为

[[1 0 0]

[0 0 1]

[0 1 2]

[0 0 1]]

共现矩阵行数等于实际类别数，列数等于聚类个数，第i行第j列的值表示实际类别为i的元素有多少个被当做聚类类别为j。

AdjustedRandIndex调整兰德系数

调整之意是：$score=\frac{x-E(x)}{max(x)-E(x)}$

兰德系数是一种指标，互信息是一种指标，经过调整得到调整兰德系数和调整互信息两种指标。

调整的意义在于：对于随机聚类，分值应该尽量低。

import numpy as np

from scipy.misc import comb

from sklearn import metrics

from sklearn.metrics.cluster.supervised import contingency_matrix

labels_true = np.array([0, 2, 2, 3, 2, 1])

labels_pred = np.array([0, 2, 2, 2, 1, 2])

score = metrics.cluster.adjusted_rand_score(labels_true, labels_pred)

print(score)

n_samples = labels_true.shape[0]

n_classes = np.unique(labels_true).shape[0]

n_clusters = np.unique(labels_pred).shape[0]

contingency = contingency_matrix(labels_true, labels_pred, sparse=True)

print(contingency.todense())

sum_comb_c = sum(comb(n_c, 2) for n_c in np.ravel(contingency.sum(axis=1)))

sum_comb_k = sum(comb(n_k, 2) for n_k in np.ravel(contingency.sum(axis=0)))

sum_comb = sum(comb(n_ij, 2) for n_ij in contingency.data)

prod_comb = (sum_comb_c * sum_comb_k) / comb(n_samples, 2)

mean_comb = (sum_comb_k + sum_comb_c) / 2.

score = (sum_comb - prod_comb) / (mean_comb - prod_comb)

print(score)

silhouette_score

silhouette_score是一种无监督聚类指标。

$$silhouette_sample_score=\frac{b-a}{max(a,b)}$$

a表示样本的最小类内距离，b表示样本的最小类间距离。

silhouette_samples函数用于计算每个样本的silhouette分值，silhouette_score就是各个样本分值的平均值。

参考资料

https://blog.csdn.net/howhigh/article/details/73928635

sklearn官方文档

sklearn聚类评价指标的更多相关文章

sklearn聚类模型：基于密度的DBSCAN；基于混合高斯模型的GMM
1 sklearn聚类方法详解 2 对比不同聚类算法在不同数据集上的表现 3 用scikit-learn学习K-Means聚类 4 用scikit-learn学习DBSCAN聚类 (基于密度的聚类) ...
学习sklearn聚类使用
学习利用sklearn的几个聚类方法: 一.几种聚类方法 1.高斯混合聚类(mixture of gaussians) 2.k均值聚类(kmeans) 3.密度聚类,均值漂移(mean shift) ...
机器学习之sklearn——聚类
生成数据集方法:sklearn.datasets.make_blobs(n_samples,n_featurs,centers)可以生成数据集,n_samples表示个数,n_features表示特征 ...
Python数模笔记-Sklearn（2）样本聚类分析
1.分类的分类分类的分类?没错,分类也有不同的种类,而且在数学建模.机器学习领域常常被混淆. 首先我们谈谈有监督学习(Supervised learning)和无监督学习(Unsupervised ...
聚类结果的评估指标及其JAVA实现
一. 前言又GET了一项技能.在做聚类算法的时候,由于要评估所提出的聚类算法的好坏,于是需要与一些已知的算法对比,或者用一些人工标注的标签来比较,于是用到了聚类结果的评估指标.我了解了以下几项. 首 ...
Alink漫谈(二十二) ：源码分析之聚类评估
Alink漫谈(二十二) :源码分析之聚类评估目录 Alink漫谈(二十二) :源码分析之聚类评估 0x00 摘要 0x01 背景概念 1.1 什么是聚类 1.2 聚类分析的方法 1.3 聚类评估 ...
waiting list
Problem: how to cluster non-stationary multivariate time series. What are stationary time series How ...
sklearn：聚类clustering
http://blog.csdn.net/pipisorry/article/details/53185758 不同聚类效果比较 sklearn不同聚类示例比较 A comparison of the ...
第八次作业：聚类--K均值算法：自主实现与sklearn.cluster.KMeans调用
import numpy as np x = np.random.randint(1,100,[20,1]) y = np.zeros(20) k = 3 def initcenter(x,k): r ...

随机推荐

C语言结构体（摘抄C语言设计）
struct Student stu_1;//定义struct Student 类型的变量stu_1 struct Student *p;//定义指向struct Student类型数据的指针变量 p ...
外网穿透-natapp安装配置(windows)
natapp官网 natapp服务器更新:全面支持HTTPS协议以及本地SSL证书,支持WSS协议.同时支持HTTP/2 WEB协议,支持微信小程序本地开发.全面自动支持泛子域名与访客真实IP地址. ...
过滤身份证号和grep复习
一.把身份证号过滤出来我们还是从一道面试题说起. 请从test.txt文件当中过滤出正确的的身份证号码 [root@localhost test.dir]# cat test.txt 赵 37083 ...
LoadRunner Controller集合点策略灰色问题解决
1.脚本里已经添加了集合点,但是在Controller里集合点策略是灰色的无法点击 2.问题解决: 将下图的勾选项去掉即可(系统默认是勾选上的) 去掉勾选后可以选择了:
史上最全NOIP初赛知识点
CSP-J/S 第一轮知识点选讲 $NOIP$(全国青少年信息学奥林匹克竞赛)于2019年取消.取而代之的是由$CCF$推出的非专业级软件能力认证,也就是现在的$CSP-J/S$.作为一名 ...
VIJOS-P1059 积木城堡
洛谷 P1504 积木城堡 https://www.luogu.org/problem/P1504 JDOJ 1240: VIJOS-P1059 积木城堡 https://neooj.com/oldo ...
openlayers绘制点，线，圆等
由于我的业务需求是可以在底图上进行一些操作,比如绘制电子围栏等功能,于是需要使用openlayers中的画笔功能,接下来开始一波操作还是上一篇的html页面, 直接上代码 <!doctype ...
es启动失败
Aug 09 21:43:23 10921114-elklogserver elasticsearch[30152]: 2018-08-09 21:43:23,068 main ERROR Null ...
Centos7下搭建NFS服务器与连接详解
一,环境介绍本实验使用了两台centos7虚拟机,其中服务器:192.168.1.188 客户端:192.168.1.189 二,实验步骤 192.168.1.1 ...
[LeetCode] 904. Fruit Into Baskets 水果装入果篮
In a row of trees, the i-th tree produces fruit with type tree[i]. You start at any tree of your cho ...

sklearn聚类评价指标