多分类下的ROC曲线和AUC

本文主要介绍一下多分类下的ROC曲线绘制和AUC计算，并以鸢尾花数据为例，简单用python进行一下说明。如果对ROC和AUC二分类下的概念不是很了解，可以先参考下这篇文章：http://blog.csdn.net/ye1215172385/article/details/79448575

由于ROC曲线是针对二分类的情况，对于多分类问题，ROC曲线的获取主要有两种方法：

假设测试样本个数为m，类别个数为n（假设类别标签分别为：0，2，...，n-1）。在训练完成后，计算出每个测试样本的在各类别下的概率或置信度，得到一个[m， n]形状的矩阵P，每一行表示一个测试样本在各类别下概率值（按类别标签排序）。相应地，将每个测试样本的标签转换为类似二进制的形式，每个位置用来标记是否属于对应的类别（也按标签排序，这样才和前面对应），由此也可以获得一个[m， n]的标签矩阵L。

比如n等于3，标签应转换为：

方法1：每种类别下，都可以得到m个测试样本为该类别的概率（矩阵P中的列）。所以，根据概率矩阵P和标签矩阵L中对应的每一列，可以计算出各个阈值下的假正例率（FPR）和真正例率（TPR），从而绘制出一条ROC曲线。这样总共可以绘制出n条ROC曲线。最后对n条ROC曲线取平均，即可得到最终的ROC曲线。

方法2：首先，对于一个测试样本：1）标签只由0和1组成，1的位置表明了它的类别（可对应二分类问题中的‘’正’’），0就表示其他类别（‘’负‘’）；2）要是分类器对该测试样本分类正确，则该样本标签中1对应的位置在概率矩阵P中的值是大于0对应的位置的概率值的。基于这两点，将标签矩阵L和概率矩阵P分别按行展开，转置后形成两列，这就得到了一个二分类的结果。所以，此方法经过计算后可以直接得到最终的ROC曲线。

上面的两个方法得到的ROC曲线是不同的，当然曲线下的面积AUC也是不一样的。在python中，方法1和方法2分别对应sklearn.metrics.roc_auc_score函数中参数average值为'macro'和'micro'的情况。

下面以方法1为例，直接上代码，概率矩阵P和标签矩阵L分别对应代码中的y_score和y_one_hot：

#!/usr/bin/python

# -*- coding:utf-8 -*-

import numpy as np

import pandas as pd

import matplotlib as mpl

import matplotlib.pyplot as plt

from sklearn.model_selection import train_test_split

from sklearn.linear_model import LogisticRegressionCV

from sklearn import metrics

from sklearn.preprocessing import label_binarize

if __name__ == '__main__':

    np.random.seed(0)

    data = pd.read_csv('iris.data', header = None)  #读取数据

    iris_types = data[4].unique()

    n_class = iris_types.size

    x = data.iloc[:, :2]  #只取前面两个特征

    y = pd.Categorical(data[4]).codes  #将标签转换0,1,...

    x_train, x_test, y_train, y_test = train_test_split(x, y, train_size = 0.6, random_state = 0)

    y_one_hot = label_binarize(y_test, np.arange(n_class))  #装换成类似二进制的编码

    alpha = np.logspace(-2, 2, 20)  #设置超参数范围

    model = LogisticRegressionCV(Cs = alpha, cv = 3, penalty = 'l2')  #使用L2正则化

    model.fit(x_train, y_train)

    print '超参数：', model.C_

    # 计算属于各个类别的概率，返回值的shape = [n_samples, n_classes]

    y_score = model.predict_proba(x_test)

    # 1、调用函数计算micro类型的AUC

    print '调用函数auc：', metrics.roc_auc_score(y_one_hot, y_score, average='micro')

    # 2、手动计算micro类型的AUC

    #首先将矩阵y_one_hot和y_score展开，然后计算假正例率FPR和真正例率TPR

    fpr, tpr, thresholds = metrics.roc_curve(y_one_hot.ravel(),y_score.ravel())

    auc = metrics.auc(fpr, tpr)

    print '手动计算auc：', auc

    #绘图

    mpl.rcParams['font.sans-serif'] = u'SimHei'

    mpl.rcParams['axes.unicode_minus'] = False

    #FPR就是横坐标,TPR就是纵坐标

    plt.plot(fpr, tpr, c = 'r', lw = 2, alpha = 0.7, label = u'AUC=%.3f' % auc)

    plt.plot((0, 1), (0, 1), c = '#808080', lw = 1, ls = '--', alpha = 0.7)

    plt.xlim((-0.01, 1.02))

    plt.ylim((-0.01, 1.02))

    plt.xticks(np.arange(0, 1.1, 0.1))

    plt.yticks(np.arange(0, 1.1, 0.1))

    plt.xlabel('False Positive Rate', fontsize=13)

    plt.ylabel('True Positive Rate', fontsize=13)

    plt.grid(b=True, ls=':')

    plt.legend(loc='lower right', fancybox=True, framealpha=0.8, fontsize=12)

    plt.title(u'鸢尾花数据Logistic分类后的ROC和AUC', fontsize=17)

    plt.show()

我的实战

Bnew_one1=[]

    for lis in Bnew4:

        bol=np.zeros(51)

        bol=bol.tolist()

        bol[lis[0]]=1

        Bnew_one1.append(bol)

    Blast_one=[]

    for lis in Blast:

        bol=np.zeros(51)

        bol=bol.tolist()

        bol[lis[0]]=1

        Blast_one.append(bol)

    Bnew_one1=np.array(Bnew_one1)

    Blast_one=np.array(Blast_one)

    Bnew_one=np.array(Bnew_one)

    print('调用函数auc：', metrics.roc_auc_score(Blast_one, Bnew_one1, average='micro'))

    fpr, tpr, thresholds = metrics.roc_curve(Blast_one.ravel(),Bnew_one1.ravel())

    auc = metrics.auc(fpr, tpr)

    print('手动计算auc：', auc)

    #绘图

    mpl.rcParams['font.sans-serif'] = u'SimHei'

    mpl.rcParams['axes.unicode_minus'] = False

    #FPR就是横坐标,TPR就是纵坐标

    plt.plot(fpr, tpr, c = 'r', lw = 2, alpha = 0.7, label = u'AUC=%.3f' % auc)

    plt.plot((0, 1), (0, 1), c = '#808080', lw = 1, ls = '--', alpha = 0.7)

    plt.xlim((-0.01, 1.02))

    plt.ylim((-0.01, 1.02))

    plt.xticks(np.arange(0, 1.1, 0.1))

    plt.yticks(np.arange(0, 1.1, 0.1))

    plt.xlabel('False Positive Rate', fontsize=13)

    plt.ylabel('True Positive Rate', fontsize=13)

    plt.grid(b=True, ls=':')

    plt.legend(loc='lower right', fancybox=True, framealpha=0.8, fontsize=12)

    plt.title(u'大类问题一分类后的ROC和AUC', fontsize=17)

    plt.show()

多分类下的ROC曲线和AUC的更多相关文章

【分类模型评判指标二】ROC曲线与AUC面积
转自:https://blog.csdn.net/Orange_Spotty_Cat/article/details/80499031 略有改动,仅供个人学习使用简介 ROC曲线与AUC面积均是用来 ...
机器学习之分类器性能指标之ROC曲线、AUC值
分类器性能指标之ROC曲线.AUC值一 roc曲线 1.roc曲线:接收者操作特征(receiveroperating characteristic),roc曲线上每个点反映着对同一信号刺激的感受性 ...
ROC曲线、AUC、Precision、Recall、F-measure理解及Python实现
本文首先从整体上介绍ROC曲线.AUC.Precision.Recall以及F-measure,然后介绍上述这些评价指标的有趣特性,最后给出ROC曲线的一个Python实现示例. 一.ROC曲线.AU ...
ROC曲线的AUC（以及其他评价指标的简介）知识整理
相关评价指标在这片文章里有很好介绍信息检索(IR)的评价指标介绍 - 准确率.召回率.F1.mAP.ROC.AUC:http://blog.csdn.net/marising/article/det ...
混淆矩阵、准确率、精确率/查准率、召回率/查全率、F1值、ROC曲线的AUC值
准确率.精确率(查准率).召回率(查全率).F1值.ROC曲线的AUC值,都可以作为评价一个机器学习模型好坏的指标(evaluation metrics),而这些评价指标直接或间接都与混淆矩阵有关,前 ...
ROC曲线，AUC面积
AUC(Area under Curve):Roc曲线下的面积,介于0.1和1之间.Auc作为数值可以直观的评价分类器的好坏,值越大越好. 首先AUC值是一个概率值,当你随机挑选一个正样本以及负样本, ...
ROC曲线和AUC值（转）
http://www.cnblogs.com/dlml/p/4403482.html 分类器性能指标之ROC曲线.AUC值一 roc曲线 1.roc曲线:接收者操作特征(receiveroperat ...
混淆矩阵、准确率、召回率、ROC曲线、AUC
混淆矩阵.准确率.召回率.ROC曲线.AUC 假设有一个用来对猫(cats).狗(dogs).兔子(rabbits)进行分类的系统,混淆矩阵就是为了进一步分析性能而对该算法测试结果做出的总结.假设总共 ...
机器学习常见的几种评价指标：精确率（Precision）、召回率（Recall）、F值（F-measure）、ROC曲线、AUC、准确率（Accuracy）
原文链接:https://blog.csdn.net/weixin_42518879/article/details/83959319 主要内容:机器学习中常见的几种评价指标,它们各自的含义和计算(注 ...

随机推荐

zoj 2966 Build The Electric System（最小生成树）
Build The Electric System Time Limit: 2 Seconds Memory Limit: 65536 KB In last winter, there wa ...
201621123005《Java程序设计》第四周学习总结
201621123005<Java程序设计>第四周学习总结标签(空格分隔): 1.本章学习总结 1. 面向对象设计 1.1 写出你认为本周学习中比较重要的知识点关键词继承.多态.覆盖. ...
APUE学习笔记——5.2流与文件对象、fwide
1 流当一个文件被打开时,可以获得文件描述符.通过文件描述符可以对文件进行I/O操作.而I/O操作是通过流完成的. 流的定向: 在Unix系统中,使用 ASCII标准 ...
c# 字符串验证（邮箱、电话、数字、ip、身份证等）
using System; using System.Text.RegularExpressions; namespace HuaTong.General.Utility { /// <summ ...
Spring核心概念（一）
1.解决JavaEE的轻量级框架. 2.环境搭建第一步:导入spring的jar包第二步:导入配置文件(一般写在resource下面) 第三步:创建一个类(bean) 第四步:在主配置文件中注入这 ...
eclipsec常用快捷键
Eclipse常用快捷键 1几个最重要的快捷键代码助手:Ctrl+Space(简体中文操作系统是Alt+/)快速修正:Ctrl+1单词补全:Alt+/打开外部Java文档:Shift+F2 显示搜索 ...
String.prototype.getParm
String.prototype.getParms=function(name){ var reg = new RegExp('(^|&)' + name + '=([^&]*)(&a ...
QUnit使用
什么是单元测试每个单元测试就是一段用于测试一个模块或接口是否能达到预期结果的代码. QUnitjs 概念Qunit是一款强大的用于帮助调试代码的,JavaScript单元测试框架.是jQuery的官 ...
Android Kill Process
/********************************************************************** * Android Kill Process * 说明: ...
OK335xS 系统启动配置解析
OK335xS 系统启动配置解析一.参考文档: AM335x ARM® Cortex™-A8 Microprocessors (MPUs) Technical Reference Manual 二. ...

多分类下的ROC曲线和AUC

多分类下的ROC曲线和AUC的更多相关文章

随机推荐

热门专题