样本稳定指数PSI

　　信用评定等级划分之后需要对评级的划分做出评价，分析这样的评级划分结果是否具有实用价值，即分析样本分布的稳定程度。样本分布稳定，则信用评定等级划分结果的实用价值就高。采用样本稳定指数（ PSI ）检验样本分布的稳定程度，若训练样本和测试样本在分布上表现一致，样本稳定指数的取值就会接近于零，信用评级划分结果的可靠性就会很高；若训练样本和测试样本在分布上差异很大，样本稳定指数的取值就会变大，信用评级划分结果的可靠性就会很低。样本稳定指数大于 0.10 ，即认为训练样本和测试样本分布上发生了轻微的改变；样本稳定指数大于 0.25 ，认为训练样本和测试样本分布上发生了比较明显的改变，应该警惕。

K 代表信用等级数，p_i1 代表训练样本在第 i 个信用等级上的违约概率，p_i2代表测试样本在第 i 个信用等级上的违约概率。

import numpy as np

y1_train_prob = np.array([0.1,0.7,0.7,0.3,0.5,0.8])

y1_pred_prob = np.array([0.1,0.4,0.1])

def psi(y1_train_prob,y1_pred_prob,k=8,eps=1e-10):

    """

    param y1_train_prob:训练数据预测1的概率

    param y1_pred_prob: 预测数据预测1的概率

    param k: 等级个数

    param eps:数值稳定系数

    return :psi

    """

    y1_train_prob = np.sort(y1_train_prob)

    y1_pred_prob  = np.sort(y1_pred_prob)

    len_train = len(y1_train_prob)

    len_pred  = len(y1_pred_prob)

    num_K_train = [] #训练样本每个信用等级的计数占比

    num_K_test  = [] #预测样本每个信用等级的计数占比

    i = 0

    while i<=1:

        temp1 = len(y1_train_prob[y1_train_prob<(i+1/k)])-len(y1_train_prob[y1_train_prob<i])

        num_K_train.append(temp1/len_train)
 

        temp2 = len(y1_pred_prob[y1_pred_prob<(i+1/k)])-len(y1_pred_prob[y1_pred_prob<i])

        num_K_test.append(temp2/len_pred)

        i= i+1/k        

    Sum = 0.0 #存储psi值

    for i in range(k):

        left = num_K_train[i]-num_K_test[i]

        right = (num_K_train[i]+eps)/(num_K_test[i]+eps)

        Sum = Sum + left*np.log(right)

    return round(Sum,3)        

psi(y1_train_prob,y1_pred_prob,k=10)

样本稳定指数PSI的更多相关文章

【机器学习PAI实践十二】机器学习算法基于信用卡消费记录做信用评分
背景如果你是做互联网金融的,那么一定听说过评分卡.评分卡是信用风险评估领域常用的建模方法,评分卡并不简单对应于某一种机器学习算法,而是一种通用的建模框架,将原始数据通过分箱后进行特征工程变换,继而应 ...
PSi-Population Stability Index (PSI)
python信用评分卡(附代码,博主录制) https://study.163.com/course/introduction.htm?courseId=1005214003&utm_camp ...
模型稳定度指标PSI与IV
由于模型是以特定时期的样本所开发的,此模型是否适用于开发样本之外的族群,必须经过稳定性测试才能得知.稳定度指标(population stability index ,PSI)可衡量测试样本及模型开发 ...
模型稳定性指标—PSI
由于模型是以特定时期的样本所开发的,此模型是否适用于开发样本之外的族群,必须经过稳定性测试才能得知.稳定度指标(population stability index ,PSI)可衡量测试样本及模型开发 ...
模型监控指标- 混淆矩阵、ROC曲线，AUC值，KS曲线以及KS值、PSI值，Lift图，Gain图，KT值，迁移矩阵
1. 混淆矩阵确定截断点后,评价学习器性能假设训练之初以及预测后,一个样本是正例还是反例是已经确定的,这个时候,样本应该有两个类别值,一个是真实的0/1,一个是预测的0/1 TP(实际为正预测为正 ...
信贷风控模型开发----模型流程&好坏样本定义
第二章模型开发流程&好坏样本定义 2.1模型开发流程 2.1.1 评分模型流程图 2.1.2流程图阐述该小结提出了一些数据指标,如果不明白没有关系,往后的文章笔者会一个个地解释这些指标的含 ...
【转】风控中的特征评价指标（二）——PSI
转自:https://zhuanlan.zhihu.com/p/79682292 风控业务背景在风控中,稳定性压倒一切.原因在于,一套风控模型正式上线运行后往往需要很久(通常一年以上)才会被替换下线 ...
SQL->Python->PySpark计算KS，AUC及PSI
KS,AUC 和 PSI 是风控算法中最常计算的几个指标,本文记录了多种工具计算这些指标的方法. 生成本文的测试数据: import pandas as pd import numpy as np i ...
一个windows下的ddos样本
一个windows下的ddos样本. 加载器程序运行之后会在临时目录释放出一个256_res.tmp的文件之后将该文件移动至system32目录下,以rasmedia.dll命名. 删除原文件. ...

随机推荐

select into from和insert into from
最近在研究oracle function 时发现select into from和insert into from,这样的语句,于是上网查阅资料学习了一下, 原来两种表达式均可以达到复制整个表或表的一 ...
关于Oracle的一些基础知识以及注意事项
一.oracle基础 1.1 DDL(Data Definition Language) 数据定义语言 create drop,desc(注意,此操作只能在PL/SQL Developer的命令窗户执 ...
使用easyui将json数据生成数据表格
1.首先需要用script引入jquery和easyui文件.如图所示: 2.html页面设置如下: data-options里面设置的属性可根据需要自己定义,是否单选,是否设置分页等等. 3.引入e ...
SWIFT用ScrollView加图片制作Banner
网上参考OBJC写的用ScrollView图片轮播效果,照着画了个,先上效果图: 附上代码: @IBOutlet weak var pc: UIPageControl! @IBOutlet weak ...
C高级第三次作业（1）
6-1 输出月份英文名 1.设计思路: 1.定义一个字符串数组将12个月的英文加进去: 2.判断输入的数是否大于等于1小于等于12: 3.若是则返还s[n-1]; 4.否则返还NULL: 源代码: ...
判断颜色信息-RGB2HSV（opencv）
前言项目车号识别过程中,车体有三种颜色黑车黑底白字.红车红底白字.绿车黄底绿字,可以通过判断车体的颜色信息,从而判断二值化是否需要反转,主要是基于rgb2hsv函数进行不同颜色的阈值判断. matl ...
hdu2073-2078
hdu2073 数学 #include<stdio.h> #include<math.h> double len(double x){ )*(x+)); } int main( ...
nginx unit nodejs 模块试用
unit 对于nodejs 的支持是在10.25 发布的,基本能用,但是依然有好多问题,当前在测试的时候就发现,请求之后会block , 相关的issue 已经有人反馈了,最好使用源码编译,方便测 ...
C# winform 使用DsoFramer 创建显示office 文档
使用微软DsoFramer 组件创建,显示office 1. DsoFramer 组件的介绍 dsoframer是微软提供一款开源的用于在线编辑.调用Word. Excel .PowerPoint等 ...
socket、tcp/ip协议、udp协议
socket通常也称作"套接字",用于描述IP地址和端口,是一个通信链的句柄,应用程序通常通过"套接字"向网络发出请求或者应答网络请求. socket起源于Un ...

样本稳定指数PSI

样本稳定指数PSI的更多相关文章

随机推荐

热门专题