基于python 信用卡评分系统的数据分析

import pandas as pd

import matplotlib.pyplot as plt #导入图像库

from sklearn.ensemble import RandomForestRegressor

# 用随机森林对缺失值预测填充函数

def set_missing(df):

    # 把已有的数值型特征取出来

    process_df = df.ix[:,[5,0,1,2,3,4,6,7,8,9]]

    # 分成已知该特征和未知该特征两部分

    known = process_df[process_df.MonthlyIncome.notnull()].as_matrix()

    unknown = process_df[process_df.MonthlyIncome.isnull()].as_matrix()

    # X为特征属性值

    X = known[:, 1:]

    # y为结果标签值

    y = known[:, 0]

    # fit到RandomForestRegressor之中

    rfr = RandomForestRegressor(random_state=0, n_estimators=200,max_depth=3,n_jobs=-1)

    rfr.fit(X,y)

    # 用得到的模型进行未知特征值预测

    predicted = rfr.predict(unknown[:, 1:]).round(0)

    print(predicted)

    # 用得到的预测结果填补原缺失数据

    df.loc[(df.MonthlyIncome.isnull()), 'MonthlyIncome'] = predicted

    return df

data = pd.read_csv(r'E:\Python\Source\CreditScore\cs-training.csv')

process_df = data.iloc[:,[5,0,1,2,3,4,6,7,8,9]]

known = process_df[process_df.MonthlyIncome.notnull()].as_matrix()

unknown = process_df[process_df.MonthlyIncome.isnull()].as_matrix()

X = known[:, 1:]

y = known[:, 0]

# fit到RandomForestRegressor之中

rfr = RandomForestRegressor(random_state=0, n_estimators=200,max_depth=3,n_jobs=-1)

rfr.fit(X,y)

# 用得到的模型进行未知特征值预测

predicted = rfr.predict(unknown[:, 1:]).round(0)

print(predicted)

data.loc[(data.MonthlyIncome.isnull()), 'MonthlyIncome'] = predicted

[8311. 1159. 8311. ... 1159. 2554. 2554.]

data=data.dropna()#删除比较少的缺失值

data = data.drop_duplicates()#删除重复项

#异常值处理

#x1 = data["age"]

x2 = data["RevolvingUtilizationOfUnsecuredLines"]

x3 = data["DebtRatio"]

fig = plt.figure(1)

ax = fig.add_subplot(111)

ax.boxplot([x2,x3])

ax.set_xticklabels(["RevolvingUtilizationOfUnsecuredLines","DebtRatio"])

Out[48]:

[Text(0,0,'RevolvingUtilizationOfUnsecuredLines'), Text(0,0,'DebtRatio')]

#异常值处理

data = data[data["age"] > 0]

data = data[data['NumberOfTime30-59DaysPastDueNotWorse'] < 90]#剔除异常值

# 好坏客户的整体分析

data['SeriousDlqin2yrs']=1-data['SeriousDlqin2yrs']

grouped = data["SeriousDlqin2yrs"].groupby(data["SeriousDlqin2yrs"]).count()

print("坏客户占比：{:.2%}".format(grouped[0]/grouped[1]))

print(grouped)

grouped.plot(kind="bar")

坏客户占比：7.16%

SeriousDlqin2yrs

0      9706

1    135648

Name: SeriousDlqin2yrs, dtype: int64

Out[54]:

<matplotlib.axes._subplots.AxesSubplot at 0x126eecc0>

 Y = data['SeriousDlqin2yrs']

本文通过对kaggle上的Give Me Some Credit数据的挖掘分析，结合信用评分卡的建立原理，从数据的预处理、变量选择、建模分析到创建信用评分，创建了一个简单的信用评分系统。本项目还有许多不足之处，比如分箱应当使用最优分箱或卡方分箱，减少人为分箱的随机性，此外模型采用的是逻辑回归算法，还可以多多尝试其他模型。

基于python 信用卡评分系统的数据分析的更多相关文章

基于Python实现的系统SLA可用性统计
基于Python实现的系统SLA可用性统计 1. 介绍 SLA是Service Level Agreement的英文缩写,也叫服务质量协议.根据SRE Google运维解密一书中的定义: SLA是服务 ...
数据分析：基于Python的自定义文件格式转换系统
*:first-child { margin-top: 0 !important; } body>*:last-child { margin-bottom: 0 !important; } /* ...
基于Python的信用评分卡模型分析（二）
上一篇文章基于Python的信用评分卡模型分析(一)已经介绍了信用评分卡模型的数据预处理.探索性数据分析.变量分箱和变量选择等.接下来我们将继续讨论信用评分卡的模型实现和分析,信用评分的方法和自动评分 ...
基于Python的信用评分卡模型分析（一）
信用风险计量体系包括主体评级模型和债项评级两部分.主体评级和债项评级均有一系列评级模型组成,其中主体评级模型可用“四张卡”来表示,分别是A卡.B卡.C卡和F卡:债项评级模型通常按照主体的融资用途,分为 ...
基于Python的数据分析(2)：字符串编码
在上一篇文章<基于Python的数据分析(1):配置安装环境>中的第四个步骤中我们在python的启动步骤中强制要求加载sitecustomize.py文件并设置其默认编码为"u ...
【Machine Learning】决策树案例：基于python的商品购买能力预测系统
决策树在商品购买能力预测案例中的算法实现作者:白宁超 2016年12月24日22:05:42 摘要:随着机器学习和深度学习的热潮,各种图书层出不穷.然而多数是基础理论知识介绍,缺乏实现的深入理解.本 ...
基于Python的数据分析(1)：配置安装环境
数据分析是一个历史久远的东西,但是直到近代微型计算机的普及,数据分析的价值才得到大家的重视.到了今天,数据分析已经成为企业生产运维的一个核心组成部分. 据我自己做数据分析的经验来看,目前数据分析按照使 ...
性能测试基于Python结合InfluxDB及Grafana图表实时监控Android系统和应用进程
基于Python结合InfluxDB及Grafana图表实时监控Android系统和应用进程 By: 授客 QQ:1033553122 1．测试环境 2．实现功能 3．使用前提 4． ...
基于 Python 和 Pandas 的数据分析(1)
基于 Python 和 Pandas 的数据分析(1) Pandas 是 Python 的一个模块(module), 我们将用 Python 完成接下来的数据分析的学习. Pandas 模块是一个高性 ...

随机推荐

基于人工智能标记语言 (AIML)和任务型对话系统(Task)的深度智能对话机器人demo
起因本demo基于基于人工智能标记语言 (AIML)和开放域问答(WebQA)的深度智能对话模型而来无意间发现一个基于人工智能标记语言 (AIML)和开放域问答(WebQA)的深度智能对话模型,但 ...
Java四舍五入保留n位小数的常用写法
1. 使用BigDecimal double v = 1.233; double res = new BigDecimal(v).setScale(2, RoundingMode.HALF_UP).d ...
ASP.NET与.NET Framework和C#的关系
你好,是我琉忆. 今天我们讲一讲ASP.NET与.NET Framework和C#的关系. 在开始介绍ASP.NET之前,我们需要先了解以下运行ASP.NET的开发平台.NET框架.如果你之前学过C# ...
Spring高级特性之四：FactoryBean和BeanFactory
FactoryBean和BeanFactory两只是两个单词顺序不同但是内容大不相同.落脚点在后面一个单词,前面一个单词是其功能描述:FactoryBean--工厂bean,一个建工厂的bean?Be ...
JVM性能调优与实战进阶篇-上
ZGC 诞生原因 Java生态非常强大,但还不够,有些场景仍处于劣势,而ZGC的出现可以让Java语言抢占其他语言的某些特定领域市场.比如谷歌主导的Android手机系统显示卡顿. 证券交易市场,实 ...
CVE-2021-40449 NtGdiResetDC UAF
背景 CVE-2021-40449是一个存在于Win32k内核驱动中的UAF漏洞.该漏洞在2021年八月下旬九月上旬被Kaspersky发现用于野外攻击活动中.通过Hook win32k驱动执行N ...
centos7云服务器安装nginx记录
nginx作为一个web和反向服务器,应用广泛,尤其适合学习c/c++的人进行使用学习,今天就对这个我听了很多的nginx进行了一次安装配置,主要是针对菜鸟教程中的安装引导进行的个人试验.主要的关注点 ...
2021年国内外五大BI厂商_商业智能工具推荐
每家公司对于BI工具的使用都有自己的特点和期望,所以当面对国内外那么多的BI厂商时,大家可能会觉得难以选择.今天我将会为大家介绍国内外五大BI厂商,对于它们做出一些分析,让大家更了解这些BI厂商. ...
给npm换源
为什么要换源? npm 官方站点 http://www.npmjs.org/ 并没有被墙,但是下载第三方依赖包的速度让人着急啊! 幸运的是,国内有几个镜像站点可以供我们使用,本人在使用 http:// ...
小记：音频格式转化ByPython（下）
上文中我们已经大致明白了pydub库的使用方法,今天的目标是写个爬虫爬取歌曲信息. 关于网络爬虫,Python的标准库里是有相应的包的,可以直接打开:https://docs.python.org/z ...

基于python 信用卡评分系统 的数据分析

基于python 信用卡评分系统 的数据分析

基于python 信用卡评分系统 的数据分析的更多相关文章

随机推荐

热门专题

基于python 信用卡评分系统的数据分析

基于python 信用卡评分系统的数据分析

基于python 信用卡评分系统的数据分析的更多相关文章