SKlearn库学习曲线

思想：

# 1.现将所有样本用交叉验证方法或者（随机抽样方法) 得到 K对训练集-验证集
# 2.依次对K个训练集，拿出数量不断增加的子集如m个，并在这些K*m个子集上训练模型。
# 3.依次在对应训练集子集、验证集上计算得分。
# 4.对每种大小下的子集，计算K次训练集得分均值和K次验证集得分均值，共得到m对值。
# 5.绘制学习率曲线。x轴训练集样本量，y轴模型得分或预测准确率。

用到的方法：

learning_curve #直接得到1个模型在不同训练集大小参数下：1.训练集大小 2.训练得分 3.测试得分

ShuffleSplit #实现交叉验证、或随机抽样划分不同的训练集合验证集

plt.fill_between

python代码：

import numpy as np

from sklearn.model_selection import learning_curve, ShuffleSplit

from sklearn.datasets import load_digits

from sklearn.naive_bayes import GaussianNB

from sklearn import svm

import matplotlib.pyplot as plt

def plot_learning_curve(estimator, title, X, y, ylim=None, cv=None,n_jobs=1, train_size=np.linspace(.1, 1.0, 5 )):

    if __name__ == '__main__':

        plt.figure()

        plt.title(title)

        if ylim is not None:

            plt.ylim(*ylim)

        plt.xlabel('Training example')

        plt.ylabel('score')

        train_sizes, train_scores, test_scores = learning_curve(estimator, X, y, cv=cv, n_jobs=n_jobs, train_sizes=train_size)

        train_scores_mean = np.mean(train_scores, axis=1)

        train_scores_std = np.std(train_scores, axis=1)

        test_scores_mean = np.mean(test_scores, axis=1)

        test_scores_std = np.std(test_scores, axis=1)

        plt.grid()#区域

        plt.fill_between(train_sizes, train_scores_mean - train_scores_std,

                         train_scores_mean + train_scores_std, alpha=0.1,

                         color="r")

        plt.fill_between(train_sizes, test_scores_mean - test_scores_std,

                         test_scores_mean + test_scores_std, alpha=0.1,

                         color="g")

        plt.plot(train_sizes, train_scores_mean, 'o-', color='r',

                 label="Training score")

        plt.plot(train_sizes, test_scores_mean,'o-',color="g",

                 label="Cross-validation score")

        plt.legend(loc="best")

        return plt

digits = load_digits()

X = digits.data

y = digits.target

cv = ShuffleSplit(n_splits=100, test_size=0.2, random_state=0)#切割100ci

estimator = GaussianNB()

title = "Learning Curves(naive_bayes)"

plot_learning_curve(estimator, title, X, y, ylim=(0.7, 1.01), cv=cv, n_jobs=4)  

title = "Learning Curves(SVM,RBF kernel, $\gamma=0.001$)"

cv = ShuffleSplit(n_splits=10, test_size=0.2, random_state=0)#交叉验证传入别的方法，而不是默认的k折交叉验证

estimator = svm.SVC(gamma=0.001)

plot_learning_curve(estimator, title, X, y, (0.7, 1.01), cv=cv, n_jobs=4)

plt.show()

结果：

说明：

1. 贝叶斯模型上，训练集规模达到1100时已经比较合适，太小的话会导致过拟合。。总的来看，该模型的准确率趋向于0.85

2. SVM模型上，训练集规模到800时已经比较合适，太小的话会导致训练集无代表性，对验证集无预测能力。。。总的来看，该模型在这份数据上的表现比第一个好。

参考

http://www.360doc.com/content/18/0424/22/50223086_748481549.shtml

SKlearn库学习曲线的更多相关文章

2.sklearn库中的标准数据集与基本功能
sklearn库中的标准数据集与基本功能下面我们详细介绍几个有代表性的数据集: 当然同学们也可以用sklearn机器学习函数来挖掘这些数据,看看可不可以捕捉到一些有趣的想象或者是发现: 波士顿房价数 ...
1.sklearn库的安装
sklearn库 sklearn是scikit-learn的简称,是一个基于Python的第三方模块.sklearn库集成了一些常用的机器学习方法,在进行机器学习任务时,并不需要实现算法,只需要简单的 ...
day-10 sklearn库实现SVM支持向量算法
学习了SVM分类器的简单原理,并调用sklearn库,对40个线性可分点进行训练,并绘制出图形画界面. 一.问题引入如下图所示,在x,y坐标轴上,我们绘制3个点A(1,1),B(2,0),C(2,3 ...
复盘一篇讲sklearn库学习文章(上)
认识 sklearn 官网地址: https://scikit-learn.gor/stable/ 从2007年发布以来, scikit-learn已成为重要的Python机器学习库, 简称sklea ...
Python: sklearn库——数据预处理
Python: sklearn库 —— 数据预处理数据集转换之预处理数据: 将输入的数据转化成机器学习算法可以使用的数据.包含特征提取和标准化. 原因:数据集的标准化(服从均值为 ...
Python机器学习笔记：sklearn库的学习
网上有很多关于sklearn的学习教程,大部分都是简单的讲清楚某一方面,其实最好的教程就是官方文档. 官方文档地址:https://scikit-learn.org/stable/ (可是官方文档非常 ...
python3安装pandas执行pip3 install pandas命令后卡住不动的问题及安装scipy、sklearn库的numpy.distutils.system_info.NotFoundError: no lapack/blas resources found问题
一直尝试在python3中安装pandas等一系列软件,但每次执行pip3 install pandas后就卡住不动了,一直停在那,开始以为是pip命令的版本不对,还执行过 python -m pip ...
day-9 sklearn库和python自带库实现最近邻KNN算法
K最近邻(k-Nearest Neighbor,KNN)分类算法,是一个理论上比较成熟的方法,也是最简单的机器学习算法之一.该方法的思路是:如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的 ...
Sklearn库例子——决策树分类
Sklearn上关于决策树算法使用的介绍:http://scikit-learn.org/stable/modules/tree.html 1.关于决策树:决策树是一个非参数的监督式学习方法,主要用于 ...

随机推荐

spring环境测试
比如有个service类:(再建个接口类) package com.tydic.jtcrm.batch.service.impl; import java.util.Map; import javax ...
kubernetes Dashboard 使用RBAC 权限认证控制
kubernetes RBAC实战环境准备先用kubeadm安装好kubernetes集群,[包地址在此](https://market.aliyun.com/products/56014009/ ...
js动画最佳实现——requestAnimationFrame
我们经常用setInterval来实现动画,其实这种做法不是太好,因为不同浏览器的刷新频率也不一样(一般认为设置16为最佳,按每秒60帧算,1000/60≍16.67) var dis = 0,tim ...
ARP协议原理学习
一.ARP的作用. 首先在window 的命令行中输入arp -a即可查看本机的arp缓存表.主机要发送数据包时,需要填充目的IP及其IP地址对应的MAC.当我们只有目的IP地址时,如何得到其对应的M ...
JAVA记录-基础常识
1.==与equals区别 1)==用于基本数据类型的比较,判断引用是否指向堆内存的同一地址.---引用地址 2)equals用于判断两个变量是否是对同一对象的引用,即堆中的内容是否相同,返回值为布尔 ...
xml/map转换器,递归设计思路【纯原】
xml/map转换器 xml转换: xml/map转换器 xml合并: xml合并 snagit图片:http://pan.baidu.com/s/1nuKJD13 git样例: https://gi ...
URL基本结构
先来简单说下URI.URL.URN这三个鬼东西. URI全称Uniform Resource Identifier,统一资源标识符 URL全称Uniform Resource Locator,统一资源 ...
【转】LR分析法
转自:http://guanjy0129.blog.163.com/blog/static/1115494452010614113333509/ LR分析法的归约过程是规范推导的逆过程,所以LR分析过 ...
ZRender
https://ecomfe.github.io/zrender-doc/public/
.NET面试题系列（十三）Lucene底层原理
索引原理全文检索技术由来已久,绝大多数都基于倒排索引来做,曾经也有过一些其他方案如文件指纹.倒排索引,顾名思义,它相反于一篇文章包含了哪些词,它从词出发,记载了这个词在哪些文档中出现过,由两部分组成 ...

SKlearn库学习曲线

SKlearn库学习曲线的更多相关文章

随机推荐

热门专题