sklearn.datasets模块主要提供了一些导入、在线下载及本地生成数据集的方法,可以通过dir或help命令查看,我们会发现主要有三种形式:load_<dataset_name>、fetch_<dataset_name>及make_<dataset_name>的方法

① datasets.load_<dataset_name>:sklearn包自带的小数据集

  1. In [2]: datasets.load_*?
  2. datasets.load_boston#波士顿房价数据集
  3. datasets.load_breast_cancer#乳腺癌数据集
  4. datasets.load_diabetes#糖尿病数据集
  5. datasets.load_digits#手写体数字数据集
  6. datasets.load_files
  7. datasets.load_iris#鸢尾花数据集
  8. datasets.load_lfw_pairs
  9. datasets.load_lfw_people
  10. datasets.load_linnerud#体能训练数据集
  11. datasets.load_mlcomp
  12. datasets.load_sample_image
  13. datasets.load_sample_images
  14. datasets.load_svmlight_file
  15. datasets.load_svmlight_files

数据集文件在sklearn安装目录下datasets\data文件下

②datasets.fetch_<dataset_name>:比较大的数据集,主要用于测试解决实际问题,支持在线下载

  1. In [3]: datasets.fetch_*?
  2. datasets.fetch_20newsgroups
  3. datasets.fetch_20newsgroups_vectorized
  4. datasets.fetch_california_housing
  5. datasets.fetch_covtype
  6. datasets.fetch_kddcup99
  7. datasets.fetch_lfw_pairs
  8. datasets.fetch_lfw_people
  9. datasets.fetch_mldata
  10. datasets.fetch_olivetti_faces
  11. datasets.fetch_rcv1
  12. datasets.fetch_species_distributions

下载下来的数据,默认保存在~/scikit_learn_data文件夹下,可以通过设置环境变量SCIKIT_LEARN_DATA修改路径,datasets.get_data_home()获取下载路径

  1. In [5]: datasets.get_data_home()
  2. Out[5]: 'G:\\datasets'

③datasets.make_*?:构造数据集

  1. In [4]: datasets.make_*?
  2. datasets.make_biclusters
  3. datasets.make_blobs
  4. datasets.make_checkerboard
  5. datasets.make_circles
  6. datasets.make_classification
  7. datasets.make_friedman1
  8. datasets.make_friedman2
  9. datasets.make_friedman3
  10. datasets.make_gaussian_quantiles
  11. datasets.make_hastie_10_2
  12. datasets.make_low_rank_matrix
  13. datasets.make_moons
  14. datasets.make_multilabel_classification
  15. datasets.make_regression
  16. datasets.make_s_curve
  17. datasets.make_sparse_coded_signal
  18. datasets.make_sparse_spd_matrix
  19. datasets.make_sparse_uncorrelated
  20. datasets.make_spd_matrix
  21. datasets.make_swiss_roll

下面以make_regression()函数为例,首先看看函数语法:

make_regression(n_samples=100, n_features=100, n_informative=10, n_targets=1, bias=0.0, effective_rank=None, tail_strength=0.5, noise=0.0, shuffle=True, coef=False, random_state=None)

参数说明:

n_samples:样本数

n_features:特征数(自变量个数)

n_informative:相关特征(相关自变量个数)即参与了建模型的特征数

n_targets:因变量个数

bias:偏差(截距)

coef:是否输出coef标识

  1. In [7]: data = datasets.make_regression(5,3,2,2,1.0,coef=True)
  2. ...: data
  3. ...:
  4. Out[7]:
  5. (array([[-0.64470031,  2.24028402, -2.26147027],
  6. [-0.09554589,  1.4653344 , -0.8882202 ],
  7. [-1.36214673,  0.08935031,  0.66733545],
  8. [-1.30553824,  1.62553382,  0.65693763],
  9. [-0.81528358,  0.81659886,  1.32412053]]),
  10. array([[ 177.32114822,  -42.34640341],
  11. [ 127.51997766,   -1.98105497],
  12. [ -37.82547178, -104.69214796],
  13. [ 100.19123506,  -95.62163254],
  14. [  45.35860387,  -59.94143654]]),
  15. array([[ 34.3135368 ,  77.79161196],
  16. [ 88.57943632,   3.03795085],
  17. [  0.        ,   0.        ]]))

上述输出结果:元组中的三个数组分别对应输入数据X,输出数据y,coef对应数组

sklearn datasets模块学习的更多相关文章

  1. sklearn dataset 模块学习

    sklearn.datasets官网:http://scikit-learn.org/stable/datasets/ sklearn.datasets 模块主要提供一些导入.在线下载及本地生成数据集 ...

  2. Scikit-Learn模块学习笔记——数据集模块datasets

    scikit-learn 的 datasets 模块包含测试数据相关函数,主要包括三类: datasets.load_*():获取小规模数据集.数据包含在 datasets 里 datasets.fe ...

  3. (数据科学学习手札21)sklearn.datasets常用功能详解

    作为Python中经典的机器学习模块,sklearn围绕着机器学习提供了很多可直接调用的机器学习算法以及很多经典的数据集,本文就对sklearn中专门用来得到已有或自定义数据集的datasets模块进 ...

  4. Python机器学习笔记:sklearn库的学习

    网上有很多关于sklearn的学习教程,大部分都是简单的讲清楚某一方面,其实最好的教程就是官方文档. 官方文档地址:https://scikit-learn.org/stable/ (可是官方文档非常 ...

  5. Python —— sklearn.feature_selection模块

    Python —— sklearn.feature_selection模块 sklearn.feature_selection模块的作用是feature selection,而不是feature ex ...

  6. 使用sklearn进行集成学习——实践

    系列 <使用sklearn进行集成学习——理论> <使用sklearn进行集成学习——实践> 目录 1 Random Forest和Gradient Tree Boosting ...

  7. 使用sklearn进行集成学习——理论

    系列 <使用sklearn进行集成学习——理论> <使用sklearn进行集成学习——实践> 目录 1 前言2 集成学习是什么?3 偏差和方差 3.1 模型的偏差和方差是什么? ...

  8. Day5 - Python基础5 常用模块学习

    Python 之路 Day5 - 常用模块学习   本节大纲: 模块介绍 time &datetime模块 random os sys shutil json & picle shel ...

  9. [转]使用sklearn进行集成学习——理论

    转:http://www.cnblogs.com/jasonfreak/p/5657196.html 目录 1 前言2 集成学习是什么?3 偏差和方差 3.1 模型的偏差和方差是什么? 3.2 bag ...

随机推荐

  1. SignalR 中使用 MessagePack 序列化提高 WebSocket 通信性能

    It's like JSON.but fast and small. MessagePack is an efficient binary serialization format. It lets ...

  2. Xcode 8.X Command Line Tools

    Summary Step 1. Upgrade Your System to macOS Sierra Step 2. Open the Terminal Application Step 3. Is ...

  3. MySQL 5.7最新版本的2个bug

    好久没写博客了,都长草了.新业务上了5.7没遇到什么问题,虽然没遇到什么问题,但不代表没有问题,我有个习惯就是没事就喜欢逛逛percona的Blog,于是看到目前最新GA版本5.7.17的2个bug, ...

  4. Java并发编程笔记之ConcurrentHashMap原理探究

    在多线程环境下,使用HashMap进行put操作时存在丢失数据的情况,为了避免这种bug的隐患,强烈建议使用ConcurrentHashMap代替HashMap. HashTable是一个线程安全的类 ...

  5. JDK源码分析之hashmap就这么简单理解

    一.HashMap概述 HashMap是基于哈希表的Map接口实现,此实现提供所有可选的映射操作,并允许使用null值和null键.HashMap与HashTable的作用大致相同,但是它不是线程安全 ...

  6. zookeeper ZAB协议 Follower和leader源码分析

    Follower处理逻辑 void followLeader() throws InterruptedException { //... try { //获取leader server QuorumS ...

  7. 附实例!实现iframe父窗体与子窗体的通信

    欢迎大家前往腾讯云+社区,获取更多腾讯海量技术实践干货哦~ 本文由前端林子发表于云+社区专栏 本文主要会介绍如何基于MessengerJS,实现iframe父窗体与子窗体间的通信,传递数据信息.同时本 ...

  8. Sharepoint 2010 工作流状态值

    在Sharepoint2010中,如果要使用工作流状态值进行筛选,必须使用内部值,不能使用文字,要不然是筛选不出来的. 进行中:2 已取消:4 已批准:16 拒绝:17 下边是已取消的工作流状态:

  9. 浅谈c#的三个高级参数ref out 和Params

    c#的三个高级参数ref out 和Params 前言:在我们学习c#基础的时候,我们会学习到c#的三个高级的参数,分别是out .ref 和Params,在这里我们来分别的讲解一下,在这里的我们先不 ...

  10. 检测到是移动端还是PC端进入页面,加载不同样式表现

    if(/AppleWebKit.*mobile/i.test(navigator.userAgent) || (/MIDP|SymbianOS|NOKIA|SAMSUNG|LG|NEC|TCL|Alc ...