Iris分类以及数组reshape想到的

最近在研究Iris花的逻辑回归分类中看到了如下的代码：

from sklearn.linear_model import LogisticRegression

X = iris["data"][:, 3:]

y=(iris["target"]==2).astype(np.int)

log_reg = LogisticRegression()

log_reg.fit(X, y)

X_new=np.linspace(0, 3, 100).reshape(-1, 1)

y_prob=log_reg.predict_proba(X_new)

decision_boundary=X_new[y_prob[:, 1] >=0.5][0]

reshape(-1, 1)第一个"-1"参数代表将数据拉平为一行，第二个1代表对于行矩阵进行处理，每个行包含一个列。下面有个demo示例：

z = np.array([[1, 2, 3, 4],

[5, 6, 7, 8],

[9, 10, 11, 12]])

z.shape

(3, 4)

z.reshape(-1)

array([ 1,  2,  3,  4,  5,  6,  7,  8,  9, 10, 11, 12])

z.reshape(-1,1)

array([[ 1],

   [ 2],

   [ 3],

   [ 4],

   [ 5],

   [ 6],

   [ 7],

   [ 8],

   [ 9],

   [10],

   [11],

   [12]])

其实(-1,1)的意义就是行数未知，列数确定是1的意思；所谓的未知就是根据实际情况来生成。可以推知reshape（1，-1）的含义。

第二个难点就是计算decision_boundary的时候：

decision_boundary=X_new[y_prob[:, 1] >=0.5][0]

其实这段语句的涵义是：首个满足y_prob[:, 1] >=0.5，对应的X_new的值。那么什么是y_prob[:, 1]呢？y_prob的获取是通过predict_prob，所以天生就是会把所有的可能值都就算一边，这里每一项都会把是Iris和NotIris的概率都计算一遍的；y_prob[:, 1]就是代表所有的Iris的判断结果，>=0.5比较好理解，就是其中判定为属于Iris的（因为>=0.5就代表倾向于Iris）的首个值；这个值就是Iris和非Iris的分界线，这个就是decision_boundary的涵义。

参考

https://stackoverflow.com/questions/18691084/what-does-1-mean-in-numpy-reshape

Iris分类以及数组reshape想到的的更多相关文章

php数组函数（分类基本数组函数，栈函数，队列）
php数组函数(分类基本数组函数,栈函数,队列函数) 一.总结 1.常用数组函数函数描述 array() 创建数组. array_combine() 通过合并两个数组来创建一个新数组. array ...
用决策树(CART)解决iris分类问题
首先先看Iris数据集 Sepal.Length--花萼长度 Sepal.Width--花萼宽度 Petal.Length--花瓣长度 Petal.Width--花瓣宽度通过上述4中属性可以预测花卉 ...
PHP递归无限分类，数组和直接输出。
去年在一家公司做项目开发,用到商城三级分类,看了之前的程序员写的分类也是头大,三级分类,循环套循环三次( foreach(){ foreach(){ foreach(){ } } } ),然后写了一个 ...
seaborn分类数据可视化
转载:https://cloud.tencent.com/developer/article/1178368 seaborn针对分类型的数据有专门的可视化函数,这些函数可大致分为三种: 分类数据散点图 ...
从Iris数据集开始---机器学习入门
代码多来自<Introduction to Machine Learning with Python>. 该文集主要是自己的一个阅读笔记以及一些小思考,小总结. 前言在开始进行模型训练之 ...
Python 读取UCI iris数据集分析、numpy基础学习
python基础.numpy使用.io读取数据集.数据处理转换与简单分析.读取UCI iris数据集中鸢尾花的萼片.花瓣长度数据,进行数据清理,去重,排序,并求出和.累积和.均值.标准差.方差.最大值 ...
【算法之美】求解两个有序数组的中位数 — leetcode 4. Median of Two Sorted Arrays
一道非常经典的题目,Median of Two Sorted Arrays.(PS:leetcode 我已经做了 190 道,欢迎围观全部题解 https://github.com/hanzichi/ ...
php用压栈的方式,循环遍历无限级别的数组(非递归方法)
php用压栈的方式,循环遍历无限级别的数组(非递归方法) 好久不写非递归遍历无限级分类...瞎猫碰到死老鼠,发刚才写的1段代码,压栈的方式遍历php无限分类的数组... php压栈的方式遍历无限级别数 ...
php数组声明、遍历、数组全局变量使用小结
数组的本质:管理和操作一组变量,成批处理,下面为大家介绍下数组的分类.数组的分类及使用说明,感兴趣的朋友可以了解下哈 php教程:数组声明,遍历,数组全局变量 <? /* * 一.数组的概 ...

随机推荐

『翻译』Access USB Devices on the Web
https://developers.google.com/web/updates/2016/03/access-usb-devices-on-the-web Access USB Devices o ...
array_udiff_uassoc
PHP array_udiff_uassoc 函数一.函数功能: 计算出第一个数组与其他数组的差集(考虑键名和键值,对键名和键值的比较都使用自定义函数).比较两到多个数组,找出第一个数组中不包含在其 ...
CentOS Minimal Install
ifup eth0chkconfig iptables offsestatus vi /etc/sysconfig/network-scripts/ifcfg-eth0 这样设置扣,记得重启网卡:[r ...
若sql语句中order by指定了多个字段,怎么排序？
举个例子吧: order by id desc,time desc 先是按 id 降序排列 (优先)如果 id 字段有些是一样的话再按time 降序排列 (前提是满足id降序排列)
Centos7安装vsftpd
1.安装vsftpd yum install vsftpd 2.添加一个ftp用户,一个不能登录系统用户,只用来登录ftp服务,这里如果没设置用户目录.默认是在home下. useradd ftpac ...
SQL注入之Sqli-labs系列第九关和第十关（基于时间盲注的注入）
开始挑战第九关(Blind- Time based- Single Quotes- String)和第十关( Blind- Time based- Double Quotes- String) gog ...
SQL注入之Sqli-labs系列第七篇（基于root权限读写注入）
开始挑战第一关(Error Based- String) 开始之前,先介绍这关需要用到的几个函数,如下图继续访问我们的地址,输入' “ 一些测试语句发现都没有反应查看源码,是采用了单引号和双括号 ...
MyBatis insert操作返回主键
在使用MyBatis做持久层时,insert语句默认是不返回记录的主键值,而是返回插入的记录条数: Dao.java @Override public int insert(T record) { f ...
微软Power BI报表服务器学习总览
今天,微软宣布了8月更新Power BI Report Server!此版本包含一些新功能,包括一些备受期待的项目,如报表主题,条件格式改进和报表页面工具提示. 报告报告主题用于触发操作的按钮组 ...
mysql创建表单脚本
如图所示,T_SENSOR_QC_CONFIG_GLOBAL_ITEM表通过外键CATEGORY_ID连接T_SENSOR_QC_CONFIG_CAT表.COMMENT为字段或表单添加注释.

Iris分类以及数组reshape想到的

Iris分类以及数组reshape想到的的更多相关文章

随机推荐

热门专题