python机器学习-乳腺癌细胞挖掘（博主亲自录制视频,包含数据预处理scale）

https://study.163.com/course/introduction.htm?courseId=1005269003&utm_campaign=commission&utm_source=cp-400000000398149&utm_medium=share

数据预处理方法包括scale,normalization,Binarizer

# -*- coding: utf-8 -*-

"""

Created on Sat Apr 14 09:09:41 2018

@author:Toby

standardScaler==features with a mean=0 and variance=1

minMaxScaler==features in a 0 to 1 range

normalizer==feature vector to a euclidean length=1

normalization

bring the values of each feature vector on a common scale

L1-least absolute deviations-sum of absolute values(on each row)=1;it is insensitive to outliers

L2-Least squares-sum of squares(on each row)=1;takes outliers in consideration during traing

"""

from sklearn import preprocessing

import numpy as np

data=np.array([[2.2,5.9,-1.8],[5.4,-3.2,-5.1],[-1.9,4.2,3.2]])

bindata=preprocessing.Binarizer(threshold=1.5).transform(data)

print('Binarized data:',bindata)

#mean removal

print('Mean(before)=',data.mean(axis=0))

print('standard deviation(before)=',data.std(axis=0))

#features with a mean=0 and variance=1

scaled_data=preprocessing.scale(data)

print('Mean(before)=',scaled_data.mean(axis=0))

print('standard deviation(before)=',scaled_data.std(axis=0))

print('scaled_data:',scaled_data)

'''

scaled_data: [[ 0.10040991  0.91127074 -0.16607709]

 [ 1.171449   -1.39221918 -1.1332319 ]

 [-1.27185891  0.48094844  1.29930899]]

'''

#features in a 0 to 1 range

minmax_scaler=preprocessing.MinMaxScaler(feature_range=(0,1))

data_minmax=minmax_scaler.fit_transform(data)

print('MinMaxScaler applied on the data:',data_minmax)

'''

MinMaxScaler applied on the data: [[ 0.56164384  1.          0.39759036]

 [ 1.          0.          0.        ]

 [ 0.          0.81318681  1.        ]]

'''

data_l1=preprocessing.normalize(data,norm='l1')

data_l2=preprocessing.normalize(data,norm='l2')

print('l1-normalized data:',data_l1)

'''

[[ 0.22222222  0.5959596  -0.18181818]

 [ 0.39416058 -0.23357664 -0.37226277]

 [-0.20430108  0.4516129   0.34408602]]

'''

print('l2-normalized data:',data_l2)

'''

[[ 0.3359268   0.90089461 -0.2748492 ]

 [ 0.6676851  -0.39566524 -0.63059148]

 [-0.33858465  0.74845029  0.57024784]]

'''

数据处理——One-Hot Encoding

一、One-Hot Encoding

One-Hot编码，又称为一位有效编码，主要是采用 $N$ 位状态寄存器来对 $N$ 个状态进行编码，每个状态都由他独立的寄存器位，并且在任意时候只有一位有效。

在实际的机器学习的应用任务中，特征有时候并不总是连续值，有可能是一些分类值，如性别可分为“male”和“female”。在机器学习任务中，对于这样的特征，通常我们需要对其进行特征数字化，如下面的例子：

有如下三个特征属性：

性别：["male"，"female"]
地区：["Europe"，"US"，"Asia"]
浏览器：["Firefox"，"Chrome"，"Safari"，"Internet Explorer"]

对于某一个样本，如["male"，"US"，"Internet Explorer"]，我们需要将这个分类值的特征数字化，最直接的方法，我们可以采用序列化的方式：[0,1,3]。但是这样的特征处理并不能直接放入机器学习算法中。

二、One-Hot Encoding的处理方法

对于上述的问题，性别的属性是二维的，同理，地区是三维的，浏览器则是思维的，这样，我们可以采用One-Hot编码的方式对上述的样本“["male"，"US"，"Internet Explorer"]”编码，“male”则对应着[1，0]，同理“US”对应着[0，1，0]，“Internet Explorer”对应着[0,0,0,1]。则完整的特征数字化的结果为：[1,0,0,1,0,0,0,0,1]。这样导致的一个结果就是数据会变得非常的稀疏。

https://study.163.com/provider/400000000398149/index.htm?share=2&shareId=400000000398149（欢迎关注博主主页，学习python视频资源，还有大量免费python经典文章）

机器学习项目合作QQ:231469242

sklearn-数据预处理scale的更多相关文章

sklearn数据预处理－scale
对数据按列属性进行scale处理后,每列的数据均值变成0,标准差变为1.可通过下面的例子加深理解: from sklearn import preprocessing import numpy as ...
sklearn数据预处理
一.standardization 之所以标准化的原因是,如果数据集中的某个特征的取值不服从标准的正太分布,则性能就会变得很差 ①函数scale提供了快速和简单的方法在单个数组形式的数据集上来执行标准 ...
sklearn 数据预处理1: StandardScaler
作用:去均值和方差归一化.且是针对每一个特征维度来做的,而不是针对样本. [注:] 并不是所有的标准化都能给estimator带来好处. “Standardization of a dataset i ...
数据预处理及sklearn方法实现
1.标准化(中心化) 在许多机器学习执行前,需要对数据集进行标准化处理.因为很对算法假设数据的特征服从标准正态分布.所以如果不对数据标准化,那么算法的效果会很差. 例如,在学习算法的目标函数,都假设数 ...
【sklearn】数据预处理 sklearn.preprocessing
数据预处理标准化 (Standardization) 规范化(Normalization) 二值化分类特征编码推定缺失数据生成多项式特征定制转换器 1. 标准化Standardization ...
sklearn学习笔记（一）——数据预处理 sklearn.preprocessing
https://blog.csdn.net/zhangyang10d/article/details/53418227 数据预处理 sklearn.preprocessing 标准化 (Standar ...
关于使用sklearn进行数据预处理 —— 归一化/标准化/正则化
一.标准化(Z-Score),或者去除均值和方差缩放公式为:(X-mean)/std 计算时对每个属性/每列分别进行. 将数据按期属性(按列进行)减去其均值,并处以其方差.得到的结果是,对于每个属 ...
sklearn中的数据预处理和特征工程
小伙伴们大家好~o(￣▽￣)ブ,沉寂了这么久我又出来啦,这次先不翻译优质的文章了,这次我们回到Python中的机器学习,看一下Sklearn中的数据预处理和特征工程,老规矩还是先强调一下我的开发环境是 ...
matlab、sklearn 中的数据预处理
数据预处理(normalize.scale) 0. 使用 PCA 降维 matlab: [coeff, score] = pca(A); reducedDimension = coeff(:,1:5) ...

随机推荐

2018-南京网络赛icpc-L题（分层最短路）
题意:给你n个点,m条边的有向带权图,然后你每次可以选<=k条边的边权变成0,问你1到n的最短路: 解题思路:这道题基本上就是原题了呀,bzoj2763(无向图),解法就是拆点跑分层的最短路,比 ...
BZOJ 1443 游戏(二分图博弈)
新知识get. 一类博弈问题,基于以下条件: 1.博弈者人数为两人,双方轮流进行决策.2.博弈状态(对应点)可分为两类(状态空间可分为两个集合),对应二分图两边(X集和Y集).任意合法的决策(对应边) ...
Xml文件汉化准备
如何提取xml文件中的字符串,是汉化的前提. Passolo中的解析器不能正确解析文件,此时可以采用Text Parser进行解析. 通过自定义规则,可以相对完整的把字符串提取出来. 一张图片就能说明 ...
RPM包定制
概述问题:当领导给你 100 台已经安装好系统的服务器,然后让优化,让你提出一个快速部署方案.解答: 1.tar 打包先编译安装打包-->分发-->解包(比如 mysql 打包后直接 ...
The Unique MST POJ - 1679 次小生成树prim
求次小生成树思路: 先把最小生成树求出来用一个Max[i][j] 数组把 i点到j 点的道路中权值最大的那个记录下来 used数组记录该条边有没有被最小生成树使用过把没有使用过的一条边加 ...
安装PHP 类库PEAR
PHP扩展与应用库常识当php项目里没有pear时: 单独安装解决方案下载下面连接的文件至go-pear.phar.http://pear.php.net/go-pear.phar该文件最好放到P ...
Navicat再次激活
换了个新电脑,上一次激活用的注册机老被杀掉,defender什么的都关了,不知道是谁在暗中保护我的电脑.. 上个激活参考:https://www.cnblogs.com/MC-Curry/p/9765 ...
[luogu4479][BJWC2018]第k大斜率【二维偏序+二分+离散化+树状数组】
传送门 https://www.luogu.org/problemnew/show/P4479 题目描述在平面直角坐标系上,有 n 个不同的点.任意两个不同的点确定了一条直线.请求出所有斜率存在的直 ...
[JSOI2008]Blue Mary的职员分配
由于Blue Mary呕心沥血的管理,Blue Mary的网络公司蒸蒸日上.现在一共拥有了n名职员,可惜没有任何的金钱和声誉.平均每名每天职员都可以给公司带来x单位金钱或者y单位声誉(名利不能双全). ...
sublime text3 replace和反向引用
实用小技巧,主要用于替换爬虫请求头,节省时间. chrome原信息显示: UserID: sds UserPass: sdsd codeKey: 350753 code: 277 B1: 提 subl ...

sklearn-数据预处理scale