sklearn 数据预处理1: StandardScaler

作用：去均值和方差归一化。且是针对每一个特征维度来做的，而不是针对样本。
【注：】
并不是所有的标准化都能给estimator带来好处。
“Standardization of a dataset is a common requirement for many machine learning estimators: they might behave badly if the individual feature do not more or less look like standard normally distributed data (e.g. Gaussian with 0 mean and unit variance).”

实例代码

# coding=utf-8

# 统计训练集的 mean 和　std 信息

from sklearn.preprocessing import StandardScaler

import numpy as np

def test_algorithm():

    np.random.seed(123)

    print('use sklearn')

    # 注：shape of data: [n_samples, n_features]

    data = np.random.randn(10, 4)

    scaler = StandardScaler()

    scaler.fit(data)

    trans_data = scaler.transform(data)

    print('original data: ')

    print data

    print('transformed data: ')

    print trans_data

    print('scaler info: scaler.mean_: {}, scaler.var_: {}'.format(scaler.mean_, scaler.var_))

    print('\n')

    print('use numpy by self')

    mean = np.mean(data, axis=0)

    std = np.std(data, axis=0)

    var = std * std

    print('mean: {}, std: {}, var: {}'.format(mean, std, var))

    # numpy 的广播功能

    another_trans_data = data - mean

    # 注：是除以标准差

    another_trans_data = another_trans_data / std

    print('another_trans_data: ')

    print another_trans_data

if __name__ == '__main__':

    test_algorithm()

程序的输出如下：

use sklearn

    original data:

    [[-1.0856306   0.99734545  0.2829785 - 1.50629471]

     [-0.57860025  1.65143654 - 2.42667924 - 0.42891263]

    [1.26593626 - 0.8667404 - 0.67888615 - 0.09470897]

    [1.49138963 - 0.638902 - 0.44398196 - 0.43435128]

    [2.20593008

    2.18678609

    1.0040539

    0.3861864]

    [0.73736858  1.49073203 - 0.93583387  1.17582904]

    [-1.25388067 - 0.6377515

    0.9071052 - 1.4286807]

    [-0.14006872 - 0.8617549 - 0.25561937 - 2.79858911]

    [-1.7715331 - 0.69987723

    0.92746243 - 0.17363568]

    [0.00284592  0.68822271 - 0.87953634  0.28362732]]

    transformed

    data:

    [[-0.94511643  0.58665507  0.5223171 - 0.93064483]

     [-0.53659117  1.16247784 - 2.13366794  0.06768082]

    [0.9495916 - 1.05437488 - 0.42049501

    0.3773612]

    [1.13124423 - 0.85379954 - 0.19024378  0.06264126]

    [1.70696485

    1.63376764

    1.22910949

    0.8229693]

    [0.52371324  1.02100318 - 0.67235312  1.55466934]

    [-1.08067913 - 0.85278672

    1.13408114 - 0.858726]

    [-0.18325687 - 1.04998594 - 0.00561227 - 2.1281129]

    [-1.49776284 - 0.9074785

    1.15403514

    0.30422599]

    [-0.06810748  0.31452186 - 0.61717074  0.72793583]]

    scaler info: scaler.mean_: [0.08737571  0.33094968 - 0.24989369 - 0.50195303], scaler.var_: [1.54038781  1.29032409

                                                                                          1.04082479  1.16464894]

    use numpy by self

    mean: [0.08737571  0.33094968 - 0.24989369 - 0.50195303], std: [1.24112361  1.13592433  1.02020821

                                                                    1.07918902], var: [1.54038781  1.29032409

                                                                                       1.04082479  1.16464894]

    another_trans_data:

    [[-0.94511643  0.58665507  0.5223171 - 0.93064483]

     [-0.53659117  1.16247784 - 2.13366794  0.06768082]

    [0.9495916 - 1.05437488 - 0.42049501

    0.3773612]

    [1.13124423 - 0.85379954 - 0.19024378  0.06264126]

    [1.70696485

    1.63376764

    1.22910949

    0.8229693]

    [0.52371324  1.02100318 - 0.67235312  1.55466934]

    [-1.08067913 - 0.85278672

    1.13408114 - 0.858726]

    [-0.18325687 - 1.04998594 - 0.00561227 - 2.1281129]

    [-1.49776284 - 0.9074785

    1.15403514

    0.30422599]

    [-0.06810748  0.31452186 - 0.61717074  0.72793583]]

sklearn 数据预处理1: StandardScaler的更多相关文章

吴裕雄 python 机器学习——数据预处理标准化StandardScaler模型
from sklearn.preprocessing import StandardScaler #数据预处理标准化StandardScaler模型 def test_StandardScaler() ...
sklearn数据预处理－scale
对数据按列属性进行scale处理后,每列的数据均值变成0,标准差变为1.可通过下面的例子加深理解: from sklearn import preprocessing import numpy as ...
sklearn数据预处理
一.standardization 之所以标准化的原因是,如果数据集中的某个特征的取值不服从标准的正太分布,则性能就会变得很差 ①函数scale提供了快速和简单的方法在单个数组形式的数据集上来执行标准 ...
数据预处理及sklearn方法实现
1.标准化(中心化) 在许多机器学习执行前,需要对数据集进行标准化处理.因为很对算法假设数据的特征服从标准正态分布.所以如果不对数据标准化,那么算法的效果会很差. 例如,在学习算法的目标函数,都假设数 ...
Python数据预处理(sklearn.preprocessing)—归一化(MinMaxScaler)，标准化(StandardScaler)，正则化(Normalizer, normalize)
关于数据预处理的几个概念归一化 (Normalization): 属性缩放到一个指定的最大和最小值(通常是1-0)之间,这可以通过preprocessing.MinMaxScaler类实现. 常 ...
使用sklearn进行数据挖掘-房价预测(4)—数据预处理
在使用机器算法之前,我们先把数据做下预处理,先把特征和标签拆分出来 housing = strat_train_set.drop("median_house_value",axis ...
【sklearn】数据预处理 sklearn.preprocessing
数据预处理标准化 (Standardization) 规范化(Normalization) 二值化分类特征编码推定缺失数据生成多项式特征定制转换器 1. 标准化Standardization ...
sklearn学习笔记（一）——数据预处理 sklearn.preprocessing
https://blog.csdn.net/zhangyang10d/article/details/53418227 数据预处理 sklearn.preprocessing 标准化 (Standar ...
【Sklearn系列】使用Sklearn进行数据预处理
这篇文章主要讲解使用Sklearn进行数据预处理,我们使用Kaggle中泰坦尼克号事件的数据作为样本. 读取数据并创建数据表格,查看数据相关信息 import pandas as pd import ...

随机推荐

Boostrap模态框，以及通过jquery绑定td的值，使模态框回显
做页面不管是登录或是修改信息,难免会使用到模态框,在此分享一个比较漂亮的模态框 Boostrap模态框使用之前首先导入jquery-3.2.1.min.js,和bootstrap.min.js 先添 ...
C++基础概述
阅读Android源码需要对C++基础语法有一定的认识,借此对C++做一个简单的语法认知. 1.数据类型类型关键字布尔型 bool 字符型 char 整型 int 浮点型 float 双浮点型 ...
iOS开发GCD(3)-数据安全
/* 多个线程可能访问同一块资源,造成数据错乱和数据安全问题为代码添加同步锁(互斥锁) */ -(void)synchronized{ @synchronized(self){ //需要锁住的代码, ...
python ddt
#!/usr/bin/env/python # -*- coding: utf-8 -*- # @Time : 2018/12/15 15:27 # @Author : ChenAdong # @Em ...
JSON语法与JavaScript语法的区别
JSON是独立于语言存在的,在不同的编程语言中对这种数据类型的实现不同,例如在JavaScript中使用JavaScript对象对这种数据格式进行实现,那么在java中当然是用java对象实现. 描述 ...
mssql sqlserver两条求和sql脚本相加的方法分享
转自:http://www.maomao365.com/?p=7205 摘要: 下文分享两条sql求和脚本,再次求和的方法分享 /* 例: 下文已知两条sql求和脚本,现需对两张不同表的求和记录再次求 ...
python len()函数的用法
函数:len() 返回字符串.列表.字典.元组等长度. 语法:len(str) str:要计算的字符串.列表.字典.元组等返回值:字符串.列表.字典.元组等元素的长度. Test: 1:计算字符串的 ...
Vue2 学习笔记3
文中例子代码请参考github 定义Vue组件什么是组件: 组件的出现,就是为了拆分Vue实例的代码量的,能够让我们以不同的组件,来划分不同的功能模块,将来我们需要什么样的功能,就可以去调用对应的组 ...
Windows 快捷方式（*.link）打开方式关联错误
1.Win+r 组合键打开 “运行”,输入 “regedit” 打开注册表 2.依次打开注册表,定位到以下位置: HKEY_CURRENT_USER\SOFTWARE\MICROSOFT\WINDO ...
聚类——K-means
聚类——认识K-means算法作者:凯鲁嘎吉 - 博客园 http://www.cnblogs.com/kailugaji/ 一.聚类与分类聚类: 无监督学习.聚类是在预先不知道欲划分类的情况下, ...

sklearn 数据预处理1: StandardScaler

实例代码

sklearn 数据预处理1: StandardScaler的更多相关文章

随机推荐

热门专题