【Sklearn系列】使用Sklearn进行数据预处理

这篇文章主要讲解使用Sklearn进行数据预处理，我们使用Kaggle中泰坦尼克号事件的数据作为样本。

读取数据并创建数据表格，查看数据相关信息

import pandas as pd

import numpy as np

from pandas import Series,DataFrame

data = pd.read_csv('tanic_train.csv')#导入进来的是dataframe格式

#data 可以打开data的具体信息，是dataframe的格式

#data.info()  #显示了基本信息的总和，包括有多少行，多少列，每列包含多少的数据，可以看出是否具有缺失值

#data.describe() #可以得到一些方差均值等统计信息，当然这是针对于数据，对于文本信息这里是没有显示的

#data['Sex'].unique()#可以判断出函数值取值范围

data.head(5) #显示数据集合前五行的内容

表格内容如下所示

填充缺失值（数据预处理的第一步就是处理缺失值）

对于缺失值不多不少的数据特征，我们可以使用机器学习模型进行缺失值得填充，例如随机森林，逻辑回归，线性回归

# 把已有的数值型特征取出来形成一个新的数据框

from sklearn.ensemble import RandomForestRegressor

age_df = data[['Age','Fare','Parch','SibSp','Pclass']]

# 乘客分成已知年龄和未知年龄两部分

known_age = age_df[age_df.Age.notnull()].as_matrix()# as_matrix()是为了将dataframe格式转为数组的格式，方便用于机器学习模型

#known_age

unknown_age = age_df[age_df.Age.isnull()].as_matrix()

#unknown_age

#y 即目标年龄

y = known_age[:,0]

# x即特征属性值

x = known_age[:,1:]##

#fit到随机森林回归算法中去

rfr =  RandomForestRegressor(random_state = 0,n_estimators = 2000, n_jobs = -1)

rfr.fit(x,y)

# 用得到的模型进行位置年龄的结果预测

predictedAges = rfr.predict(unknown_age[:,1:]) #看一下里面是啥

#用得到的预测结果填补原缺失数据

data.loc[data.Age.isnull(),'Age'] = predictedAges  ##去掉括号试试

对于缺失值太多的特征，我们可以直接删去，或者采取让不是缺失值的为1，缺失值为0

data.loc[data_train.Cabin.notnull(),'Cabin'] = 0

data.loc[data_train.Cabin.isnull(),'Cabin'] = 1

对于数据缺失值很少的我们可以采用均值或者中位数替代的方法

data["Age"] = data["Age"].fillna(data["Age"].median()/mean())

处理类目型数据

data['Embarked'].unique()

data['Embarked'] = data['Embarked'].fillna('S')

data.loc[data["Embarked"] == "S", "Embarked"] = 0

data.loc[data["Embarked"] == "C", "Embarked"] = 1

data.loc[data["Embarked"] == "Q", "Embarked"] =2

data.loc[data.Cabin.notnull(),'Cabin'] = 0

data.loc[data.Cabin.isnull(),'Cabin'] = 1

data.loc[data['Sex']=='male','Sex'] = 1

data.loc[data['Sex']=='female','Sex'] = 0

从dataframe中挑选我们需要的特征值

data=data[['Age','Survived','Fare','Pclass','Parch','Sex','SibSp','Cabin','Embarked']]

数据标准化（标准差标准化，经过处理的数据符合均值为0，标准差为1的标准正态分布）

st=np.array(X[['Age']])

scaler = preprocessing.StandardScaler().fit(st)

#在fit函数中，如果特征值只是一列的话，一定要注意在从数据集合挑选这一列特征的时候要使用X[['someting']],这样在使用np.array()之后才是可以被使用的

X['Age']=scaler.transform(st)

st2=np.array(X[['Fare']])

scaler = preprocessing.StandardScaler().fit(st2)

X['Fare']=scaler.transform(st2)

【Sklearn系列】使用Sklearn进行数据预处理的更多相关文章

【深度学习系列】PaddlePaddle之数据预处理
上篇文章讲了卷积神经网络的基本知识,本来这篇文章准备继续深入讲CNN的相关知识和手写CNN,但是有很多同学跟我发邮件或私信问我关于PaddlePaddle如何读取数据.做数据预处理相关的内容.网上看的 ...
sklearn系列之 sklearn.svm.SVC详解
首先我们应该对SVM的参数有一个详细的认知: sklearn.svm.SVC 参数说明: 本身这个函数也是基于libsvm实现的,所以在参数设置上有很多相似的地方.(PS: libsvm中的二次规划问 ...
吴裕雄 python 机器学习——数据预处理过滤式特征选取SelectPercentile模型
from sklearn.feature_selection import SelectPercentile,f_classif #数据预处理过滤式特征选取SelectPercentile模型 def ...
吴裕雄 python 机器学习——数据预处理嵌入式特征选择
import numpy as np import matplotlib.pyplot as plt from sklearn.svm import LinearSVC from sklearn.li ...
使用sklearn进行数据挖掘-房价预测(4)—数据预处理
在使用机器算法之前,我们先把数据做下预处理,先把特征和标签拆分出来 housing = strat_train_set.drop("median_house_value",axis ...
sklearn数据预处理－scale
对数据按列属性进行scale处理后,每列的数据均值变成0,标准差变为1.可通过下面的例子加深理解: from sklearn import preprocessing import numpy as ...
【sklearn】数据预处理 sklearn.preprocessing
数据预处理标准化 (Standardization) 规范化(Normalization) 二值化分类特征编码推定缺失数据生成多项式特征定制转换器 1. 标准化Standardization ...
sklearn数据预处理
一.standardization 之所以标准化的原因是,如果数据集中的某个特征的取值不服从标准的正太分布,则性能就会变得很差 ①函数scale提供了快速和简单的方法在单个数组形式的数据集上来执行标准 ...
sklearn学习笔记（一）——数据预处理 sklearn.preprocessing
https://blog.csdn.net/zhangyang10d/article/details/53418227 数据预处理 sklearn.preprocessing 标准化 (Standar ...

随机推荐

一张图看懂offsetX, clientX, pageX, screenX的区别
1.具体含义见下图1 2.浏览器的兼任情况
ArcGisJS的layers-add-result事件总结
map.on("layers-add-result", initEditing);当地图控件中的所有图层加载完毕之后触发. 注意图层加载完成后返回的的结果:event. funct ...
selenium grid 使用方法
代码和selenium driver相同只是启动环境方式不同.至少启动一个hub 一个 node .如需要多个,可以使用端口进行区分. java -jar selenium-server-stan ...
iptable防范ddos攻击
Basic DoS Protection https://github.com/MPOS/php-mpos/wiki/Basic-DoS-Protection # Rule 1: Limit New ...
对react vd 性能的理解
相信大家都知道react vd的性能是很好的,速度挺快的,真实dom操作很慢的,但是结果完全相反: 后来我就做了个测试,从两个方面去测试,在页面初始渲染1w条数据,react渲染耗时超过了1秒在12 ...
Vim中根据正则对选中文本对齐(比如ini文件的=号对齐)
vimrc增加如下内容即可: vnoremap <M-=> :call Duiqi('\v(^\s*\S+)\s+(.*)')<CR> "reg匹配的第2段文字对齐 ...
那些年我用过的SAP IDE
在Google上根据关键字"程序员鄙视链"搜索,会得到68多万条结果. 玲琅满目的搜索结果里是众多不同维度划分的鄙视链. 其中有一个维度,就是编程工具的鄙视链,比如: 而我在SAP ...
httpclient 中post请求重定向
背景:使用httpclient 的post请求进行登录,需要重定向登录,请求重定向后的地址在httpclient中post请求不像get请求自己可以重定向,实现方式是判断post请求返回码是否是3 ...
H3C S2100配置管理vlan与交换机管理IP
管理 VLAN 简介:S2100系列以太网交换机任何时刻只能有一个VLAN对应的VLAN接口可以配置IP地址,该 VLAN 即为管理 VLAN.如果要对以太网交换机进行远程管理,必须配置交换机管理 V ...
2017.10.18 微机原理与接口----汇编语言语法和DOS功能调用
4.1 汇编语言中的基本数据 ·标识符 ·常数 ·变量具有三个属性: (1)段地址(SEG):变量所在段的段地址 (2)偏移地址(OFFSET):变量所在段内的偏移地址 (3)类型(TYPE):每个变 ...

【Sklearn系列】使用Sklearn进行数据预处理

读取数据并创建数据表格，查看数据相关信息

填充缺失值（数据预处理的第一步就是处理缺失值）

处理类目型数据

从dataframe中挑选我们需要的特征值

数据标准化（标准差标准化，经过处理的数据符合均值为0，标准差为1的标准正态分布）

【Sklearn系列】使用Sklearn进行数据预处理的更多相关文章

随机推荐

热门专题