[特征工程] encoding

参考：An Overview of Encoding Techniques | Kaggle

Method 1: Label encoding

给每个类别以一个数字label，作为分类。将类别映射到自然数数值空间上

from sklearn.preprocessing import LabelEncoder

train=pd.DataFrame()

label=LabelEncoder()

for c in  X.columns:

    if(X[c].dtype=='object'):

        train[c]=label.fit_transform(X[c])

    else:

        train[c]=X[c]

Method 2 : One hot encoding

即独热码，每一个category对应特征向量中的一位，对应位置是否为1判定是否为该类。

可以使用pd.get_dummies()或sklearn.preprocessing中OneHotEncoder

from sklearn.preprocessing import OneHotEncoder

one=OneHotEncoder(

one.fit(X)

train=one.transform(X)

Method 3 : Feature Hashing/Hashing Trick

一个“one hot encoding style” 的编码方式，将数据编入特定维数的散度矩阵中，降维中使用了hash方法。

from sklearn.feature_extraction import FeatureHasher

X_train_hash=X.copy()

for c in X.columns:

    X_train_hash[c]=X[c].astype('str')

hashing=FeatureHasher(input_type='string')

train=hashing.transform(X_train_hash.values)

Method 4 :Encoding categories with dataset statistics

尝试为模型提供较低维的每个类别的表示，且其中类似的类别的表示相近。最简单的方法是将每个类别替换为我们在数据集中看到它的次数，即用出现频率作为他们的embedding。

X_train_stat=X.copy()

for c in X_train_stat.columns:

    if(X_train_stat[c].dtype=='object'):

        X_train_stat[c]=X_train_stat[c].astype('category')

        counts=X_train_stat[c].value_counts()

        counts=counts.sort_index()

        counts=counts.fillna(0)

        counts += np.random.rand(len(counts))/1000

        X_train_stat[c].cat.categories=counts

对于循环出现的特征，例如日期，星期等，常用sin\cos将其转为二维空间中的数据。这是基于“循环”的性质，类似于对圆进行分割。

X_train_cyclic=X.copy()

columns=['day','month']

for col in columns:

    X_train_cyclic[col+'_sin']=np.sin((2*np.pi*X_train_cyclic[col])/max(X_train_cyclic[col]))

    X_train_cyclic[col+'_cos']=np.cos((2*np.pi*X_train_cyclic[col])/max(X_train_cyclic[col]))

X_train_cyclic=X_train_cyclic.drop(columns,axis=1)

one=OneHotEncoder()

one.fit(X_train_cyclic)

train=one.transform(X_train_cyclic)

Method 5 : Target encoding

Target encoding 通过目标数据对类别变量进行编码，使用目标对应概率或平均概率替换该类别，即出现频次相近的被视为同一类（大城市，热门项等）。这个方法比较依赖训练集与测试集合的分布，要求他们数据分布一致。另外，这种方法可能会导致过拟合。

X_target=df_train.copy()

X_target['day']=X_target['day'].astype('object')

X_target['month']=X_target['month'].astype('object')

for col in X_target.columns:

    if (X_target[col].dtype=='object'):

        target= dict ( X_target.groupby(col)['target'].agg('sum')/X_target.groupby(col)['target'].agg('count'))

        X_target[col]=X_target[col].replace(target).values

为了减轻过拟合可能带来的影响，可以使用K-Fold Validation ，每次对一份样本进行目标编码时，使用的都是其他K-1份数据之中的数据。

X['target']=y

cols=X.drop(['target','id'],axis=1).columns

%%time

X_fold=X.copy()

X_fold[['ord_0','day','month']]=X_fold[['ord_0','day','month']].astype('object')

X_fold[['bin_3','bin_4']]=X_fold[['bin_3','bin_4']].replace({'Y':1,'N':0,'T':1,"F":0})

kf = KFold(n_splits = 5, shuffle = False, random_state=2019)

for train_ind,val_ind in kf.split(X):

    for col in cols:

        if(X_fold[col].dtype=='object'):

            replaced=dict(X.iloc[train_ind][[col,'target']].groupby(col)['target'].mean())

            X_fold.loc[val_ind,col]=X_fold.iloc[val_ind][col].replace(replaced).values

此外，在对特征进行编码前也需要进行特征种类的区分。常分为：

0-1数值：只有两种取值，可映射到0，1
类别数值：多个类别，这也是最常见的数据。
时序数据：时间戳等，隐含了顺序信息，可以反应趋势。

[特征工程] encoding的更多相关文章

机器学习-特征工程-Missing value和Category encoding
好了,大家现在进入到机器学习中的一块核心部分了,那就是特征工程,洋文叫做Feature Engineering.实际在机器学习的应用中,真正用于算法的结构分析和部署的工作只占很少的一部分,相反,用于特 ...
特征工程(Feature Engineering)
一.什么是特征工程? "Feature engineering is the process of transforming raw data into features that bett ...
机器学习-特征工程-Feature generation 和 Feature selection
概述:上节咱们说了特征工程是机器学习的一个核心内容.然后咱们已经学习了特征工程中的基础内容,分别是missing value handling和categorical data encoding的一些 ...
【Python数据挖掘】第六篇--特征工程
一.Standardization 方法一:StandardScaler from sklearn.preprocessing import StandardScaler sds = Standard ...
AI学习笔记：特征工程
一.概述 Andrew Ng:Coming up with features is difficult, time-consuming, requires expert knowledge. &quo ...
Alink漫谈(十) ：特征工程之特征哈希/标准化缩放
Alink漫谈(十) :特征工程之特征哈希/标准化缩放目录 Alink漫谈(十) :特征工程之特征哈希/标准化缩放 0x00 摘要 0x01 相关概念 1.1 特征工程 1.2 特征缩放(Scali ...
使用sklearn做单机特征工程
目录 1 特征工程是什么?2 数据预处理 2.1 无量纲化 2.1.1 标准化 2.1.2 区间缩放法 2.1.3 标准化与归一化的区别 2.2 对定量特征二值化 2.3 对定性特征哑编码 2.4 缺 ...
特征工程(Feature Enginnering)学习记要
最近学习特征工程(Feature Enginnering)的相关技术,主要包含两块:特征选取(Feature Selection)和特征抓取(Feature Extraction).这里记录一些要点 ...
【转】使用sklearn做单机特征工程
这里是原文说明:这是我用Markdown编辑的第一篇随笔目录 1 特征工程是什么? 2 数据预处理 2.1 无量纲化 2.1.1 标准化 2.1.2 区间缩放法 2.1.3 无量纲化与正则化的区别 ...

随机推荐

实验1：SDN拓扑拓扑实验
一.实验目的能够使用源码安装Mininet: 能够使用Mininet的可视化工具生成拓扑: 能够使用Mininet的命令行生成特定拓扑: 能够使用Mininet交互界面管理SDN拓扑: 能够使用Py ...
菜鸡的Java笔记第二十八 - java 包的定义
包的主要作用以及定义包的导入操作系统常见的开发包 jar 程序命令包的定义在任何的操作系统之中都有一个统一的共识:同一个目录下不能够存在有相同的文 ...
[nowcoder5668H]Sort the Strings Revision
考虑对于$p_{i}=0$,那么可以快速比较出$s_{0},s_{1},...,s_{i-1}$与$s_{i},s_{i+1},...,s_{n}$之间的大小关系,然后对两边分别找到最小的$p_{i} ...
dart系列之:在dart中使用生成器
目录简介两种返回类型的generator Stream的操作总结简介 ES6中在引入异步编程的同时,也引入了Generators,通过yield关键词来生成对应的数据.同样的dart也有yie ...
[源码解析] PyTorch 分布式(10)------DistributedDataParallel 之 Reducer静态架构
[源码解析] PyTorch 分布式(10)------DistributedDataParallel之Reducer静态架构目录 [源码解析] PyTorch 分布式(10)------Distr ...
buu
buuCTFwp(1~32) 1.签到题题里就有flag flag{buu_ctf} 2.二维码 1.题目是一个二维码,用010发现提示四位数字,想到应该是暗藏压缩包 2.虚拟机foremost分离 ...
Codeforces 1340F - Nastya and CBS（分块+哈希）
Codeforces 题面传送门 & 洛谷题面传送门首先看到这样的数据范围我们可以考虑分块,具体来说,对于每一块我们记录其中的括号是否能完全消掉,以及对其进行括号相消之后的括号序列(显然是一 ...
sigma网格中水平压力梯度误差及其修正
1.水平梯度误差产生 sigma坐标系下,笛卡尔坐标内水平梯度项对应形式为 \[\begin{equation} \left. \frac{\partial }{\partial x} \right| ...
【机器学习与R语言】10- 关联规则
目录 1.理解关联规则 1)基本认识 2)Apriori算法 2.关联规则应用示例 1)收集数据 2)探索和准备数据 3)训练模型 4)评估性能 5)提高模型性能 1.理解关联规则 1)基本认识购物 ...
C语言自定义函数按行读入文件
在之前的博客中 https://www.cnblogs.com/mmtinfo/p/13036039.html 读取一行的getline()函数是GNU 的扩展函数. 这里用自定义函数实现这个功能,从 ...

[特征工程] encoding

[特征工程] encoding的更多相关文章

随机推荐

热门专题