关于value

value_counts将会对于指定列的数据进行group，然后统计出各个出现的值的数量，并且按照从高到低的顺序进行排序

 train_data = load_titanic_data("train.csv")

 train_data["Pclass"].value_counts()

输出：

3 491

1 216

2 184

Name: Pclass, dtype: int64

代表Pclass这个字段共有三种值：1，2，3；出现的次数分别为216,184以及491，上面的列表就是按照出现“值”的数量从高到低排列以及数量进行排列；

原则即使：在对于NaN值处理常规的一种方案就是对于数字型取“中位数”，对于Category的（文字型）填充则取出现频率最高的；下面就是实现对于文字型填充Null值；

 from sklearn.pipeline import Pipeline

 from sklearn.preprocessing import Imputer

 num_pipeline = Pipeline([

         ("select_numeric", DataFrameSelector(["Age", "SibSp", "Parch", "Fare"])),

         ("imputer", Imputer(strategy="median")),

     ])

 class MostFrequentImputer(BaseEstimator, TransformerMixin):

     def fit(self, X, y=None):

         self.most_frequent_ = pd.Series([X[c].value_counts().index[0] for c in X],

                                         index=X.columns)

         return self

     def transform(self, X, y=None):

         return X.fillna(self.most_frequent_)

 from future_encoders import OneHotEncoder

 cat_pipeline = Pipeline([

         ("select_cat", DataFrameSelector(["Pclass", "Sex", "Embarked"])),

         ("imputer", MostFrequentImputer()),

         ("cat_encoder", OneHotEncoder(sparse=False)),

     ])

 cat_pipeline.fit_transform(train_data)

参考：

https://stackoverflow.com/questions/25239958/impute-categorical-missing-values-in-scikit-learn

关于value_count的更多相关文章

Python数据分析笔记目录
速查笔记使用实例 Pandas-数据导入 (未完成) Pandas-数据探索基础属性 shape indexs columns values dtype/dtypes 汇总和计算描述统计 coun ...
Python_Day_01（使用环境为Python3.0+）
Python 变量与赋值. Python在赋值时时不需要进行定义类型,可直接进行定义赋值. #直接赋值字符串格式 value = "Char" #直接赋值为数字 value = 1 ...
Pandas-数据探索
Pandas包对数据的常用探索功能,方便了解数据描述性属性. 目录基础属性 shape indexs columns values dtype/dtypes 汇总和计算描述统计 count() va ...
matplotlib basic and boxplot
============================================matplotlib 绘图基础========================================= ...
Elasticsearch学习笔记（一）
批量建索引: curl -s -XPOST 'localhost:9200/_bulk' --data-binary @documents.json 查看索引mappingmyindex/_mappi ...
Elasticsearch查询
Elasticsearch支持两种类型的查询:基本查询和复合查询. 基本查询,如词条查询用于查询实际数据. 复合查询,如布尔查询,可以合并多个查询, 然而,这不是全部.除了这两种类型的查询,你还可以用 ...
aggregation 详解2（metrics aggregations）
概述权值聚合类型从需要聚合的文档中取一个值(value)来计算文档的相应权值(比如该值在这些文档中的max.sum等). 用于计算的值(value)可以是文档的字段(field),也可以是脚本(sc ...
Elasticsearch--Aggregation详细总结（聚合统计）
Elasticsearch的Aggregation功能也异常强悍. Aggregation共分为三种:Metric Aggregations.Bucket Aggregations. Pipeline ...
数据特征分析：1.基础分析概述& 分布分析
基础分析概述几个基础分析思路: 分布分析对比分析统计分析帕累托分析正态性检测相关性分析分布分析分布分析是研究数据的分布特征和分布类型,分定量数据.定性数据区分基本统计量. import ...

随机推荐

linux下关于PCL（point cloud library）库的安装，三行命令错误的问题
最近想再看看PCL,所以进行了安装,在之前的接触的过程中,由于之前的网络存在问题,导致以下三个命令: sudo add-apt-repository ppa:v-launchpad-jochen-sp ...
springsecurity启动出现org.springframework.beans.factory.parsing.BeanDefinitionParsingException: Configuration problem: You must use a 3.0 schema with Spring Security 3.0.
在换了spring-security的jar包以后启动出现org.springframework.beans.factory.parsing.BeanDefinitionParsingExceptio ...
REST easy with kbmMW #21 – Delphi client stubs
在之前的博文中,我提到新的存根生成器框架具有生成Delphi客户端存根所需的功能,使得开发Delphi智能客户端非常容易,完全支持编译时的类型检查和IDE类/属性帮助. 我没想到会把它包含在即将发布的 ...
【转载】深度学习总结：用pytorch做dropout和Batch Normalization时需要注意的地方，用tensorflow做dropout和BN时需要注意的地方,
原文地址: https://blog.csdn.net/weixin_40759186/article/details/87547795 ------------------------------- ...
【转载】 PyTorch学习之六个学习率调整策略
原文地址: https://blog.csdn.net/shanglianlm/article/details/85143614 ----------------------------------- ...
Ubuntu关闭进入screensaver模式
/********************************************************************************* * Ubuntu关闭进入scree ...
RNN 通过字符语言模型理解BPTT
链接:https://github.com/karpathy/char-rnn http://karpathy.github.io/2015/05/21/rnn-effectiveness/ http ...
NOI-1.1-06-空格分隔输出-体验多个输入输出
06:空格分隔输出总时间限制: 1000ms 内存限制: 65536kB 描述读入一个字符,一个整数,一个单精度浮点数,一个双精度浮点数,然后按顺序输出它们,并且要求在他们之间用一个空格分隔. ...
pycharm中如何安装Scrapy库
先打开pycharm软件. 然后先安装pywin32和setuptools库. 安装成功后再尝试Twisted库,如果失败,就去晚上下载一个库:https://www.lfd.uci.edu/~goh ...
[LeetCode&Python] Problem 448. Find All Numbers Disappeared in an Array
Given an array of integers where 1 ≤ a[i] ≤ n (n = size of array), some elements appear twice and ot ...

关于value_count

关于value_count的更多相关文章

随机推荐

热门专题