Pandas统计分析

pandas数据的基本统计分析

和numpy的函数近似

dates = pd.date_range('',periods=10)

dates

df = pd.DataFrame(np.random.randn(10,4),index=dates,columns=['A','B','C','D'])

df

df.describe() #快速统计结果

df.mean() # 按列求平均值

df.mean(1) # 按行求平均值

基本统计分析函数

.describe() 针对0轴(列)的统计汇总，计数/平均值/标准差/最小值/四分位数/最大值
.sum() 计算数据的总和,按0轴计算(各行计算),下同,要按列计算参数1
.count() 非NaN值数量
.mean() .median() .mode() 计算数据的算数平均值/算数中位数/众数
.var() .std() 计算数据的方差/标准差
.min() .max() 计算数据的最小值/最大值

只适用于series:

.argmin(),.argmax() 计算数据最大值/最小值所在位置的索引位置(自动索引,用她是因为很容易切片等操作)
.idxmin(),.idxmax() 计算数据最大值/最小值所在位置的索引(自定义索引)

a = pd.Series([9,8,7,6],index=['a','b','c','d'])

a

b = pd.DataFrame(np.arange(20).reshape(4,5),index=['c','a','d','b'])

b

a.describe()

type(a.describe()) #series对象

a.describe()['count']

b.describe() #默认0轴运算

type(b.describe()) #dataframe对象

#返回横行数据,series

b.describe().loc['max']

b.describe().iloc[7]

#返回一列值,这里第2列

b.describe()[2]

#b.describe()[2]

b.describe().loc[:,2]

数据的累计统计分析

对序列的前1-n个数累计运算
可减少for循环的使用

累计统计分析函数,适用于series和dataframe类型

.cumsum() 依次给出前1/2/.../n个数的和
.cumprod() 依次给出前1/2/.../n个数的积
.cummax() 依次给出前1/2/.../n个数的最大值
.cummin() 依次给出前1/2/.../n个数的最小值

b = pd.DataFrame(np.arange(20).reshape(4,5),index=['c','a','d','b'])

b

b.cumsum() #列的累加和

b.cumprod() #列的累加积

滚动计算(窗口计算)函数

适用series/dataframe

.rolling(w).sum() 依次计算相邻w个元素的和
.rolling(w).mean() 依次计算相邻w个元素的算数平均值
.rolling(w).var() 依次计算相邻w个元素的方差
.rolling(w).std() 依次计算相邻w个元素的标准差
.rolling(w).min .max() 依次计算相邻w个元素的最小值/最大值

b.rolling(2).sum() #纵向列,以两个元素为单位,做求和运算

b.rolling(3).sum()

Pandas统计分析的更多相关文章

18-09-27 pandas 学习02
如何系统的学习python 中有关数据分析和挖掘相关的库?什么是系统的学习?系统的学习就是一个先搭建只是框架体系,然后不断填充知识看,不断更新迭代的过程. Pandas,numpy,scipy,mat ...
常用统计分析python包开源学习代码 numpy pandas matplotlib
常用统计分析python包开源学习代码 numpy pandas matplotlib 待办 https://github.com/zmzhouXJTU/Python-Data-Analysis
Python数据分析之pandas学习
Python中的pandas模块进行数据分析. 接下来pandas介绍中将学习到如下8块内容:1.数据结构简介:DataFrame和Series2.数据索引index3.利用pandas查询数据4.利 ...
[原创博文] 用Python做统计分析（Scipy.stats的文档）
[转自] 用Python做统计分析 (Scipy.stats的文档) 对scipy.stats的详细介绍: 这个文档说了以下内容,对python如何做统计分析感兴趣的人可以看看,毕竟Python的库也 ...
python 抓取金融数据，pandas进行数据分析并可视化系列 (一)
终于盼来了不是前言部分的前言,相当于杂谈,算得上闲扯,我觉得很多东西都是在闲扯中感悟的,比如需求这东西,一个人只有跟自己沟通好了,总结出某些东西了,才能更好的和别人去聊,去说. 今天这篇写的是明白需求 ...
数据分析与展示——Pandas数据特征分析
Pandas数据特征分析数据的排序将一组数据通过摘要(有损地提取数据特征的过程)的方式,可以获得基本统计(含排序).分布/累计统计.数据特征(相关性.周期性等).数据挖掘(形成知识). .sort ...
python 数据分析--pandas
接下来pandas介绍中将学习到如下8块内容:1.数据结构简介:DataFrame和Series2.数据索引index3.利用pandas查询数据4.利用pandas的DataFrames进行统计分析 ...
使用Pandas将多个数据表合一
使用Pandas将多个数据表合一将多张数据表合为一张表,便于统计分析,进行这一操作的前提为这多张数据表互相之间有关联信息,或者有相同的列. import pandas as pd unames = ...
pandas用法之二
1,函数应用 ①map() 将函数作用于一个Series的每一个函数(不能是DataFrame) 类似于Python的高阶函数map() 函数可以是Numpy中的通用函数,也可以是自定义函数优点:代 ...

随机推荐

Solr Date类型的哪些你不得不了解的细节
我们先来看看Solr日期类型的一些内幕,然后讨论一下Solr日期类型存在的一些问题,最后我们看看怎么解决现存的问题.概述 DateField 在Solr4.x之前,我们只有DateField,这类型现 ...
git解决冲突插件之Beyond Compare
Beyond Compare主要作用: 1. 可以比较文件.文件夹的差异: 2. 将一个文件或文件夹的两个不同版本进行变更合并,生成一个输出. 基于以上两个特性,可以将beyond compare集成 ...
python- do_excel
# @File : class_01_do_excel.py # coding=gbk #pip install openpyxl #新建.xlsx,一定要右键新建 from openpyxl imp ...
mongo数据库的安装与使用
下载mongoDB安装包.https://pan.baidu.com/s/1cvSJtc 默认安装.会在系统盘的program Files文件夹下法相一个MongoDB的文件夹,这个就是软件安装的位置 ...
数据库设计和ER模型-------之ER模型的基本概念（第二章）
ER模型(实体联系模型)的基本元素实体:是一个数据对象,在ER模型中,实体用方框表示,方框内注明实体的名称联系:表示一个或多个实体之间的关联关系,联系用菱形框表示,并用线段将其与相关的实体联系起来 ...
（二）apache atlas配置和运行
上一篇文章,我们已经构建出了altas的安装包,所以我们继续使用安装包配置和运行atlas 首先解压atlas压缩包,授予bin目录下的执行权限 1.默认启动atlas cd atlas/bin/ p ...
58.纯 CSS 创作一只卡通鹦鹉
原文地址:https://segmentfault.com/a/1190000015339977 优化后效果地址:https://scrimba.com/c/c97Z2vuD 感想:消除了图片外的:h ...
《算法》第五章部分程序 part 2
▶ 书中第五章部分程序,包括在加上自己补充的代码,字符串高位优先排序(计数 + 插排),(原地排序),(三路快排,与前面的三路归并排序相同) ● 计数 + 插排 package package01; ...
hadoop hdfs 元数据 journalnode editslog fsimage
先上图,文章以后再上截图有先后所以有些延迟,但是不耽误总体的理解(active-nn=a-nn=active-namenode; s-nn=standby-nn=standby-namenode; ...
自制进度条在python3下PyCharm中运行或在控制台按照目录运行
import timescale = 50print("执行开始".center(scale//2,"-"))start = time.perf_counter ...

Pandas统计分析

Pandas统计分析

基本统计分析函数

数据的累计统计分析

滚动计算(窗口计算)函数

Pandas统计分析的更多相关文章

随机推荐

热门专题