Pandas Statistical Functions
import pandas as pd
import random
import numpy as np
n_rows=5
n_cols=2
df = pd.DataFrame(np.random.randn(n_rows, n_cols),
index = pd.date_range('1/1/2000', periods=n_rows),
columns = ['A','B'])
df=df.apply(lambda x:[int(xx*10) for xx in x],axis=0)
df
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | -18 | 3 |
| 2000-01-02 | 5 | -4 |
| 2000-01-03 | -2 | 8 |
| 2000-01-04 | 0 | 1 |
| 2000-01-05 | -18 | 3 |
pct_change
## pct_change() to compute the percent change over a given number of periods
df.pct_change(periods=1) # b{t}=(a{t}-a{t-1})/a{t-1}
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | NaN | NaN |
| 2000-01-02 | -1.277778 | -2.333333 |
| 2000-01-03 | -1.400000 | -3.000000 |
| 2000-01-04 | -1.000000 | -0.875000 |
| 2000-01-05 | -inf | 2.000000 |
df.pct_change(periods=2) # b{t}=(a{t}-a{t-2})/a{t-2}
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | NaN | NaN |
| 2000-01-02 | NaN | NaN |
| 2000-01-03 | -0.888889 | 1.666667 |
| 2000-01-04 | -1.000000 | -1.250000 |
| 2000-01-05 | 8.000000 | -0.625000 |
Covariance
df.cov()
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| A | 114.80 | -17.85 |
| B | -17.85 | 18.70 |
df.A.cov(df.B)
-17.849999999999998
Correlation
df.corr()
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| A | 1.000000 | -0.385253 |
| B | -0.385253 | 1.000000 |
Data ranking
df.rank()
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | 1.5 | 3.5 |
| 2000-01-02 | 5.0 | 1.0 |
| 2000-01-03 | 3.0 | 5.0 |
| 2000-01-04 | 4.0 | 2.0 |
| 2000-01-05 | 1.5 | 3.5 |
df.rank(axis=1)
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | 1.0 | 2.0 |
| 2000-01-02 | 2.0 | 1.0 |
| 2000-01-03 | 1.0 | 2.0 |
| 2000-01-04 | 1.0 | 2.0 |
| 2000-01-05 | 1.0 | 2.0 |
method parameter:
average : average rank of tied group
min : lowest rank in the group
max : highest rank in the group
first : ranks assigned in the order they appear in the array
Window Functions
cumsum
df
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | -18 | 3 |
| 2000-01-02 | 5 | -4 |
| 2000-01-03 | -2 | 8 |
| 2000-01-04 | 0 | 1 |
| 2000-01-05 | -18 | 3 |
df.cumsum()
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | -18 | 3 |
| 2000-01-02 | -13 | -1 |
| 2000-01-03 | -15 | 7 |
| 2000-01-04 | -15 | 8 |
| 2000-01-05 | -33 | 11 |
rolling
df
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | -18 | 3 |
| 2000-01-02 | 5 | -4 |
| 2000-01-03 | -2 | 8 |
| 2000-01-04 | 0 | 1 |
| 2000-01-05 | -18 | 3 |
r=df.rolling(window=2)
r.mean()
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | NaN | NaN |
| 2000-01-02 | -6.5 | -0.5 |
| 2000-01-03 | 1.5 | 2.0 |
| 2000-01-04 | -1.0 | 4.5 |
| 2000-01-05 | -9.0 | 2.0 |
r.count()
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | 1.0 | 1.0 |
| 2000-01-02 | 2.0 | 2.0 |
| 2000-01-03 | 2.0 | 2.0 |
| 2000-01-04 | 2.0 | 2.0 |
| 2000-01-05 | 2.0 | 2.0 |
r.max()
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | NaN | NaN |
| 2000-01-02 | 5.0 | 3.0 |
| 2000-01-03 | 5.0 | 8.0 |
| 2000-01-04 | 0.0 | 8.0 |
| 2000-01-05 | 0.0 | 3.0 |
| Method | Description |
|---|---|
| count() | Number of non-null observations |
| sum() | Sum of values |
| mean() | Mean of values |
| median() | Arithmetic median of values |
| min() | Minimum |
| max() | Maximum |
| std() | Bessel-corrected sample standard deviation |
| var() | Unbiased variance |
| skew() | Sample skewness (3rd moment) |
| kurt() | Sample kurtosis (4th moment) |
| quantile() | Sample quantile (value at %) |
| apply() | Generic apply |
| cov() | Unbiased covariance (binary) |
| corr() | Correlation (binary) |
win_type can specify distribution function.
parameter 'on' to specify a column (rather than the default of the index) in a DataFrame.
df
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | -18 | 3 |
| 2000-01-02 | 5 | -4 |
| 2000-01-03 | -2 | 8 |
| 2000-01-04 | 0 | 1 |
| 2000-01-05 | -18 | 3 |
df.rolling(window='3d',min_periods=3).sum() ## 最近三天
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | NaN | NaN |
| 2000-01-02 | NaN | NaN |
| 2000-01-03 | -15.0 | 7.0 |
| 2000-01-04 | 3.0 | 5.0 |
| 2000-01-05 | -20.0 | 12.0 |
expanding
df
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | -18 | 3 |
| 2000-01-02 | 5 | -4 |
| 2000-01-03 | -2 | 8 |
| 2000-01-04 | 0 | 1 |
| 2000-01-05 | -18 | 3 |
df.expanding().mean() ## statistic with all data up to a point in time
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | -18.00 | 3.000000 |
| 2000-01-02 | -6.50 | -0.500000 |
| 2000-01-03 | -5.00 | 2.333333 |
| 2000-01-04 | -3.75 | 2.000000 |
| 2000-01-05 | -6.60 | 2.200000 |
Exponentially Weighted Windows(ewm)
df
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | -18 | 3 |
| 2000-01-02 | 5 | -4 |
| 2000-01-03 | -2 | 8 |
| 2000-01-04 | 0 | 1 |
| 2000-01-05 | -18 | 3 |
df.ewm(alpha=0.9).mean()
.dataframe tbody tr th:only-of-type {
vertical-align: middle;
}
.dataframe tbody tr th {
vertical-align: top;
}
.dataframe thead th {
text-align: right;
}
| A | B | |
|---|---|---|
| 2000-01-01 | -18.000000 | 3.000000 |
| 2000-01-02 | 2.909091 | -3.363636 |
| 2000-01-03 | -1.513514 | 6.873874 |
| 2000-01-04 | -0.151215 | 1.586859 |
| 2000-01-05 | -16.215282 | 2.858699 |
Pandas Statistical Functions的更多相关文章
- 小白学 Python 数据分析(2):Pandas (一)概述
人生苦短,我用 Python 前文传送门: 小白学 Python 数据分析(1):数据分析基础 概览 首先还是几个官方链接放一下: Pandas 官网:https://pandas.pydata.or ...
- Why Apache Spark is a Crossover Hit for Data Scientists [FWD]
Spark is a compelling multi-purpose platform for use cases that span investigative, as well as opera ...
- Scipy教程 - 统计函数库scipy.stats
http://blog.csdn.net/pipisorry/article/details/49515215 统计函数Statistical functions(scipy.stats) Pytho ...
- scipy.stats
scipy.stats Scipy的stats模块包含了多种概率分布的随机变量,随机变量分为连续的和离散的两种.所有的连续随机变量都是rv_continuous的派生类的对象,而所有的离散随机变量都是 ...
- GitHub相关资料&&可以参加的开源项目
GitHub相关的资料 有不懂的地方时可以看GitHub Docs. GitHub tutorial GitHub glossary GitHub的字典,可以看到里面特定的概念. All about ...
- R实战 第十二篇:随机数
由R生成的随机数实际上伪随机数,也就是说,随机数是由某种算法而不是真正的随机过程产生的,随机数生成器需要一个初始值来生成数字,该初始值叫做种子.通过把种子设置为特定的值,可以保证每次运行同一段代码时都 ...
- PP图和QQ图
一. QQ图 分位数图示法(Quantile Quantile Plot,简称 Q-Q 图) 统计学里Q-Q图(Q代表分位数)是一个概率图,用图形的方式比较两个概率分布,把他们 ...
- D01-R语言基础学习
R语言基础学习——D01 20190410内容纲要: 1.R的下载与安装 2.R包的安装与使用方法 (1)查看已安装的包 (2)查看是否安装过包 (3)安装包 (4)更新包 3.结果的重用 4.R处理 ...
- matlab toolboxes 大全
MATLAB Toolboxes top (Top) Audio - Astronomy - BiomedicalInformatics - Chemometrics - Chaos - Chemi ...
随机推荐
- 【Springboot】注解@ConfigurationProperties让配置整齐而简单
1 简介 前面我们用一篇文章<[Spring]只想用一篇文章记录@Value的使用,不想再找其它了(附思维导图)> 详细讲解了在Spring中如何使用@Value来实现我们对配置的需求,它 ...
- rabbitmq系列(一)初识rabbitmq
为什么要使用消息中间件 案例:假如我们开发了一个商品抢购网站.这个网站的目的就是在某一时间点进行抢购商品,同时要求用户注册,在注册的时候会同时给用户电话和邮箱中发送验证码,以便完成信息注册.传统做法应 ...
- Go语言教程之结构体
Hello,大家好,我是小栈君,最近因为工作的事情延误了一点分享的进度,但是我会尽量抽时间分享关于IT干货知识,还希望大家能够持续关注"IT干货栈"哦. 闲话不多说,今天给大家继续 ...
- Netty快速入门(05)Java NIO 介绍-Selector
Java NIO Selector Selector是Java NIO中的一个组件,用于检查一个或多个NIO Channel的状态是否处于可读.可写.如此可以实现单线程管理多个channels,也就是 ...
- 【阿里云IoT+YF3300】11.物联网多设备快速通信级联
我们见到的很多物联网设备,大都是“一跳”上网,所谓的“一跳”就是设备直接上网,内嵌物联网模块或者通过DTU直接上网.其实稍微复杂的物联网现场,往往网关下面连接若干物联网设备(如下图),并且这些物联网设 ...
- 那些不懂hystrix的秘密
一 前言 springcloud系列文章已经出到hystrix,中间知识追寻者跑去学了其它知识,回来感觉spingcloud系列出的也不少了:需要完全理解这篇文章对于初学者需要有一定的基础知识,如果看 ...
- 【 Tomcat 】tomcat8.0 基本参数调优配置-----(2)
Tomcat 的缺省配置是不能稳定长期运行的,也就是不适合生产环境,它会死机,让你不断重新启动,甚至在午夜时分唤醒你.对于操作系统优化来说,是尽可能的增大可使用的内存容量.提高CPU 的频率,保证文件 ...
- Redis高可用方案-哨兵与集群
Redis高可用方案 一.名词解释 二.主从复制 Redis主从复制模式可以将主节点的数据同步给从节点,从而保障当主节点不可达的情况下,从节点可以作为 后备顶上来,并且可以保障数据尽量不丢失(主从 ...
- hdu6601 主席树
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=6601 Problem Description N sticks are arranged in a r ...
- java 三元运算
一.格式: 数据类型 变量名称 = 条件判断 ? 表达式a : 表达式b; 二.注意: 1.不是打印操作时,需要 三元运算的右则 2.表达式a和表达式b的值,必须要和变量名称 的数据类型相等 貌似和C ...