pandas高级操作总结

1.pandas中的列的分位数

# 查看列的分位数

import pandas as pd

# set columns type

my_df['col'] = my_df['col'].astype(np.float64)

# computations for 4 quantiles : quartiles

bins_col = pd.qcut(my_df['col'], 4)

bins_col_label = pd.qcut(my_df['col'], 4).labels

分位数

2.多重聚合（组函数）

# 多重聚合（组函数）

# columns settings

grouped_on = 'col_0'  # ['col_0', 'col_2'] for multiple columns

aggregated_column = 'col_1'

### Choice of aggregate functions

## On non-NA values in the group

## - numeric choice :: mean, median, sum, std, var, min, max, prod

## - group choice :: first, last, count

# list of functions to compute

agg_funcs = ['mean', 'max']

# compute aggregate values

aggregated_values = my_df.groupby(grouped_on)[aggregated_columns].agg(agg_funcs)

# get the aggregate of group

aggregated_values.ix[group]

多重聚合

3.使用自定义函数进行聚合

# 使用自定义函数进行聚合

# columns settings

grouped_on = ['col_0']

aggregated_columns = ['col_1']

def my_func(my_group_array):

    return my_group_array.min() * my_group_array.count()

## list of functions to compute

agg_funcs = [my_func] # could be many

# compute aggregate values

aggregated_values = my_df.groupby(grouped_on)[aggregated_columns].agg(agg_funcs)

自定义函数进行聚合

4.在聚合的dataframe上使用apply

在聚合中使用apply

# 在聚合的dataframe上使用apply

# top n in aggregate dataframe

def top_n(group_df, col, n=2):

    bests = group_df[col].value_counts()[:n]

    return bests

# columns settings

grouped_on = 'col_0'

aggregated_column = 'col'

grouped = my_df.groupby(grouped_on)

groups_top_n = grouped.apply(top_n, aggregated_column, n=3)

5.移动平均

# 移动平均

import numpy as np

ret = np.cumsum(np.array(X), dtype=float)

ret[w:] = ret[w:] - ret[:-w]

result = ret[w - 1:] / w

# X: array-like

# window: int

移动平均

6.组数据的基本信息

# 组数据的基本信息

# columns settings

grouped_on = 'col_0'  # ['col_0', 'col_1'] for multiple columns

aggregated_column = 'col_1'

### Choice of aggregate functions

## On non-NA values in the group

## - numeric choice : mean, median, sum, std, var, min, max, prod

## - group choice : first, last, count

## On the group lines

## - size of the group : size

aggregated_values = my_df.groupby(grouped_on)[aggregated_column].mean()

aggregated_values.name = 'mean'

# get the aggregate of group

aggregated_values.ix[group]

组数据的基本信息

7.数据组的遍历

数据组的遍历

# 数据组的遍历

# columns settings

grouped_on = 'col_0'  # ['col_0', 'col_1'] for multiple columns

grouped = my_df.groupby(grouped_on)

i = 0

for group_name, group_dataframe in grouped:

    if i > 10:

        break

    i += 1

    print(i, group_name, group_dataframe.mean())  ## mean on all numerical columns

8.最大互信息数

# 最大互信息数

import numpy as np

matrix = np.transpose(np.array(X)).astype(float)

mine = MINE(alpha=0.6, c=15, est="mic_approx")

mic_result = []

for i in matrix[1:]:

    mine.compute_score(t_matrix[0], i)

    mic_result.append(mine.mic())

return mic_result

最大互信息数

9.pearson相关系数

import numpy as np

matrix = np.transpose(np.array(X))

np.corrcoef(matrix[0], matrix[1])[0, 1]

# X: array-like

# https://docs.scipy.org/doc/numpy-1.13.0/reference/generated/numpy.corrcoef.html

pearson相关系数

10.自定义聚合函数

# 自定义聚合函数

def zscore(x):

    return (x - x.mean()) / x.std()

my_df['zscore_col'] = my_df.groupby(grouped_on)[aggregated_column].transform(zscore)

自定义聚合函数

11.标准聚合使用groupby

# 标准聚合使用groupby

# columns settings

grouped_on = 'col_1'

aggregated_column = 'col_0'

### Choice of aggregate functions

## On non-NA values in the group

## - numeric choice : mean, median, sum, std, var, min, max, prod

## - group choice : first, last, count

my_df['aggregate_values_on_col'] = my_df.groupby(grouped_on)[aggregated_column].transform(lambda v: v.mean())

标准聚合使用groupby

12.使用自定义函数设值

# 使用自定义函数设值

def to_log(v):

    try:

        return log(v)

    except:

        return np.nan

my_df['new_col'] = my_df['col_0'].map(to_log)

使用自定义函数设值

13.使用复杂函数设值

# 使用复杂的函数设值

import numpy as np

def complex_formula(col0_value, col1_value):

    return "%s (%s)" % (col0_value, col1_value)

my_df['new_col'] = np.vectorize(complex_formula)(my_df['col_0'], my_df['col_1'])

使用复杂函数设值

14.使用字典dict设值

# 使用字典dict设值

gender_dict={'男':1,'女':2}

df['gender'] = df['gender'].map(gender_dict)

使用字典设值

参考信息：https://www.kesci.com/

pandas高级操作总结的更多相关文章

数据分析06 /pandas高级操作相关案例：人口案例分析、2012美国大选献金项目数据分析
数据分析06 /pandas高级操作相关案例:人口案例分析.2012美国大选献金项目数据分析目录数据分析06 /pandas高级操作相关案例:人口案例分析.2012美国大选献金项目数据分析 1. ...
pandas高级操作
pandas高级操作 import numpy as np import pandas as pd from pandas import DataFrame,Series 替换操作替换操作可以同步作 ...
数据分析05 /pandas的高级操作
数据分析05 /pandas的高级操作目录数据分析05 /pandas的高级操作 1. 替换操作 2. 映射操作 3. 运算工具 4. 映射索引 / 更改之前索引 5. 排序实现的随机抽样/打乱表 ...
Pandas高级教程之:GroupBy用法
Pandas高级教程之:GroupBy用法目录简介分割数据多index get_group dropna groups属性 index的层级 group的遍历聚合操作通用聚合方法同时使用 ...
[Session] SessionHelper2---C#关于Session高级操作帮助类（转载）
点击下载 SessionHelper2.rar 这个类是关于Session的一些高级操作1.添加时限制时间2.读取对象3.读取数据等等看下面代码吧 /// <summary> /// 联系 ...
cassandra高级操作之索引、排序以及分页
本次就给大家讲讲cassandra的高级操作:索引.排序和分页:处于性能的考虑,cassandra对这些支持都比较简单,所以我们不能希望cassandra完全适用于我们的逻辑,而是应该将我们的逻辑设计 ...
pandas小记：pandas高级功能
http://blog.csdn.net/pipisorry/article/details/53486777 pandas高级功能:面板数据.字符串方法.分类.可视化. 面板数据 {pandas数据 ...
MySQL学习笔记_9_MySQL高级操作（上）
MySQL高级操作(上) 一.MySQL表复制 create table t2 like t1; #复制表结构,t2可以学习到t1所有的表结构 insert into t2 ...
MySQL学习笔记_10_MySQL高级操作（下）
MySQL高级操作(下) 五.MySQL预处理语句 1.设置预处理stmt,传递一个数据作为where的判断条件 prepare stmt from "select * from table ...

随机推荐

Automapper问题记录
在Automapper使用中会碰到一些未能映射或者错误的问题,这些问题可能会经常忘记如何处理,想到一些就记录一些: 映射值有时为空又不报错的情况这很可能是由于目标类中的部分属性有问题导致的,最简单的 ...
[PY3]——对iterator的处理（解析式、map、reduce、filter）
引言对iterator一般可以用for in方法处理,但有时可以借助更高效.也更易读的方式去处理. 例如解析式(包括列表解析式.生成器解析式.集合解析式.字典解析式), 例如map( ).reduc ...
RabbitMQ上手记录–part 5-节点集群高可用(多服务器)
上一part<RabbitMQ上手记录–part 4-节点集群(单机多节点)>中介绍了RabbitMQ集群的一些概念以及实现了在单机上运行多个节点,并且将多个节点组成一个集群. 通常情况下 ...
Git报错：error: cannot open .git/FETCH_HEAD: Read-only file system
Git:git pull时报错 error: cannot open .git/FETCH_HEAD: Read-only file system 查看该文件: 未在网上找到解决办法,重启服务器就好了 ...
JS中的拖动之—— ondragstart，ondrag，ondragend ， ondragenter ， ondragover ， ondragleave， ondrop 的区别
关于 HTML5 中的拖动功能. 更多信息可以查看我们 HTML 教程中的 HTML5 拖放.以下我只做一下简介. 1 如果你想让元素变得可拖动,首先你得对元素设置 draggable 属性此属 ...
javascript中字符串常用操作总结
String对象属性 (1) length属性 length算是字符串中非常常用的一个属性了,它的功能是获取字符串的长度.当然需要注意的是js中的中文每个汉字也只代表一个字符,这里可能跟其他语言有些不 ...
Winfrom 基于TCP的Socket服务端多线程（进阶版）
using System; using System.Collections.Generic; using System.ComponentModel; using System.Data; usin ...
ffmpeg按比例缩放--"width / height not divisible by 2" 解决方法
最近在处理视频的时候,有这么一个需求如果视频的分辨率宽度大于960的话,就把宽度设为960,而高度按其比例进行缩放如果视频的分辨率高度大于540的话,就把高度设为540,而宽度按其比例进行缩放之 ...
532 -数组中的K-diff对
例1: 输入: [3,1,4,1,5],k = 2 输出: 2 说明:阵列中有两个2-diff对,(1,3)和(3,5). 虽然我们在输入中有两个1,但我们应该只返回唯一对的数量. 例2: 输入: ...
根据多个点使用canvas贝赛尔曲线画一条平滑的曲线
众所周知想用canvas画一条曲线我们可以使用这些函数: 二次曲线:quadraticCurveTo(cp1x, cp1y, x, y) 贝塞尔曲线:bezierCurveTo(cp1x, cp1y, ...

pandas高级操作总结

pandas高级操作总结的更多相关文章

随机推荐

热门专题