pandas 10分钟教程(二)

重点发法

分组 groupby('列名') groupby(['列名1','列名2',.........])

分组的步骤

(Splitting) 按照一些规则将数据分为不同的组,拆分
(Applying) 对于每组数据分别执行一个函数.'应用,申请'
(Combining) 将结果组合到一个数据结构, '组合/合并'

import pandas as pd
#根据A分组后求和
df.groupby('A').sum()
#分组,指定具体列的出来函数    #reset_index 重置索引
df.group(by=['列1','列2',....]).agg({'列名':['max','min']}).reset_index()

#agg/apply:指定具体的处理函数,,,可以 写自定义函数

分组后的统计方法

size() = count()
max(),min(),mean() 最大最小,平均数
std()
median() 中位数
frist() ,last() 第一个和最后一个非NA值
prod 非NA值得积

以上统计函数,除了count()外,都会自动过滤非数字列!!!!

排重:duplicated
1. 检查重复的数据:df.duplicated()
2. 检查重复指定列名:df.duplicated(['列1','列2',....])
3. 删除重复数据:df.drop_duolicates()
4. 删除时指定保留的数据： df.drop_duplicates(['列1'，.......],keep='frist/last')
  - keep:保存
  - frist:第一个，last:最后一个
数据透视表(和groupby()类似)
1. df.pibot_table(df,index=['列1','列2',...],values='列名',aggfunc=np.mean/sum)
  - index : 需要排序的列
  - values : 需要统计的列
  - aggfunc : 执行的统计函数,不写默认统计平均值
分组替换: Categories 分组/分类,
1. 实现第二列分组比替换数据:
  - df['新列名'] = df['B'].astype('category');转化为分类/分组类型
  - 分配列名: df['新列名'].cat.set_categories((值1,值2,.......))
  - 重新设置:　df['新列名'] = df['新列名'].cat_set_categories([值一，值二，...])

读写文件
1. HDF5: 存储打数据,方便和其他语言对接,
  - to_hdf()
  - read_hdf()
2. 表格:excel
  - read_excel('path',sheet_name='子页名')
  - to_excel(path)

Python数据分析Pandas库之熊猫(10分钟二)的更多相关文章

Python数据分析Pandas库之熊猫(10分钟一)
pandas熊猫10分钟教程排序 df.sort_index(axis=0/1,ascending=False/True) df.sort_values(by='列名') import numpy ...
Python数据分析Pandas库方法简介
Pandas 入门 Pandas简介背景:pandas是一个Python包,提供快速,灵活和富有表现力的数据结构,旨在使“关系”或“标记”数据的使用既简单又直观.它旨在成为在Python中进行实际, ...
Python数据分析Pandas库数据结构(一)
pandas数据结构 1.生成一维矩阵模拟数据 import pandas as pdimport numpy as nps = pd.Series([1,2,3,4,np.nan,9,9])s2 = ...
Python数据分析 Pandas模块基础数据结构与简介(二)
重点方法分组:groupby('列名') groupby(['列1'],['列2'........]) 分组步骤: (spiltting)拆分按照一些规则将数据分为不同的组 (Applying)申 ...
Python数据分析--Pandas知识点(二)
本文主要是总结学习pandas过程中用到的函数和方法, 在此记录, 防止遗忘. Python数据分析--Pandas知识点(一) 下面将是在知识点一的基础上继续总结. 13. 简单计算新建一个数据表 ...
Python数据分析--Pandas知识点(三)
本文主要是总结学习pandas过程中用到的函数和方法, 在此记录, 防止遗忘. Python数据分析--Pandas知识点(一) Python数据分析--Pandas知识点(二) 下面将是在知识点一, ...
Python的Pandas库简述
pandas 是 python 的数据分析处理库import pandas as pd 1.读取CSV.TXT文件 foodinfo = pd.read_csv("pandas_study. ...
Python之Pandas库常用函数大全（含注释）
前言:本博文摘抄自中国慕课大学上的课程<Python数据分析与展示>,推荐刚入门的同学去学习,这是非常好的入门视频. 继续一个新的库,Pandas库.Pandas库围绕Series类型和D ...
Python数据分析-Pandas（Series与DataFrame）
Pandas介绍: pandas是一个强大的Python数据分析的工具包,是基于NumPy构建的. Pandas的主要功能: 1)具备对其功能的数据结构DataFrame.Series 2)集成时间序 ...

随机推荐

[LeetCode] Number of Subarrays with Bounded Maximum 有界限最大值的子数组数量
We are given an array A of positive integers, and two positive integers L and R (L <= R). Return ...
ng7 设置文件路径别名
/tsconfig.json 配置后重启服务 { "compileOnSave": false, "compilerOptions": { "base ...
小程序展开收缩文字demo
demo效果图: wxml 代码: <view class="{{ellipsis?'ellipsis':'unellipsis'}}">五险一金五五险一金险险一金五五 ...
Invalid bound statement (not found): com.xsw.dao.CategoryDao.getCategoryById] with root cause
五月 30, 2018 11:11:03 上午 org.apache.catalina.core.StandardWrapperValve invoke严重: Servlet.service() fo ...
第6周Java学习任务
一.阅读ManagerTest 1.UML图 : 2.e.getSalary()到底是调用Manager类的还是Employee类的getSalary方法? stuff[0]中存的是Manager对象 ...
EF Oracle TNS 连接
<oracle.manageddataaccess.client> <version number="*"> <settings> <se ...
我了解到的新知识之----遇到路由器DNS被篡改我该怎么办？
最近一则新闻让我不得不开始重视家中一直沉默在角落里路由器了. http://www.21ic.com/tougao/article/8346.html 于是立刻搜索了一些关于如何检查DNS地址是否被修 ...
Ultimate Facebook Messenger for Business Guide (Feb 2019)
Ultimate Facebook Messenger for Business Guide (Updated: Feb 2019) By Iaroslav Kudritskiy November 2 ...
PPTPD 服务搭建
查看系统发行版 uname -a 安装pptpd 服务 apt-get -y install ppp pptpd 配置 PPTPD 文件 vim /etc/pptpd.conf #去掉注释 local ...
Ansoftmaxwell15.0
电场磁场仿真软件安装出现问题: 基本问题都一样: 解决方式1:安装路径不要有中文的路径. 若安装提示vc++2005x86 安装失败问题是:没有安装vc++2005 请安装vc++2005 x86 ...

Python数据分析Pandas库之熊猫(10分钟二)

pandas 10分钟教程(二)

重点发法

分组后的统计方法

Python数据分析Pandas库之熊猫(10分钟二)的更多相关文章

随机推荐

热门专题