numpy 与 pandas

numpy:

import numpy as np

np.array([1,2,3]) 创建数组
np.arange(10).reshape(2,5) 类似于range(起始，终止，步长)，可以加reshape(2,5)定义形状。必须是相乘等于前面的size
np.linsapace(1,10,10) 参数为：起始，终止，平分多少个
zeros((2,4)) 根据指定形状和dtype创建全0数组
ones((2,4)) 根据指定形状和dtype创建全1数组
empty((2,4)) 根据指定形状和dtype创建空数组（随机值）
eye(5) 根据指定边长和dtype创建单位矩阵 5*5的矩阵，从0开始的的对角线为1，其他为0
arr[0:2,1:3] 多维数据的切片逗号前是行，后面是列

布尔型索引：

给一个数组，选出数组中所有大于5的数和偶数。
答案：arr[(a>5) & (a%2==0)] 或是| 非是~
花式索引*
对于一个数组，选出其第1，3，4，6，7个元素，组成新的二维数组。
答案：arr[[1,3,4,6,7]]
对一个二维数组，选出其第一列和第三列，组成新的二维数组。
答案：a[:,[1,3]] 解读：行全取，列要1,3

常见通用函数：

二元函数：

浮点数特殊值：

浮点数：float
浮点数有两个特殊值：
nan(Not a Number)：不等于任何浮点数（nan != nan）例如：0/0 或者负数开根号
inf(infinity)：比任何浮点数都大例如：4/0 为无限大
在数据分析中，nan常被用作表示数据缺失值

常用函数：

sum 求和
cumsum 求前缀和
mean 求平均数
std 求标准差
var 求方差
min 求最小值
max 求最大值
argmin 求最小值索引
argmax 求最大值索引

随机数生成函数在np.random子包内
常用函数

rand 给定形状产生随机数组（0到1之间的数）
randint 给定形状产生随机整数
choice 给定形状产生随机选择
shuffle 与random.shuffle相同
uniform 给定形状产生随机数组

pandas：

pandas的主要功能
具备对其功能的数据结构DataFrame、Series
集成时间序列功能
提供丰富的数学运算和操作
灵活处理缺失数据

Series

Series是一种类似于一位数组的对象，由一组数据和一组与之相关的数据标签（索引）组成。
创建方式：

pd.Series([4,7,-5,3])

结果：	0 4

1 7

2 -5

3 3

pd.Series([4,7,-5,3],index=['a','b','c','d'])

结果：	a 4

b 7

c -5

d 3

pd.Series({'a':1, 'b':2})

结果：	a 1

b 2

pd.Series(0, index=['a','b','c','d’])

a 0

结果：	b 0

c 0

d 0

获取值数组和索引数组：values属性和index属性
Series比较像列表（数组）和字典的结合体。

Series支持数组的特性：

从ndarray创建Series：Series(arr)
与标量运算：sr*2
两个Series运算：sr1+sr2
索引：sr[0], sr[[1,2,4]]
切片：sr[0:2]（切片依然是视图形式）
通用函数：np.abs(sr)
布尔值过滤：sr[sr>0]
统计函数：mean() sum() cumsum()

Series支持字典的特性（标签）：

loc
从字典创建Series：Series(dic),
in运算：’a’ in sr、for x in sr
键索引：sr['a'], sr[['a', 'b', 'd']]
键切片：sr['a':'c']
其他函数：get('a', default=0)等

loc属性以标签解释
iloc属性以下标解释

如何在两个Series对象相加时将缺失值设为0？

sr1.add(sr2, fill_value=0)
Series缺失数据 NaN
dropna() 过滤掉值为NaN的行
fillna() 填充缺失数据
isnull() 返回布尔数组，缺失值对应为True ：布尔值索引
notnull() 返回布尔数组，缺失值对应为False
过滤缺失数据：sr.dropna() 或 sr[data.notnull()]
填充缺失数据：fillna(0)

DataFrame

创建方式：
pd.DataFrame({'one':[1,2,3,4],'two':[4,3,2,1]})
pd.DataFrame({'one':pd.Series([1,2,3],index=['a','b','c']), 'two':pd.Series([1,2,3,4],index=['b','a','c','d'])})

DataFrame使用索引切片

方法1：两个中括号，先取列再取行。 df['A'][0]
方法2（推荐）：使用loc/iloc属性，一个中括号，逗号隔开，先取行再取列。
loc属性：解释为标签
iloc属性：解释为下标
向DataFrame对象中写入值时只使用方法2
行/列索引部分可以是常规索引、切片、布尔值索引、花式索引任意搭配。（注意：两部分都是花式索引时结果可能与预料的不同）

通过标签获取：

df['A']
df[['A', 'B']]
df['A'][0]
df[0:10][['A', 'C']]
df.loc[:,['A','B']]
df.loc[:,'A':'C']
df.loc[0,'A']
df.loc[0:10,['A','C']]

通过位置获取：

df.iloc[3]
df.iloc[3,3]
df.iloc[0:3,4:6]
df.iloc[1:5,:]
df.iloc[[1,2,4],[0,3]]

通过布尔值过滤：

df[df['A']>0]
df[df['A'].isin([1,3,5])]
df[df<0] = 0

DataFrame数据对齐与缺失数据
DataFrame处理缺失数据的相关方法：

dropna(axis=0,where='any',…)
fillna()
isnull()
notnull()

pandas常用方法（适用Series和DataFrame）：

mean(axis=0,skipna=False)
sum(axis=1)
sort_index(axis, …, ascending) 按行或列索引排序
sort_values(by, axis, ascending) 按值排序
NumPy的通用函数同样适用于pandas
apply(func, axis=0) 将自定义函数应用在各行或者各列上，func可返回标量或者Series
applymap(func) 将函数应用在DataFrame各个元素上
map(func) 将函数应用在Series各个元素上

numpy 与 pandas的更多相关文章

python安装numpy和pandas
最近要对一系列数据做同比比较,需要用到numpy和pandas来计算,不过使用python安装numpy和pandas因为linux环境没有外网遇到了很多问题就记下来了.首要条件,python版本必须 ...
如何快速地从mongo中提取数据到numpy以及pandas中去
mongo数据通常过于庞大,很难一下子放进内存里进行分析,如果直接在python里使用字典来存贮每一个文档,使用list来存储数据的话,将很快是内存沾满.型号拥有numpy和pandas import ...
numpy、pandas
numpy: 仨属性:ndim-维度个数:shape-维度大小:dtype-数据类型. numpy和pandas各def的axis缺省为0,作用于列,除DataFrame的.sort_index()和 ...
[转] python安装numpy和pandas
最近要对一系列数据做同比比较,需要用到numpy和pandas来计算,不过使用python安装numpy和pandas因为linux环境没有外网遇到了很多问题就记下来了.首要条件,python版本必须 ...
1.理解Numpy、pandas
之前一直做得只是采集数据,而没有再做后期对数据的处理分析工作,自己也是有意愿去往这些方向学习的,最近就在慢慢的接触. 首先简单理解一下numpy和pandas:一.NumPy:1.NumPy是高性能计 ...
numpy和pandas简单使用
numpy和pandas简单使用 import numpy as np import pandas as pd 一维数据分析 numpy中使用array, pandas中使用series numpy一 ...
Python入门之安装numpy和pandas
最近要对一系列数据做同比比较,需要用到numpy和pandas来计算,不过使用python安装numpy和pandas因为linux环境没有外网遇到了很多问题就记下来了. 首要条件,python版本必 ...
python及numpy，pandas易混淆的点
https://blog.csdn.net/happyhorizion/article/details/77894035 初接触python觉得及其友好(类似matlab),尤其是一些令人拍案叫绝不可 ...
【转载】python安装numpy和pandas
转载:原文地址 http://www.cnblogs.com/lxmhhy/p/6029465.html 最近要对一系列数据做同比比较,需要用到numpy和pandas来计算,不过使用python安装 ...
linux离线搭建Python环境及安装numpy、pandas
1.安装python2.7.3 Cent OS 6.5默认装的有python2.6.6,需要重新安装python2.7.3下载地址:https://www.python.org/downloads/s ...

随机推荐

Javascript - ExtJs - 其它
组件通用配置 width:number | "%" //宽 height:number | "%" //高 autoEl:string | Json / ...
Javascript - ExtJs - XTemplate组件
XTemplate组件(Ext.XTemplate) 如果有一些重复的html代码需要装入数据,可以考虑使用XTemplate模板组件.XTemplate可以填入数组.对象,支持条件判断.for循环. ...
SpringBoot的Web配置
重写全局配置如果springboot提供的springmvc配置不符合要求,则可以通过一个配置类(标有@Configuration注解的类)加上@EnableWebMvc注解来实现完全自己控制的mv ...
HBSX2019 3月训练
Day 1 3月有31天废话今天先颓过了就只剩30天了初步计划每天一道字符串/数据结构题图论学习根据<若干图论模型探讨>(lyd)复习二分图与网络流学习 <算法竞赛进阶指 ...
requests库入门06-post请求
示例相应的接口文档:GitHub邮箱接口文档先登录GitHub,然后右上角用户下拉框中选择settings,然后选Emails.可以看到当前账户设置的邮箱情况再看添加邮箱接口的文档描述,可以通过一 ...
U3D虚拟摇杆制作
来自https://www.cnblogs.com/jiuxuan/p/7453762.html 1.创建两个Image,修改第一个Image名称为 Background,把第二个Image放入 Ba ...
题解-bzoj4221 JOI2012kangaroo
Problem bzoj 题意:给定$n$只袋鼠,每只袋鼠有俩属性$a,b$,若$a_i\leq b_j$,则$i$是可以被$j$放置在袋子里的,求经过一系列放置操作后无法进行操作 ...
$Django 多对多-自定义第三张表基于双下划线的跨表查询(补充)
自定义第三张表的好处:可以定义多个字段, 缺点:查询不方便(有方法解决) 1.第三张表设置外键,联合唯一(查询不方便) class Books(models.Model): name=models.C ...
HDU 5446
题意: 大组合数取余 (素数连乘) 思路: 对于答案 X X % pi = ai === C(m,n) % pi: 然后就是用孙子定理求出X, ai 用卢卡斯定理求得中间 LL * LL 会爆, ...
Ex 2_23 如果一个数组超过半数的元素都相同时，该数组被称为含有一个主元素..._第二次作业
将数组A划分为两个数组A1和A2 ,各含有A的一半元素或一半多一个.若A中含有主元素x,则A1和A2中至少有一个数组含有主元素x,对A1和A2递归地计算有无主元素,若A只含有一个元素,则A的主元素就是 ...

numpy 与 pandas

numpy 与 pandas的更多相关文章

随机推荐

热门专题