Python基于pandas的数据处理（二）

14 抽样

 df.sample(10, replace = True)

 df.sample(3)

 df.sample(frac = 0.5) # 按比例抽样

 df.sample(frac = 10, replace = True,weights = np.random.randint(1,10,6)) # 对样本加权

 df.sample(3, axis = 1) # 变量抽样

15 join（即 merge）

 pd.merge(df.sample(4), df.sample(4), how = "left", on = "A", indicator = True)

16 随机数

numpy.random.rand(3, 2) # 按维度生成[0,1)之间的均匀分布随机数

np.random.randn(2,5) # 按维度生成标准正太分布随机数

np.random.randint(2, size=10) # randint(low[, high, size])生成随机整数，默认low为0，high必填，size默认为1

np.random.bytes(10) # 返回随机字节

a=np.arange(10)

np.random.shuffle(a) # 洗牌

a=np.arange(9).reshape(3, 3)

np.random.shuffle(a) # 若是数组，则只会打乱第一维

np.random.permutation(10) # 随机排列，对于多维序列也适用

np.random.permutation(10) .reshape(2, 5)

np.random.seed(1000) # 种子

np.random.normal(2,3,[5,2]) # 高斯分布，其他分布可查

# http://docs.scipy.org/doc/numpy-1.10.1/reference/routines.random.html

np.random.seed(12345678)

x = scipy.stats.norm.rvs(loc=5, scale=3, size=100) # 另外scipy也有这些随机数的生成，附带检验

scipy.stats.shapiro(x)

# http://docs.scipy.org/doc/scipy-0.17.0/reference/stats.html

17 gather和spread

 # gather:

 def gather( df, key, value, cols ):

     id_vars = [ col for col in df.columns if col not in cols ]

     id_values = cols

     var_name = key

     value_name = value

     return pandas.melt( df, id_vars, id_values, var_name, value_name )

 # 以上是定义的一个函数，实际上一样的，横变竖，是gather,竖变横，是spread

 pd.melt(df, id_vars=['E','F'], value_vars=['A','C'])

 # spread:

 pd.pivot(df["D"],df["E"],df['F']) #这个是竖变横

 df3=pd.pivot(df2['D'],df2['variable'],df2['value'])

 df3.reset_index(level=0, inplace=True) # 再变回df的样子

18 熵

 scipy.stats.entropy(np.arange(10))

19 字符串拼接

 [",".join(['a','b','d'])]

 df[['E','F']].groupby('F')['E'].apply(lambda x: "{%s}" % ', '.join(x)) # 分组拼接，前提是这些列都要是字符串

 df[['E','F']].applymap(str).groupby('E')['F'].apply(lambda x: "%s" % ', '.join(x)) # 所以可以这样

20 随机字符串生成

 import random,string

 df2 = pd.DataFrame(range(10),columns=['y'])

 df2["x"] = [",".join(random.sample(string.lowercase,random.randint(2,5))) for i in range(10)]

21 分列后生成hash表

 # 用20 的示例数据

 df3=pd.DataFrame(df2.x.str.split(',').tolist(),index=df2.y).stack().reset_index(level=0)

 df3.columns=["y","x"]

22 去重

 df[["F","E"]].drop_duplicates()

23 离散化

 pd.cut(df.A,range(-1,2,1))

Python基于pandas的数据处理（二）的更多相关文章

Python基于pandas的数据处理（一）
import pandas as pd, numpy as np dates = pd.date_range(', periods=6) df = pd.DataFrame(np.random.ran ...
python – 基于pandas中的列中的值从DataFrame中选择行
如何从基于pandas中某些列的值的DataFrame中选择行?在SQL中我将使用: select * from table where colume_name = some_value. 我试图看看 ...
python使用pandas进行数据处理
pandas数据处理关注公众号"轻松学编程"了解更多. 以下命令都是在浏览器中输入. cmd命令窗口输入:jupyter notebook 打开浏览器输入网址http://loc ...
【python】pandas & matplotlib 数据处理绘制曲面图
Python matplotlib模块,是扩展的MATLAB的一个绘图工具库,它可以绘制各种图形建议安装 Anaconda后使用 ,集成了很多第三库,基本满足大家的需求,下载地址,对应选择pytho ...
基于pandas python的美团某商家的评论销售数据分析(可视化）
基于pandas python的美团某商家的评论销售数据分析第一篇数据初步的统计本文是该可视化系列的第二篇第三篇数据中的评论数据用于自然语言处理导入相关库 from pyecharts i ...
基于 Python 和 Pandas 的数据分析(2) --- Pandas 基础
在这个用 Python 和 Pandas 实现数据分析的教程中, 我们将明确一些 Pandas 基础知识. 加载到 Pandas Dataframe 的数据形式可以很多, 但是通常需要能形成行和列的数 ...
基于 Python 和 Pandas 的数据分析(1)
基于 Python 和 Pandas 的数据分析(1) Pandas 是 Python 的一个模块(module), 我们将用 Python 完成接下来的数据分析的学习. Pandas 模块是一个高性 ...
Python：pandas（二）——pandas函数
Python:pandas(一) 这一章翻译总结自:pandas官方文档--General functions 空值:pd.NaT.np.nan //判断是否为空 if a is np.nan: .. ...
基于 Python 和 Pandas 的数据分析(4) --- 建立数据集
这一节我想对使用 Python 和 Pandas 的数据分析做一些扩展. 假设我们是亿万富翁, 我们会想要多元化地进行投资, 比如股票, 分红, 金融市场等, 那么现在我们要聚焦房地产市场, 做一些这 ...

随机推荐

One or more types required to compile a dynamic expression cannot be found.
This is because dynamic keyword is a new C# keyword. So we need to import Microsoft.CSharp.dll. Here ...
gdnz
更新yum库:yum updat yum install epel-release 查看是否安装mysql:rpm -qa|grep -i mysql 移除列表mysql :yum remo ...
MES开发学习一
/*开发批次的当前信息查询界面,显示字段包括批次名,产品名,产品版本,批次数量,开始原因,所有者,当前工序,工艺路线, 工艺路线版本,车间,并能通过批次名,产品名,工序进行过滤和按照批次名正序排列.* ...
linux命令（6）：rmdir 命令
rmdir命令 rmdir是常用的命令,该命令的功能是删除空目录,一个目录被删除之前必须是空的.(注意,rm - r dir命令可代替rmdir,但是有很大危险性.)删除某目录时也必须具有对父目录的写 ...
解决: maven编译项目报“非法字符: \65279 ”错误
打包maven项目的时候,出现异常: [INFO] ------------------------------------------------------------------------ [ ...
css 下拉列表的制作
圣诞节后上课就是不在状态,一整天都在神游,还感觉特别累,本来想休息休息的,结果某人看不惯我一直吃东西,非得把电脑给我打开,让整理今天所学的内容,想了一下,确实上午讲的用无序列表<ul>做的 ...
Jquery遍历选中的input标签
$("input[name='chkAgent']:[checked]").each(function () { alert($(this).attr("value&qu ...
记一次u盘无法格式化、0字节、写保护的解决过程
首先各种找方法,下载了一堆烂七八糟的东西都没能解决后来看了这个链接的文章 http://jingyan.baidu.com/article/6079ad0e5bdec428ff86dbcd.html ...
ABP 仓储VIEW实现
每个view实体加个ID 对应实体属性配置到View的列 View添加一列类似自增序列 ROW_NUMBER() OVER(ORDER BY getdate()) AS ID codefirst时删 ...
JVM内存模型和启动参数的关系
今天开始接触JVM的内存模型这一块的内容,以下这张图是从网上找的,先收藏了,虽然现在还看不太懂.以后弄懂了才进行详细的解说.

Python基于pandas的数据处理（二）

Python基于pandas的数据处理（二）的更多相关文章

随机推荐

热门专题