Pandas | 26 疏离数据

当任何匹配特定值的数据(NaN/缺失值，尽管可以选择任何值)被省略时，稀疏对象被“压缩”。一个特殊的SparseIndex对象跟踪数据被“稀疏”的地方。这将在一个例子中更有意义。所有的标准Pandas数据结构都应用了to_sparse方法 -

import pandas as pd

import numpy as np

ts = pd.Series(np.random.randn(10))

ts[2:-2] = np.nan

sts = ts.to_sparse()

print (sts)

输出结果：

0   -0.391926

1   -1.774880

2         NaN

3         NaN

4         NaN

5         NaN

6         NaN

7         NaN

8    0.642988

9   -0.373698

dtype: float64

BlockIndex

Block locations: array([0, 8])

Block lengths: array([2, 2])

为了内存效率的原因，所以需要稀疏对象的存在。

现在假设有一个大的NA DataFrame并执行下面的代码 -

import pandas as pd

import numpy as np

df = pd.DataFrame(np.random.randn(10000, 4))

df.ix[:9998] = np.nan

sdf = df.to_sparse()

print (sdf.density)

输出结果：

0.0001

通过调用to_dense可以将任何稀疏对象转换回标准密集形式 -

import pandas as pd

import numpy as np

ts = pd.Series(np.random.randn(10))

ts[2:-2] = np.nan

sts = ts.to_sparse()

print (sts.to_dense())

输出结果：

0   -0.275846

1    1.172722

2         NaN

3         NaN

4         NaN

5         NaN

6         NaN

7         NaN

8   -0.612009

9   -1.413996

dtype: float64

稀疏Dtypes

稀疏数据应该具有与其密集表示相同的dtype。目前，支持float64，int64和booldtypes。取决于原始的dtype，fill_value默认值的更改 -

float64 − np.nan
int64 − 0
bool − False

执行下面的代码来理解相同的内容 -

import pandas as pd

import numpy as np

s = pd.Series([1, np.nan, np.nan])

print (s)

print ("=============================")

s.to_sparse()

print (s)

输出结果：

0    1.0

1    NaN

2    NaN

dtype: float64

=============================

0    1.0

1    NaN

2    NaN

dtype: float64

Pandas | 26 疏离数据的更多相关文章

[数据清洗]-使用 Pandas 清洗“脏”数据
概要准备工作检查数据处理缺失数据添加默认值删除不完整的行删除不完整的列规范化数据类型必要的转换重命名列名保存结果更多资源 Pandas 是 Python 中很流行的类库,使用它可 ...
[数据清洗]- Pandas 清洗“脏”数据（二）
概要了解数据分析数据问题清洗数据整合代码了解数据在处理任何数据之前,我们的第一任务是理解数据以及数据是干什么用的.我们尝试去理解数据的列/行.记录.数据格式.语义错误.缺失的条目以及错误的 ...
[数据清洗]- Pandas 清洗“脏”数据（三）
预览数据这次我们使用 Artworks.csv ,我们选取 100 行数据来完成本次内容.具体步骤: 导入 Pandas 读取 csv 数据到 DataFrame(要确保数据已经下载到指定路径) D ...
Python利用pandas处理Excel数据的应用
Python利用pandas处理Excel数据的应用最近迷上了高效处理数据的pandas,其实这个是用来做数据分析的,如果你是做大数据分析和测试的,那么这个是非常的有用的!!但是其实我们平时在做 ...
Pandas学习1 --- 数据载入
import numpy as np import pandas as pd 数据加载首先,我们需要将收集的数据加载到内存中,才能进行进一步的操作.pandas提供了非常多的读取数据的函数,分别应用 ...
[数据清洗]-Pandas 清洗“脏”数据（一）
概要准备工作检查数据处理缺失数据添加默认值删除不完整的行删除不完整的列规范化数据类型必要的转换重命名列名保存结果更多资源 Pandas 是 Python 中很流行的类库,使用它可 ...
【python基础】利用pandas处理Excel数据
参考:https://www.cnblogs.com/liulinghua90/p/9935642.html 一.安装第三方库xlrd和pandas 1:pandas依赖处理Excel的xlrd模块, ...
Python3 Pandas的DataFrame数据的增、删、改、查
Python3 Pandas的DataFrame数据的增.删.改.查一.DataFrame数据准备增.删.改.查的方法有很多很多种,这里只展示出常用的几种. 参数inplace默认为False,只 ...
Pandas透视表处理数据（转）
手把手教你用Pandas透视表处理数据(附学习资料) 2018-01-06 数据派THU 来源:伯乐在线 - PyPer 本文共2203字,建议阅读5分钟.本文重点解释pandas中的函数pivot ...

随机推荐

在Visual Studio中新增生成项目
在Visual Studio中新增生成项目选择适配器类型选择WCF-SQL适配器创建连接选项选择相应的存储过程生成相应的消息架构
proxy 简化版本
public interface People { public String eat(String param); } public class Jack implements People { @ ...
luogu P1533 可怜的狗狗 |莫队+二分
题目背景小卡由于公务需要出差,将新家中的狗狗们托付给朋友嘉嘉,但是嘉嘉是一个很懒的人,他才没那么多时间帮小卡喂狗狗. 题目描述小卡家有N只狗,由于品种.年龄不同,每一只狗都有一个不同的漂亮值.漂亮 ...
从时序异常检测（Time series anomaly detection algorithm）算法原理讨论到时序异常检测应用的思考
1. 主要观点总结 0x1:什么场景下应用时序算法有效历史数据可以被用来预测未来数据,对于一些周期性或者趋势性较强的时间序列领域问题,时序分解和时序预测算法可以发挥较好的作用,例如: 四季与天气的关 ...
2019-11-29-C#-反射调用私有事件
原文:2019-11-29-C#-反射调用私有事件 title author date CreateTime categories C# 反射调用私有事件 lindexi 2019-11-29 08: ...
关于Panel隐藏横向滚动条
不设置控件的AutoScroll属性,在后台写代码,就可以隐藏掉横向滚动条
SqlServer简单的操作XML以及SQl的 try catch等统一格式
1:SqlServer简单的操作XML: ALTER PROCEDURE [dbo].[SP_CRM_FranchiseeRecharge_Money] @Create_By VARCHAR(), @ ...
python每日经典算法题5(基础题)+1(较难题)
一:基础算法题5道 1.阿姆斯特朗数如果一个n位正整数等于其各位数字的n次方之和,则称该数为阿姆斯特朗数.判断用户输入的数字是否为阿姆斯特朗数. (1)题目分析:这里要先得到该数是多少位的,然后再把 ...
Math基础使用
/* java.lang.Math类是数学相关的工具类,里面提供的大量静态方法,完成与数学运算的操作 public static double abs(double num):获取绝对值. publi ...
git远程写协作同步
1:创建一个要提交的文件2 git init 初始化 3 git remote add origin https://github.com/maohongli/cang.git 建立远程连接4 git ...

Pandas | 26 疏离数据

稀疏Dtypes

Pandas | 26 疏离数据的更多相关文章

随机推荐

热门专题