pandas包 —— drop()、sort_values()、drop

一、drop() 函数

当你要删除某一行或者某一列时，用drop函数，它不改变原有的df中的数据，而是返回另一个dataframe来存放删除后的数据。

1.命令：　　df.drop()

　　删除行：df.drop('apps') 　　　#drop函数的参数默认 axis=0

　　删除列：df.dorp('col', axis=1) #删除列要加axis=1，默认是删除行的

temp = deviceid_packages.drop('apps', axis=1)

temp1 = deviceid_packages.drop(['apps'], axis=1)

二、sort_values()函数

pandas中的sort_values()函数原理类似于SQL中的order by，可以将数据集依照某个字段中的数据进行排序，该函数即可根据指定列数据也可根据指定行的数据排序。

1.sort_values()函数的具体参数

Usage：

DataFrame.sort_values(by=‘##’,axis=0,ascending=True, inplace=False, na_position=‘last’)

2.参数说明：

参数	说明
by	指定列名(axis=0或’index’)或索引值(axis=1或’columns’)
axis	若axis=0或’index’，则按照指定列中数据大小排序；若axis=1或’columns’，则按照指定索引中数据大小排序，默认axis=0
ascending	是否按指定列的数组升序排列，默认为True，即升序排列
inplace	是否用排序后的数据集替换原来的数据，默认为False，即不替换
na_position	{‘first’,‘last’}，设定缺失值的显示位置

#注意sort_values()函数与drop()函数的参数axis表示的相反

三、drop_duplicates()函数

参考:https://www.cnblogs.com/xxswkl/p/10989306.html

dataframe删除某一列的重复元素，默认只留下第一次出现的

inplace参数设置为true时直接在原数据上修改,为False时,生成副本.

#注意：所有函数中inplace一旦设置为True,它整体已经就是None.想要再跟函数只能再写一行.

且此时在前面也不能赋值,赋值也是None.因为设置为True时,整体是None,设置为False时,整体是一个引用,可以赋给其它变量.

a1 = pd.DataFrame({

                    'a': [1, 1, 3, 2,],

                    'b': [1, 1, 6, 4,],

                    'c': [1, 1, 3, 9,]

                  })

print(a1)

#    a  b  c

# 0  1  1  1

# 1  1  1  1

# 2  3  6  3

# 3  2  4  9

a1.drop_duplicates(inplace=True)

print(a1)

#    a  b  c

# 0  1  1  1

# 2  3  6  3

# 3  2  4  9

# 这里inplace为假，整体实际上是一个引用，所以可以直接输出.

print(a1.drop_duplicates(['a','b'], keep='first',inplace=False)) #删除a，b两列重复的行，并且保留首次出现的哪一行

#    a  b  c

# 0  1  1  1

# 2  3  6  3

# 3  2  4  9

# 注意这里因为inplace为真，直接在原数据上修改，直接输出是空，因为它并不是一个引用，a1才是引用.

print(a1.drop_duplicates(['a','b'], keep='first',inplace=True))

# None

想要留下去掉的重复行，可以先删除重复行后，保存索引，再删除索引.

import pandas as pd

import numpy as np

import re

df = pd.DataFrame({'a': [1,1,3,4,3],

                   'b': [1,1,3,4,3],

                   'c': [1,1,3,4,3]})

print('原始数据：\n',df)

# 原始数据：

#     a  b  c

# 0  1  1  1

# 1  1  1  1

# 2  3  3  3

# 3  4  4  4

# 4  3  3  3

print('去掉重复行后：\n', df.drop_duplicates())

# 去掉重复行后：

#     a  b  c

# 0  1  1  1

# 2  3  3  3

# 3  4  4  4

drop_index = df.drop_duplicates().index.tolist()

print('去掉的重复行是：\n',df.drop(drop_index))

# 去掉的重复行是：

#     a  b  c

# 1  1  1  1

# 4  3  3  3

#参数inplace=默认为假，数据框df还是原来的没有改变

print(df)

#     a  b  c

# 0  1  1  1

# 1  1  1  1

# 2  3  3  3

# 3  4  4  4

# 4  3  3  3

pandas包 —— drop()、sort_values()、drop_duplicates()的更多相关文章

pandas Series的sort_values()方法
pandas Series的 sort_values() 方法能对Series进行排序,返回一个新的Series: s = pd.Series([np.nan, 1, 3, 10, 5]) 升序排列: ...
沉淀，再出发：python中的pandas包
沉淀,再出发:python中的pandas包一.前言 python中有很多的包,正是因为这些包工具才使得python能够如此强大,无论是在数据处理还是在web开发,python都发挥着重要的作用,下 ...
python读取数据文件：pandas包详解
本文转载自https://blog.csdn.net/brucewong0516/article/details/79092579 pandas包是一个高效的文件读取工具,适用于txt,excel,等 ...
Python之路-pandas包的详解与使用
什么是pandas pandas是一种Python数据分析的利器,是一个开源的数据分析包,最初是应用于金融数据分析工具而开发出来的,因此pandas为时间序列分析提供了很好的支持.pandas是PyD ...
pandas包学习笔记
目录 zip Importing & exporting data Plotting with pandas Visual exploratory data analysis 折线图散点图 ...
Lesson11——Pandas去重函数：drop_duplicates()
pandas目录 "去重"通过字面意思不难理解,就是删除重复的数据.在一个数据集中,找出重复的数据删并将其删除,最终只保存一个唯一存在的数据项,这就是数据去重的整个过程.删除重复数 ...
pandas的drop函数
当你要删除某一行或者某一列时,用drop函数,它不改变原有的df中的数据,而是返回另一个dataframe来存放删除后的数据. 1.命令: df.drop() 删除行:df.drop('apps') ...
pandas 排序之 sort_values，reindex，reset_index， sort_index
如果想按照自己的方式排序ind = 行索引data= data[ind] ind = data.sum(axis=1).sort_values(ascending=False).index data ...
Python使用xlrd、pandas包从Excel读取数据
#coding=utf-8 # pip install xlrd import xlrd def read_from_xls(filepath,index_col_list): #filepath:读 ...

随机推荐

Go文档：go命令
目录 go go bug--启动bug报告 go build--编译包及其依赖包 go clean--删除对象文件和缓存文件 go doc--查看包或符号的文档 go env--打印环境变量 go f ...
shell coding about mac ox
1, mac path---http://blog.csdn.net/playstudy/article/details/50149021 Mac系统的环境变量,加载顺序为:/etc/profile ...
Java基础知识笔记第七章：内部类和异常类
内部类 /* *Java支持在一个类中定义另一个类,这样的类称为内部类,而包含内部类的类称为内部类的外嵌类 */ 重要关系: /* *1.内部类的外嵌类在内部类中仍然有效,内部类的方法也可以外嵌类的方 ...
android下创建文件夹和修改其权限的方法
原文:http://www.cnblogs.com/wanqieddy/archive/2011/12/28/2304906.html 由于工作的需要,今天研究了在android下创建文件夹和修改其权 ...
C++11通过拷贝构造器拷贝const字段(待解决)
问题梗概如标题所述. 在今天实现Token类的时候,遇到的问题. 我希望将Token类设定为immutable属性的,这样实现的方式是将这个类内的所有字段均设置为const型,同时每个字段均为publ ...
idea右键新建选项没有类和包的创建方式
Intelidea创建好项目之后,右键新建Java class的时候发现没有改选项,只有以下几个选项把sec目录设为源码目录,首先打开Project Structure
winform和wpf里必知的多线程知识
背景: 很多小伙伴经常在群里问线程的问题,平时我经常转一些视频教程这些人不看,我就自己写个总结吧不过还是要注意的是,切换本来就不能太频繁,要一口气改. wpf的viewmodel就不需要UI线程,更 ...
UniGUI之提示信息MessageDlg及获得信息Prompt(15)
UniGui的信息弹出框MessageDlg的原型定义如下: procedure MessageDlg(const Msg: string; DlgType: TMsgDlgType; Buttons ...
2016 年 31 款轻量高效的开源 JavaScript 插件和库
目前有很多网站设计师和开发者喜欢使用由JavaScript开发的插件和库,但同时面临一个苦恼的问题:它们中的大多数实在是太累赘而且常常降低网站的性能.其实,其中也有不少轻量级的插件和库,它们不仅轻巧有 ...
新闻网大数据实时分析可视化系统项目——14、Spark2.X环境准备、编译部署及运行
1.Spark概述 Spark 是一个用来实现快速而通用的集群计算的平台. 在速度方面, Spark 扩展了广泛使用的 MapReduce 计算模型,而且高效地支持更多计算模式,包括交互式查询和流处理 ...

pandas包 —— drop()、sort_values()、drop_duplicates()

pandas包 —— drop()、sort_values()、drop_duplicates()的更多相关文章

随机推荐

热门专题