通常情况下,数据集中会存在许多同一类别的信息,比如相同国家、相同行政编码、相同性别等,当这些相同类别的数据多次出现时,就会给数据处理增添许多麻烦,导致数据集变得臃肿,不能直观、清晰地展示数据。

针对上述问题,Pandas 提供了分类对象(Categorical Object),该对象能够实现有序排列、自动去重的功能,但是它不能执行运算。本节,我们了解一下分类对象的使用。

对象创建

我们可以通过多种方式创建分类对象,下面介绍以下两种方法:

1) 指定dtype创建

  1. import pandas as pd
  2. s = pd.Series(["a","b","c","a"], dtype="category")
  3. print(s)

输出结果:

0    a
1 b
2 c
3 a
dtype: category
Categories (3, object): [a, b, c]

通过上述示例,您可能会注意到,虽然传递给 Series 四个元素值,但是它的类别为 3,这是因为 a 的类别存在重复。

2) pd.Categorical

通过 Category  的构造函数,您可以创建一个类别对象。构造函数,如下所示:

pandas.Categorical(values, categories, ordered)

values:以列表的形式传参,表示要分类的值。
ordered:布尔值,默认为 False,若为 Ture,表示对分类的数据进行排序。
dtype:返回一个 category 类型,表示分类对象。

示例如下:

  1. import pandas as pd
  2. #自动按a、b、c分类
  3. cat = pd.Categorical(['a', 'b', 'c', 'a', 'b', 'c'])
  4. print(cat)

输出结果:

[a, b, c, a, b, c]
Categories (3, object): [a, b, c]

再看一组示例:

  1. import pandas as pd
  2. cat=pd.Categorical(['a','b','c','a','b','c','d'], ['c', 'b', 'a'])
  3. print(cat)

输出结果:

[a, b, c, a, b, c, NaN]
Categories (3, object): [c, b, a]

上述示例中,第二个参数值表示类别,当列表中不存在某一类别时,会自动将类别值设置为 NA。

通过指定ordered=True来实现有序分类。示例如下:

  1. import pandas as pd
  2. cat=pd.Categorical(['a','b','c','a','b','c','d'], ['c', 'b', 'a'],ordered=True)
  3. print(cat)
  4. #求最小值
  5. print(cat.min())

输出结果:

[a, b, c, a, b, c, NaN]
Categories (3, object): [c < b < a]
c

获取统计信息

对已经分类的数据使用 describe() 方法,您会得到和数据统计相关的摘要信息。

  1. import pandas as pd
  2. import numpy as np
  3. cat = pd.Categorical(["a", "c", "c", np.nan], categories=["b", "a", "c"])
  4. df = pd.DataFrame({"cat":cat, "s":["a", "c", "c", np.nan]})
  5. print(df.describe())
  6. print(df["cat"].describe())

输出结果:

       cat  s
count 3 3
unique 2 2
top c c
freq 2 2 count 3
unique 2
top c
freq 2
Name: cat, dtype: object

获取类别属性

使用obj.categories命令可以获取对象的类别信息。示例如下:

  1. import pandas as pd
  2. import numpy as np
  3. s = pd.Categorical(["a", "c", "c", np.nan], categories=["b", "a", "c"])
  4. print (s.categories)

输出结果:

Index(['b', 'a', 'c'], dtype='object')

通过 obj.order 可以获取 order 指定的布尔值:

  1. import pandas as pd
  2. import numpy as np
  3. cat = pd.Categorical(["a", "c", "c", np.nan], categories=["b", "a", "c"])
  4. #False表示未指定排序
  5. print (cat.ordered)

输出结果:

False

重命名类别

要想对类别实现重命名,可以通过 Series.cat.categories 来实现的,示例如下:

  1. import pandas as pd
  2. s = pd.Series(["a","b","c","a"], dtype="category")
  3. #对类名重命名
  4. s.cat.categories = ["Group %s" % g for g in s.cat.categories]
  5. print(s.cat.categories)

输出结果:

Index(['Group a', 'Group b', 'Group c'], dtype='object')

追加新类别

使用 s.cat.add_categories() 方法,可以追加新类别。

  1. import pandas as pd
  2. s = pd.Series(["a","b","c","a"], dtype="category")
  3. #追加新类别
  4. s = s.cat.add_categories([5])
  5. #查看现有类别
  6. print(s.cat.categories)

输出结果:

Index(['a', 'b', 'c', 5], dtype='object')

删除类别

使用 remove_categories() 方法,可以删除不需要的类别。示例如下:

  1. import pandas as pd
  2. s = pd.Series(["a","b","c","a"], dtype="category")
  3. #原序列
  4. print(s)
  5. #删除后序列
  6. print(s.cat.remove_categories("a"))

输出结果

0    a
1 b
2 c
3 a
dtype: category
Categories (3, object): [a, b, c] 0 NaN
1 b
2 c
3 NaN
dtype: category
Categories (2, object): [b, c]

分类对象比较

在下述两种情况下,我们可以对分类对象进行比较:

  • 当两个类别对象长度相同时,可以进行比较运算;
  • 当两个类别的 ordered 均等于 True,并且类别相同时,可以进行比较运算,比如 ==,!=,>,>=,< 和 <=。

示例如下:

  1. import pandas as pd
  2. s1=['a','a','b','d','c']
  3. #当满足两个类别长度相同时
  4. ss0=pd.Categorical(s1,categories=['a','d','b','c'])
  5. ss1 = pd.Categorical(s1)
  6. print(ss0==ss1)

输出结果:

array([ True,  True,  True,  True,  True])

示例如下:
import pandas as pd

  1. s1=['a','a','b','d','c']
  2. s2=['a','b','b','d','c']
  3. #满足上述第二个条件,类别相同,并且ordered均为True
  4. ss0=pd.Categorical(s1,categories=['a','d','b','c'],ordered=True)
  5. ss1 = pd.Categorical(s2,categories=['a','d','b','c'],ordered=True)
  6. print(ss0<ss1)

输出结果:

array([False,  True, False, False, False])

pandas之分类操作的更多相关文章

  1. 数据分析05 /pandas的高级操作

    数据分析05 /pandas的高级操作 目录 数据分析05 /pandas的高级操作 1. 替换操作 2. 映射操作 3. 运算工具 4. 映射索引 / 更改之前索引 5. 排序实现的随机抽样/打乱表 ...

  2. pandas的apply操作

    pandas的apply操作类似于Scala的udf一样方便,假设存在如下dataframe: id_part pred pred_class v_id 0 d [0.722817, 0.650064 ...

  3. Pandas的基础操作(一)——矩阵表的创建及其属性

    Pandas的基础操作(一)——矩阵表的创建及其属性 (注:记得在文件开头导入import numpy as np以及import pandas as pd) import pandas as pd ...

  4. python数据结构:pandas(2)数据操作

    一.Pandas的数据操作 0.DataFrame的数据结构 1.Series索引操作 (0)Series class Series(base.IndexOpsMixin, generic.NDFra ...

  5. Pandas的拼接操作

    pandas的拼接操作 pandas的拼接分为两种: 级联:pd.concat, pd.append 合并:pd.merge, pd.join import pandas as pd import n ...

  6. (四)pandas的拼接操作

    pandas的拼接操作 #重点 pandas的拼接分为两种: 级联:pd.concat, pd.append 合并:pd.merge, pd.join 0. 回顾numpy的级联 import num ...

  7. pandas 写csv 操作

    pandas 写csv 操作 def show_history(self): df = pd.DataFrame() df['Time'] = pd.Series(self.time_hist) df ...

  8. Pandas | 23 分类数据

    通常实时的数据包括重复的文本列.例如:性别,国家和代码等特征总是重复的.这些是分类数据的例子. 分类变量只能采用有限的数量,而且通常是固定的数量.除了固定长度,分类数据可能有顺序,但不能执行数字操作. ...

  9. pandas之数据处理操作

    1.pandas对缺失数据的处理 我们的数据缺失通常有两种情况: 1.一种就是空,None等,在pandas是NaN(和np.nan一样) 解决方法: 判断数据是否为NaN:pd.isnull(df) ...

  10. pandas dataframe类型操作

    用python做数据分析pandas库介绍之DataFrame基本操作   怎样删除list中空字符? 最简单的方法:new_list = [ x for x in li if x != '' ] 这 ...

随机推荐

  1. linux一些指令

    一.           文件操作命令 查看当前目录下的文件或文件夹 详细查看ls –l 每列代表不同的意义: 第一列drwxr-xr-x  表示权限, n  其中第一个字符d表示 目录(可能有b-块 ...

  2. jsp第九周作业

    1.做一个图书类Book id,name,price ,get,set访问器,构造方法2个,1个无参,1个有参做一个测试类,在main中创建3个图书对象,放到list集合中.做一个菜单,可以添加,删除 ...

  3. Linux系列---【设置ssh连接超时时间】

    设置ssh连接超时时间 shell工具总是不断的超时,上个厕所就断开了,很不方便,这里根据自己习惯设置一下. echo "export TMOUT=600" >> /e ...

  4. 水印 canvas 实现

    let str = info; let c = document.createElement("canvas"); document.body.appendChild.c; let ...

  5. Levenshtein距离【编辑距离算法】字符串相似度算法

    指两个字串之间,有一个转成另一个所需的最少编辑操作的次数. 算法过程 str1或str2的长度为0返回另一个字符串的长度. if(str1.length==0) return str2.length; ...

  6. 【javascript】export 与 export default 区别

    总是记不得,自己打一遍 通过export方式导出,在导入时要加{ },export default则不需要,因为它本身只能有一个

  7. NX二次开发 版本通用方法

    对于用C++做NX二次开发,随着NX的版本变更,二开所用的函数也会有相应的更新调整,生成的DLL不能跨版本运行,报错率极高,甚至不能加载.折腾了好久找到三种方法: 1.纯使用C++的代码开发或者尽可能 ...

  8. decay_rate, decay_steps ,batchsize,iteration,epoch

    (96条消息) decay_rate, decay_steps ,batchsize,iteration,epoch_hellocsz的博客-CSDN博客_decay_steps (1)batchsi ...

  9. python requests 上传文件_python3使用requests上传文件,content-type踩的坑

    通常提交普通表单时,requests的post方法可以指定headers,所以我在使用requests模拟上传文件行为时,直接按照下面的方式写了: 然后服务器就报出了找不到分隔符Invalid mul ...

  10. linux 打包各种后缀的命令

    01-.tar格式解包:[*******]$ tar xvf FileName.tar打包:[*******]$ tar cvf FileName.tar DirName(注:tar是打包,不是压缩! ...