Python 中 sorted 如何自定义比较逻辑

在 Python 中对一个可迭代对象进行排序是很常见的一个操作，一般会用到 sorted() 函数

num_list = [4, 2, 8, -9, 1, -3]

sorted_num_list = sorted(num_list)

print(sorted_num_list)

上面的代码是对整数列表 num_list 按从小到大的顺序进行排序，得到的结果如下

[-9, -3, 1, 2, 4, 8]

有时候不仅仅是对元素本身进行排序，而是在元素值的基础上进行一些计算之后再进行比较，比如将 num_list 中的元素按照其平方值的大小进行排序。

在 Python 2 中，可以通过 sorted() 函数中的 cmp 或 key 参数来实现这种自定义的比较逻辑。cmp 比较函数接收两个参数 x 和 y（x 和 y 都是列表中元素）并且返回一个数字，如果返回正数表示 x > y，返回 0 表示 x == y，返回负数表示 x < y。key 函数接收一个参数，重新计算出一个结果，然后用计算出的结果参与排序比较。因此在 Python 2 中按平方值大小排序可以有下面两种实现方式

num_list = [4, 2, 8, -9, 1, -3]

# cmp 参数只在 Python 2 中存在，Python 3 及之后的版本移除了 cmp 参数

sorted_num_list = sorted(num_list, cmp=lambda x, y: x ** 2 - y ** 2)

sorted_num_list = sorted(num_list, key=lambda x: x ** 2)

但是随着 Python 3.0 的发布，cmp 参数也随之被移除了，也就是说在 Python 3 中自定义比较逻辑就只能通过 key 参数来实现。至于为什么将 cmp 参数移除，在 Python 的 Issue tracker 中有一段很长的讨论，主要有以下两点原因

cmp 是一个冗余参数，所有使用 cmp 的场景都可以用 key 来代替
使用 key 比使用 cmp 的性能更快，对于有 N 个元素的列表，在排序过程中如果调用 cmp 进行比较，那么 cmp 的调用次数为 Nlog(N) 量级（基于比较的排序的最快时间复杂度），如果使用 key 参数，那么只需要在每个元素上调用一次 key 函数，只有 N 次调用，虽然使用 key 参数也要进行 O(Nlog(N)) 量级比较次数，但这些比较是在 C 语言层，比调用用户自定义的函数快。

关于上面性能的问题，我做了一个实验，分别随机生成 1000、10000、100000 和 1000000 个整数，然后用 key 和 cmp 的方式分别进行排序并记录排序的时间消耗

import random

import time

counts = (1000, 10000, 100000, 1000000)

def custom_cmp(x, y):

    return x ** 2 - y ** 2

def custom_key(x):

    return x ** 2

print('%7s%20s%20s' % ('count', 'cmp_duration', 'key_duration'))

for count in counts:

    min_num = -count // 2

    max_num = count // 2

    nums = [random.randint(min_num, max_num) for _ in range(count)]

    start = time.time()

    sorted(nums, cmp=custom_cmp)

    cmp_duration = time.time() - start

    start = time.time()

    sorted(nums, key=custom_key)

    key_duration = time.time() - start

    print('%7d%20.2f%20.2f' % (count, cmp_duration, key_duration))

在我的笔记本上一次运行结果如下

  count        cmp_duration        key_duration

   1000                0.00                0.00

  10000                0.02                0.01

 100000                0.34                0.11

1000000                4.75                1.85

可以看到，当列表中数字的数量超过 100000 的时候，使用 key 函数的性能优势就非常明显了，比 cmp 快了 2~3 倍。

对于熟悉 Java 或 C++ 等其他编程语言的同学来说，可能更熟悉 cmp 的比较方式。其实 Python 3 中也可以通过 functools 工具包中的 cmp_to_key() 函数来将 cmp 转换成 key，从而使用接收两个参数的自定义比较函数 cmp。

import functools

num_list = [4, 2, 8, -9, 1, -3]

def custom_cmp(x, y):

    return x ** 2 - y ** 2

sorted_num_list = sorted(num_list, key=functools.cmp_to_key(custom_cmp))

print(sorted_num_list)

那么，cmp_to_key() 函数是如何将 cmp 转换成 key 的呢，我们可以通过源码一探究竟

def cmp_to_key(mycmp):

    """Convert a cmp= function into a key= function"""

    class K(object):

        __slots__ = ['obj']

        def __init__(self, obj):

            self.obj = obj

        def __lt__(self, other):

            return mycmp(self.obj, other.obj) < 0

        def __gt__(self, other):

            return mycmp(self.obj, other.obj) > 0

        def __eq__(self, other):

            return mycmp(self.obj, other.obj) == 0

        def __le__(self, other):

            return mycmp(self.obj, other.obj) <= 0

        def __ge__(self, other):

            return mycmp(self.obj, other.obj) >= 0

        __hash__ = None

    return K

其实 cmp_to_key() 返回的是一个类 K，只不过在类 K 中重载了各种比较运算符，重载的过程中使用到了自定义的比较函数 mycmp，使得 K 的大小比较逻辑与 mycmp 一致。这样，对于 num_list 中的每个元素 num 都会执行一次 K(num) 生成一个类 K 的实例，然后通过比较不同 K 的实例的大小进行排序。

虽然通过 cmp_to_key() 可以调用自定义的 cmp 函数，但是还是要优先使用 key 函数，因为通过 cmp_to_key() 方式会在排序过程中创建很多类 K 的实例，对性能有很大影响，下面是 cmp_to_key() 和 key 的性能比较

  count          cmp_to_key        key_duration

   1000                0.01                0.00

  10000                0.10                0.01

 100000                1.36                0.09

1000000               16.89                1.13

当 num_list 中的数量为 1000000 的时候 key 比 cmp_to_key 快了将近 15 倍。

本文主要介绍了如何在 sorted 函数中自定义比较逻辑，Python 2 中可以通过 cmp 或 key 来实现，cmp 接收 2 个参数，通过返回的数值来判断两个参数的大小，key 重新计算一个新的结果参与比较。在 Python 3 中，考虑到 cmp 的性能和冗余的原因，将其移除了。在 Python 3.2 中提供了 functools.cmp_to_key 这个函数来使用自定义的比较函数 cmp，但是出于性能的考虑，我们还是要优先使用 key 来进行排序。

Python 中 sorted 如何自定义比较逻辑的更多相关文章

Python中sorted()方法
Python中sorted()方法的用法 1.先说一下iterable,中文意思是迭代器. Python的帮助文档中对iterable的解释是:iteralbe指的是能够一次返回它的一个成员的对象.i ...
Python中sorted()方法的用法
Python中sorted()方法的用法 2012-12-24 22:01:14| 分类: Python |字号订阅 1.先说一下iterable,中文意思是迭代器. Python的帮助文档中对i ...
Python中sorted(iterable, /, *, key=None, reverse=False)的参数中的斜杆是什么意思？
通过help(sorted)查看sorted的帮助文档,显示如下: Help on built-in function sorted in module builtins: sorted(iterab ...
[转].Python中sorted函数的用法
[Python] sorted函数我们需要对List.Dict进行排序,Python提供了两个方法对给定的List L进行排序,方法1.用List的成员函数sort进行排序,在本地进行排序,不返回副 ...
Python中sorted函数的用法(转)
[Python] sorted函数我们需要对List.Dict进行排序,Python提供了两个方法对给定的List L进行排序, 方法1.用List的成员函数sort进行排序,在本地进行排序,不返 ...
python 中 sorted() 和 list.sort() 的用法
今天用python自带的sorted对一个列表进行排序, 在这里总结一下只要是可迭代对象都可以用sorted . sorted(itrearble, cmp=None, key=None, reve ...
python中sorted()和set()去重，排序
前言在看一个聊天机器人的神经网络模型训练前准备训练数据,需要对训练材料做处理(转化成张量)需要先提炼词干,然后对词干做去重和排序 words = sorted(list(set(words))) 对 ...
Python中sorted(iterable, *, key=None, reverse=False)函数参数定义中的独立星号(*)的含义
老猿在 <Python中函数的参数带星号是什么意思?>中介绍了Python函数中参数带星号的含义,而在实际使用和Python的标准文档中,会看到某写函数(如sorted(iterable, ...
python中sorted方法和列表的sort方法使用详解
一.基本形式列表有自己的sort方法,其对列表进行原址排序,既然是原址排序,那显然元组不可能拥有这种方法,因为元组是不可修改的. 排序,数字.字符串按照ASCII,中文按照unicode从小到大排序 ...

随机推荐

JavaDailyReports10_07
动手动脑① 1 package test_1; 2 3 public class Test { 4 5 public static void main(String[] args) { 6 // TO ...
JAVA并发包——锁
1.java多线程中,可以使用synchronized关键字来实现线程间的同步互斥工作,其实还有个更优秀的机制来完成这个同步互斥的工作--Lock对象,主要有2种锁:重入锁和读写锁,它们比synchr ...
C++ string的内部究竟是什么样的？
在C语言中,有两种方式表示字符串: 一种是用字符数组来容纳字符串,例如char str[10] = "abc",这样的字符串是可读写的: 一种是使用字符串常量,例如char *st ...
ROS开源小车TurtleBot3详情介绍（Burger）
您为什么要选择ROS开源智能小车 ROS(RobotOperating System,机器人操作系统)是目前世界上更主流更多人使用的的机器人开源操作系统.它可以提供操作系统应有的服务,包括硬件抽象,底 ...
Java并发编程实战（3）- 互斥锁
我们在这篇文章中主要讨论如何使用互斥锁来解决并发编程中的原子性问题. 目录概述互斥锁模型互斥锁简易模型互斥锁改进模型 Java世界中的互斥锁 synchronized中的锁和锁对象 synch ...
VBA实现相同行合并
帮人捣鼓了个VBA代码用来实现多行合并,具体需求为:列2/列3/列4 相同的情况下,则对应的行合并为一行,且列1用空格隔开,列5则相加: (对大多数办公室职员,VBA还算是提高效率的一个利器吧) 最终 ...
【Vue】Vue开发环境搭建
Vue前置学习环境文章目录 Vue前置学习环境 IDE Node.js 调试环境工程环境小结 IDE WebStorm 官网下载:https://www.jetbrains.com/websto ...
2019 Java开发利器Intellij IDEA安装、配置和使用
进入Intellij IDEA的官网,选择电脑对应的合适版本进行下载,这儿我选择的是Intellij IDEA的社区版,安装旗舰版可去网上找相应的教程. Intellij IDEA的官网:https: ...
【Python】PDF转WORD
注意,下文中的PDF文档是纯文字格式,而且非扫描版的PDF文件. 如果是扫描版或者带有图片的.可能转起来会出现排版异常并且图片无法保存到.doc文件中. 正文开始: 需要安装依赖包 pdfminer3 ...
leetcode 1593. 拆分字符串使唯一子字符串的数目最大（DFS，剪枝）
题目链接 leetcode 1593. 拆分字符串使唯一子字符串的数目最大题意: 给你一个字符串 s ,请你拆分该字符串,并返回拆分后唯一子字符串的最大数目. 字符串 s 拆分后可以得到若干非空子 ...

Python 中 sorted 如何自定义比较逻辑

Python 中 sorted 如何自定义比较逻辑的更多相关文章

随机推荐

热门专题