【LeetCode哈希表】前k个高频词，利用哈希表+vector进行排序操作

前k个高频词

https://leetcode.cn/problems/top-k-frequent-words/

给定一个单词列表 words 和一个整数 k ，返回前 k 个出现次数最多的单词。

返回的答案应该按单词出现频率由高到低排序。如果不同的单词有相同出现频率，按字典顺序排序。

示例 1：

输入: words = ["i", "love", "leetcode", "i", "love", "coding"], k = 2

输出: ["i", "love"]

解析: "i" 和 "love" 为出现次数最多的两个单词，均为2次。

注意，按字母顺序 "i" 在 "love" 之前。

示例 2：

输入: ["the", "day", "is", "sunny", "the", "the", "the", "sunny", "is", "is"], k = 4

输出: ["the", "is", "sunny", "day"]

解析: "the", "is", "sunny" 和 "day" 是出现次数最多的四个单词，

出现次数依次为 4, 3, 2 和 1 次。

注意：

1 <= words.length <= 500

1 <= words[i] <= 10

words[i] 由小写英文字母组成。

k 的取值范围是 [1, 不同 words[i] 的数量]

思路

解题思路

本题和前k个高频元素的小顶堆实现有点像，可以参考着做。首先我们需要先统计words中每个元素出现的次数，建立一个hashmap

很自然的，我们希望对这个hashmap进行排序，最好是按值排序，这样问题就解决了。

但是，unordered_map本身是无序的，不支持排序。因此在统计完对应元素出现的次数之后，我们还需要将键值对取出，放入另外的支持排序的数据结构中进行排序处理

并且，由于题目的要求，我们需要自定义排序规则（编写仿函数cmp）。可以选择vector作为排序的容器载体，使用值按从大到小完成排序之后，返回k个pair的first（键）即可

排序仿函数编写

注意，这里我们在编写cmp时要满足两个规则：vector中元素按值从大到小降序排序、如果值相等则按照键的字典序大小进行排序

在 bool operator() 函数中，它根据给定的规则比较了两个 pair<string, int> 类型的对象 p1 和 p2。其中，p1.second 表示字符串 p1 出现的次数，p1.first 表示字符串本身。函数返回值为 true 表示 p1 在排序中应该出现在 p2 的前面，而返回值为 false 则表示 p1 应该出现在 p2 的后面。

这里不能直接使用 return p1.second > p2.second; 是因为如果有多个字符串的出现次数相同，则需要按字典序升序排列字符串，即在出现次数相同的情况下，需要同时比较字符串的大小。因此，我们需要在重载函数中加入额外的比较操作来满足题目的要求。

具体来说，重载函数首先比较两个 pair<string, int> 中的出现次数，如果出现次数不同，则将出现次数多的字符串排在前面；如果出现次数相同，则比较两个字符串的字典序，将字典序小的字符串排在前面。综合这两种比较规则，就能够得到题目所要求的排序结果。

什么是字典序？

字典序（Lexicographic Order）是一种字符串之间的大小比较方式，也可以称为字母表顺序、字母表序或词典序。在字典序中，字符串的大小关系取决于它们每个位置上的字符的 ASCII 码值的大小关系。具体来说，给定两个字符串 s 和 t，如果从左到右逐位比较它们对应位置上的字符，遇到不同的字符时，则以这两个字符的 ASCII 码值的大小关系来确定它们之间的大小关系，如下所示：

如果 s[i] < t[i]，则 s 小于 t；

如果 s[i] > t[i]，则 s 大于 t；

如果 s[i] = t[i]，则继续比较下一个字符，直到找到一个不同的字符或者比较完整个字符串。

举例来说，"abc" 小于 "acd"，因为在第 2 个位置处 'b' 的 ASCII 码值小于 'c' 的 ASCII 码值。类似地，"apple" 小于 "application"，因为前者长度较短，而在前 5 个字符处与后者相同，因此按照字典序规则，前者排在后者前面。

在实际编程中，我们通常会用到 operator< 操作符来实现字符串之间的字典序比较。例如，对于两个字符串 s 和 t，可以使用 s < t 来判断它们的大小关系。

代码

// 定义一个Solution类

class Solution {

public:

    // 定义一个嵌套类cmp用于排序

    class cmp{

    public:

        // 重载()运算符，用于比较两个pair<string, int>类型的对象

        bool operator()(pair<string, int>& p1, pair<string, int>& p2){

            // 按pair值比较，如果p1.second大于p2.second，则返回true，否则返回false

            if(p1.second != p2.second) return p1.second > p2.second;

            // 按pair键比较，如果p1.second等于p2.second（出现次数相等），则按字典序比较p1.first和p2.first，如果p1.first小于p2.first，则返回true，否则返回false

            else return p1.first < p2.first;

        }

    };

    vector<string> topKFrequent(vector<string>& words, int k) {

        unordered_map<string, int> hashmap;// 定义一个unordered_map，用于统计每个字符串在words中出现的次数

        for(int i = 0; i < words.size(); ++i) hashmap[words[i]]++;

        // 将哈希表中的键值对转换成pair<string, int>类型的vector，以便排序

        vector<pair<string, int>> vec4sort(hashmap.begin(), hashmap.end());

        // 使用自定义的cmp类进行排序，按照字符串出现的次数进行降序排序，如果次数相同则按字典序升序排序

        sort(vec4sort.begin(), vec4sort.end(), cmp());

        vector<string> res;// 定义一个空的vector<string>，用于存储结果

        // 将排序后的前k个pair<string, int>中的string添加到res中

        for(int i = 0; i < k; ++i){

            res.push_back(vec4sort[i].first);

        }

        return res;// 返回结果向量

    }

};