Hive函数：rank()、dense

数据准备：

G1,KING,5000

G1,BING,5000

G2,FING,5000

G1,FORD,3000

G2,SCOTT,3000

G1,JONES,2975

G2,BLAKE,2850

G1,CLARK,2450

G1,ALLEN,1600

G1,CELL1,NULL

G2,CELL2,NULL

CREATE EXTERNAL TABLE test_data (

gid string,

ename STRING,

sal INT

) ROW FORMAT DELIMITED

FIELDS TERMINATED BY ','

stored as textfile location '/user/jc_rc_ftp/test_data';

select * from test_data l;

+--------+----------+--------+--+

| l.gid  | l.ename  | l.sal  |

+--------+----------+--------+--+

| G1     | CELL1    | NULL   |

| G2     | CELL2    | NULL   |

| G1     | KING     | 5000   |

| G1     | BING     | 5000   |

| G2     | FING     | 5000   |

| G1     | FORD     | 3000   |

| G2     | SCOTT    | 3000   |

| G1     | JONES    | 2975   |

| G2     | BLAKE    | 2850   |

| G1     | CLARK    | 2450   |

| G1     | ALLEN    | 1600   |

+--------+----------+--------+--+

rank

---rank()over(order by 列名排序)的结果是不连续的，如果有4个人，其中有3个是并列第1名，那么最后的排序结果结果如：1 1 1 4

SQL> select gid,ename,sal,rank() over(order by sal desc) from test_data;

---rank() over (partition by 分组字段 order by 排序字段顺序)

注意：使用rank()over(order by 排序字段顺序)排序的时候，空值是最大的

select gid,ename,sal,rank()over(partition by gid order by coalesce(sal,0) desc) from test_data;

+------+--------+-------+----------------+--+

| gid | ename | sal | rank_window_0 |

+------+--------+-------+----------------+--+

| G1 | BING | 5000 | 1 |

| G1 | KING | 5000 | 1 |

| G1 | FORD | 3000 | 3 |

| G1 | JONES | 2975 | 4 |

| G1 | CLARK | 2450 | 5 |

| G1 | ALLEN | 1600 | 6 |

| G1 | CELL1 | NULL | 7 |

| G2 | FING | 5000 | 1 |

| G2 | SCOTT | 3000 | 2 |

| G2 | BLAKE | 2850 | 3 |

| G2 | CELL2 | NULL | 4 |

+------+--------+-------+----------------+--+

dense_rank

---dense_rank()over(order by 列名排序)的结果是连续的，如果有4个人，其中有3个是并列第1名，那么最后的排序结果如：1 1 1 2
如果排序字段为null，可能造成在排序时将null字段排在最前面，影响排序的正确性。
所以建议将 dense_rank()over(order by 列名排序)改为dense_rank()over(order by 列名排序 nulls last)

---rank()over(order by 列名排序)的结果是不连续的，如果有4个人，其中有3个是并列第1名，那么最后的排序结果结果如：1 1 1 4

SQL> select gid,ename,sal,rank() over(order by sal desc) from test_data;

+------+--------+-------+----------------+--+

| gid  | ename  |  sal  | rank_window_0  |

+------+--------+-------+----------------+--+

| G2   | FING   | 5000  | 1              |

| G1   | BING   | 5000  | 1              |

| G1   | KING   | 5000  | 1              |

| G2   | SCOTT  | 3000  | 4              |

| G1   | FORD   | 3000  | 4              |

| G1   | JONES  | 2975  | 6              |

| G2   | BLAKE  | 2850  | 7              |

| G1   | CLARK  | 2450  | 8              |

| G1   | ALLEN  | 1600  | 9              |

| G1   | CELL1  | NULL  | 10             |

| G2   | CELL2  | NULL  | 10             |

+------+--------+-------+----------------+--+

---rank() over (partition by 分组字段 order by 排序字段 顺序)

注意：使用rank()over(order by 排序字段 顺序)排序的时候，空值是最大的

select gid,ename,sal,rank()over(partition by gid order by coalesce(sal,0) desc) from test_data;

+------+--------+-------+----------------+--+

| gid  | ename  |  sal  | rank_window_0  |

+------+--------+-------+----------------+--+

| G1   | BING   | 5000  | 1              |

| G1   | KING   | 5000  | 1              |

| G1   | FORD   | 3000  | 3              |

| G1   | JONES  | 2975  | 4              |

| G1   | CLARK  | 2450  | 5              |

| G1   | ALLEN  | 1600  | 6              |

| G1   | CELL1  | NULL  | 7              |

| G2   | FING   | 5000  | 1              |

| G2   | SCOTT  | 3000  | 2              |

| G2   | BLAKE  | 2850  | 3              |

| G2   | CELL2  | NULL  | 4              |

+------+--------+-------+----------------+--+

---dense_rank()over(order by 列名排序)的结果是连续的，如果有4个人，其中有3个是并列第1名，那么最后的排序结果如：1 1 1 2

如果排序字段为null，可能造成在排序时将null字段排在最前面，影响排序的正确性。

所以建议将 dense_rank()over(order by 列名 排序)改为dense_rank()over(order by 列名排序 nulls last)

select gid,ename,sal,dense_rank()over(order by sal desc) from test_data;

+------+--------+-------+----------------------+--+

| gid  | ename  |  sal  | dense_rank_window_0  |

+------+--------+-------+----------------------+--+

| G2   | FING   | 5000  | 1                    |

| G1   | BING   | 5000  | 1                    |

| G1   | KING   | 5000  | 1                    |

| G2   | SCOTT  | 3000  | 2                    |

| G1   | FORD   | 3000  | 2                    |

| G1   | JONES  | 2975  | 3                    |

| G2   | BLAKE  | 2850  | 4                    |

| G1   | CLARK  | 2450  | 5                    |

| G1   | ALLEN  | 1600  | 6                    |

| G2   | CELL2  | NULL  | 7                    |

| G1   | CELL1  | NULL  | 7                    |

+------+--------+-------+----------------------+--+

select gid,ename,sal,dense_rank()over(partition by gid order by sal desc) from test_data;

+------+--------+-------+----------------------+--+

| gid  | ename  |  sal  | dense_rank_window_0  |

+------+--------+-------+----------------------+--+

| G1   | BING   | 5000  | 1                    |

| G1   | KING   | 5000  | 1                    |

| G1   | FORD   | 3000  | 2                    |

| G1   | JONES  | 2975  | 3                    |

| G1   | CLARK  | 2450  | 4                    |

| G1   | ALLEN  | 1600  | 5                    |

| G1   | CELL1  | NULL  | 6                    |

| G2   | FING   | 5000  | 1                    |

| G2   | SCOTT  | 3000  | 2                    |

| G2   | BLAKE  | 2850  | 3                    |

| G2   | CELL2  | NULL  | 4                    |

+------+--------+-------+----------------------+--+

Hive函数：rank()、dense_rank()的更多相关文章

Oracle 的开窗函数 rank,dense_rank,row_number
1.开窗函数和分组函数的区别分组函数是指按照某列或者某些列分组后进行某种计算,比如计数,求和等聚合函数进行计算. 开窗函数是指基于某列或某些列让数据有序,数据行数和原始数据数相同,依然能曾现个体数据 ...
Hive ROW_NUMBER,RANK(),DENSE_RANK()
准备数据浙江,杭州,300 浙江,宁波,150 浙江,温州,200 浙江,嘉兴,100 江苏,南京,270 江苏,苏州,299 江苏,某市,200 江苏,某某市,100 创建表 CREATE t ...
知方可补不足~row_number,rank,dense_rank,ntile排名函数的用法
回到目录这篇文章介绍SQL中4个很有意思的函数,我称它的行标函数,它们是row_number,rank,dense_rank和ntile,下面分别进行介绍. 一 row_number:它为数据表加一 ...
SQL Server：排名函数row_number,rank,dense_rank,ntile详解
1.Row_Number函数 row_number函数大家比较熟悉一些,因为它的用途非常的广泛,我们经常在分页与排序中用到它,它的功能就是在每一行中生成一个连续的不重复的序号例如: select S ...
Hive学习之路（十四）Hive分析窗口函数(二) NTILE,ROW_NUMBER,RANK,DENSE_RANK
概述本文中介绍前几个序列函数,NTILE,ROW_NUMBER,RANK,DENSE_RANK,下面会一一解释各自的用途. 注意: 序列函数不支持WINDOW子句.(ROWS BETWEEN) 数据 ...
SQL-OVER与四种排名函数：ROW_NUMBER(),RANK(),DENSE_RANK(),NTILE()
1 SELECT orderid,custid,val, ROW_NUMBER() OVER(ORDER BY val) AS rownum, RANK() OVER(ORDER BY val) AS ...
SQL Server中排名函数row_number,rank,dense_rank,ntile详解
SQL Server中排名函数row_number,rank,dense_rank,ntile详解从SQL SERVER2005开始,SQL SERVER新增了四个排名函数,分别如下:1.row_n ...
大数据学习day29-----spark09-------1. 练习：统计店铺按月份的销售额和累计到该月的总销售额（SQL, DSL,RDD） 2. 分组topN的实现（row_number(), rank(), dense_rank()方法的区别）3. spark自定义函数-UDF
1. 练习数据: (1)需求1:统计有过连续3天以上销售的店铺有哪些,并且计算出连续三天以上的销售额第一步:将每天的金额求和(同一天可能会有多个订单) SELECT sid,dt,SUM(mone ...
[转]oracle分析函数Rank, Dense_rank, row_number
oracle分析函数Rank, Dense_rank, row_number 分析函数2(Rank, Dense_rank, row_number) 目录 ==================== ...
sql server 排名函数：DENSE_RANK
一.需求之前sql server 的排名函数用得最多的应该是RoW_NUMBER()了,我通常用ROW_NUMBER() + CTE 来实现分页:今天逛园,看到另一个内置排名函数还不错,自己顺便想了 ...

随机推荐

Python基础-week03
本节内容摘要:http://www.cnblogs.com/Jame-mei 1.集合及其运算 2.文件读与写详解(1-3) 3.文件修改详解作业:程序1: 实现简单的shell sed替换功能 ...
1-1hibernate数据库操作基础
一.纯原始数据库连接详见http://www.cnblogs.com/lukelook/p/7845757.html 1.Class.forName("oracle.jdbc.driver. ...
WinSock 异步I/O模型-1
异步选择(WSAAsyncSelect):异步选择基本定义异步选择(WSAAsyncSelect)模型是一个有用的异步 I/O 模型.利用这个模型,应用程序可在一个套接字上,接收以 Windows ...
如何通过TortoiseGit（小乌龟）把本地项目上传到github上
1.第一步: 安装git for windows(链接:https://gitforwindows.org/)一路next就好了, 如果遇到什么问题可以参考我另外一篇文章~^ - ^ 2.第二步:安装 ...
POJ1331 Multiply(strtol函数练习)
题目链接:http://poj.org/problem?id=1331 主要介绍strtol函数: long int strtol(const char *nptr,char **endptr,int ...
WebPack介绍
一.Webpack 是什么 Webpack 是德国开发者 Tobias Koppers 开发的模块加载器,Instagram 工程师认为这个方案很棒, 似乎还把作者招过去了.在 Webpack 当中, ...
大数据 --> 分布式服务框架Zookeeper
分布式服务框架 Zookeeper Zookeeper系列分布式服务框架 Zookeeper -- 管理分布式环境中的数据
MySQL之数据库和表的基本操作（建立表、删除表、向表中添加字段）
介绍关于数据库和表的一些基本操作添加字段.给字段添加注释 ); ) COMMENT '统一社会信用代码录入单位'; ,) 更改字段类型 ,) COMMENT '一头签收,@0或空不用,1必须'; 有 ...
Beta No.5
今天遇到的困难: 前端大部分代码由我们放逐的组员完成,这影响到了我们解决"Fragment碎片刷新时总产生的固定位置"的进程,很难找到源码对应新加入的成员对界面代码不熟悉. 我们 ...
Beta冲刺NO.7
Beta冲刺第七天昨天的困难昨天的困难在一些多表查询上,不熟悉hibernate的套路,走了很多弯路. 第一次使用图表插件,在图表的显示问题上花了一定的时间. 对于页面绑定和后台数据自动填充的理 ...

Hive函数：rank()、dense_rank()

rank

dense_rank

Hive函数：rank()、dense_rank()的更多相关文章

随机推荐

热门专题