Top k问题(线性时间选择算法)
问题描述:给定n个整数,求其中第k小的数。
分析:显然,对所有的数据进行排序,即很容易找到第k小的数。但是排序的时间复杂度较高,很难达到线性时间,哈希排序可以实现,但是需要另外的辅助空间。
这里我提供了一种方法,可以在O(n)线性时间内解决Top k问题。关于时间复杂度的证明,不再解释,读者可以查阅相关资料。具体的算法描述如下:
算法:LinearSelect(S,k)
输入:数组S[1:n]和正整数k,其中1<=k<=n;
输出:S中第k小的元素
1. If n<20 Then 将S中的元素排序后输出第k个元素,算法结束;
2.将S划分为无公共元素的 floor(n/5) 个分组,每组5个元素,第 i 个组记为Si;
3.用插入排序算法将每个组Si 排序,求得中位数 mi ,其中 i=1,2,3,...,floor(n/5);
4.递归调用本算法求得{mi | 1<=i floor(n/5)}的中位数(即第floor(n/10)小的元素)M;
5.划分S为A={x|x属于S 并且 x<M}, B={x|x属于S 并且 x=M}和C={x|x属于S 并且 x>M};
6. If |A|>k Then 输出 LinearSelect(A,k);
7. ElseIf |A|+|B|<k Then 输出 LinearSelect(C,k-|A|-|B|);
8. Else 输出M,算法结束;
当然了,本题是求第k小,如果求第k大,可以转换成对应的第n-k小,同样可以求。这个算法以后会经常用到,一定要掌握,但是如果数据量不超过20个的话,也可以直接排序求。
完整的Java代码如下,代码写法都比较通用,读者可以很容易转换为其他语言实现:
import java.lang.Math;
import java.util.Arrays;
import java.util.Scanner;
public class Topk {
public static int LinearSelect(int s[],int n,int k)
{ int topk=0;
if(n<=0)return topk; //如果数组为空,则返回0
if(n<5) //这里对应算法的第一步。这里我定义的是小于5个,则直接排序,读者也可以自己设定
{
for(int i=0;i<n-1;i++)
for(int j=i+1;j<n;j++)
if(s[i]>s[j])
{int t=s[i];s[i]=s[j];s[j]=t;}
topk= s[k-1];
}
else{ int ss[][]=new int[n/5][5]; //对应算法的第二步
int j=-1;
for(int i=0;i<n/5*5;i++)
{ if(i%5==0)j++;
ss[j][i%5]=s[i]; } int sss[]=new int[n/5];
for(int i=0;i<n/5;i++) //对应算法的第三步
{
Arrays.sort(ss[i]);
sss[i]=ss[i][2]; }
Arrays.sort(sss);
int M=sss[n/5/2]; //对应算法的第四步 int A[]=new int[n]; //对应算法的第五步
int B[]=new int[n];
int C[]=new int[n];
int a=0,b=0,c=0; //作为三个结合的指针
for(int i=0;i<n;i++) //放入对应的集合中
{
if(s[i]<M)A[a++]=s[i];
if(s[i]==M)B[b++]=s[i];
if(s[i]>M)C[c++]=s[i];
} if(a>k-1)topk=LinearSelect(A,a,k); //对应算法第六步,我定义的数组是从下标0开始的忙,所以这里是k-1
else if(a+b<k-1)topk=LinearSelect(C,c,k-a-b); //对应算法第七步
else topk=M; //对应算法第八步 }
return topk; //返回最终的Top k
}
public static void main(String[] args) { int s[]={16,9,92,40,25,27};
int n=6;
int k=2;
System.out.print("数组为:");
for(int i=0;i<n;i++)
{
System.out.print(s[i]+",");
}
System.out.println();
System.out.println("第"+k+"小的数为:"+LinearSelect(s,n,k)); } }
输出结果为:
数组为:16,9,92,40,25,27,
第2小的数为:16
Top k问题(线性时间选择算法)的更多相关文章
- 【Unsolved】线性时间选择算法的复杂度证明
线性时间选择算法中,最坏情况仍然可以保持O(n). 原因是通过对中位数的中位数的寻找,保证每次分组后,任意一组包含元素的数量不会大于某个值. 普通的Partition最坏情况下,每次只能排除一个元素, ...
- Top K问题的两种解决思路
Top K问题在数据分析中非常普遍的一个问题(在面试中也经常被问到),比如: 从20亿个数字的文本中,找出最大的前100个. 解决Top K问题有两种思路, 最直观:小顶堆(大顶堆 -> 最小1 ...
- 程序员编程艺术:第三章续、Top K算法问题的实现
程序员编程艺术:第三章续.Top K算法问题的实现 作者:July,zhouzhenren,yansha. 致谢:微软100题实现组,狂想曲创作组. 时间:2011年05月08日 ...
- Top K算法
应用场景: 搜索引擎会通过日志文件把用户每次检索使用的所有检索串都记录下来,每个查询串的长度为1-255字节. 假设目前有一千万个记录(这些查询串的重复度比较高,虽然总数是1千万,但如果 ...
- [图解算法]线性时间选择Linear Select——<递归与分治策略>
#include <ctime> #include <iostream> using namespace std; template <class Type> vo ...
- 算法:线性时间选择(C/C++)
Description 给定线性序集中n个元素和一个整数k,n<=2000000,1<=k<=n,要求找出这n个元素中第k小的数. Input 第一行有两个正整数n,k. 接下来是n ...
- 排序算法Java版,以及各自的复杂度,以及由堆排序产生的top K问题
常用的排序算法包括: 冒泡排序:每次在无序队列里将相邻两个数依次进行比较,将小数调换到前面, 逐次比较,直至将最大的数移到最后.最将剩下的N-1个数继续比较,将次大数移至倒数第二.依此规律,直至比较结 ...
- 快速排序以及第k小元素的线性选择算法
简要介绍下快速排序的思想:通过一趟排序将要排序的数据分割成独立的两部分,其中一部分的所有数据都比另外一部分的所有数据都要小,然后再按此方法对这两部分数据分别进行快速排序,整个排序过程可以递归进行,以此 ...
- Top K问题-BFPRT算法、Parition算法
BFPRT算法原理 在BFPTR算法中,仅仅是改变了快速排序Partion中的pivot值的选取,在快速排序中,我们始终选择第一个元素或者最后一个元素作为pivot,而在BFPTR算法中,每次选择五分 ...
随机推荐
- DOTween 模仿NGUI Tween
最近再做一个小的项目,只要使用的是DOTween 动画. 但是感到DOTween 在某些方面不如 NGUI的Twenn 比较好用 所以就模仿了一下 在此,请各位大神指点一下 public class ...
- Oracle游标动态赋值
1. oracle游标动态赋值的小例子 -- 实现1:动态给游标赋值 -- 实现2:游标用表的rowtype声明,但数据却只配置表一行的某些字段时,遍历游标时需fetch into到精确字段 CREA ...
- IOS添加多个按钮在导航栏
UIView *customView = [[UIView alloc] initWithFrame:CGRectMake(0.0f, 0.0f, 75.0f, 30.0f)]; UIButton * ...
- [Python] 发送email的几种方式
python发送email还是比較简单的,能够通过登录邮件服务来发送,linux下也能够使用调用sendmail命令来发送,还能够使用本地或者是远程的smtp服务来发送邮件,无论是单个,群发,还是抄送 ...
- 从Android Handler内部类到WeakReference的知识关联
Handler: 普通使用方法: Handler用于处理和从队列MessageQueue中得到Message.一般我们要重写Handler的handleMessage(Message msg){}方法 ...
- JDBC插入百万数据,不到5秒!
java自带的批量操作,就可以很好的支持大量数据的处理.相比c#,简单很多.c#要使用oracle提供的ODP.NET,效率才很高,但是代码却很复杂.总之,在这方面,c#没得比.当然,这里的表是没加索 ...
- 影响布局的inline-block的空白符的问题
昨天切页面时,进行布局时,想改变以下方法换换口味,所以就抛弃了float方法,采用了display:inline-block方法,没想到却随之而来的带来了一个想不通的问题,那就是空白.废话不多说,上代 ...
- c++中各种数据类型所占字节
求各种数据类型所占用的字节数可调用sizeof函数,求各种数据类型的最大值可以调用limits标准库中的numeric_limits<T>::max(),numeric_limits< ...
- linux安装perl模块
查询perl CPAN模块 shell>perl -MCPAN -e shell cpan>install module_name 手动安装perl CPAN模块 从 CPAN(h ...
- (zz)Lambda 表达式(C# 编程指南)
https://msdn.microsoft.com/zh-cn/library/bb397687.aspx Lambda 表达式是一种可用于创建委托或表达式目录树类型的匿名函数.通过使用 lambd ...