对比hive和mysql查询汇总

由于底层的处理机制大不相同，hive和mysql在查询上还是有较大差异的！

单个表的select操作

最简单的查询

，字段2 frome 表名 where 字段 [not]in(元素1，元素2)；

例：select * from t_student where age in (21,23);

select * from t_student where age not in (21,23);

带between and的范围查询：select 字段1，字段2 frome 表名 where 字段 [not]between 取值1 and 取值2；

例：select * frome t_student where age between 21 and 29;

select * frome t_student where age not between 21 and 29;

带like的模糊查询：select 字段1，字段2... frome 表名 where 字段 [not] like '字符串'；

"%"代表任意字符；

"_"代表单个字符；

空值查询：select 字段1，字段2...frome 表名 where 字段 is[not] null;

带and的多条件查询：

select 字段1，字段2...frome 表名 where 条件表达式1 and 条件表达式2 [and 条件表达式n]

例：select * frome t_student where gradeName='一年级' and age=23；

带or的多条件查询

select 字段1，字段2...frome 表名 where 条件表达式1 or 条件表达式2 [or 条件表达式n]

例：select * frome t_student where gradeName='一年级' or age=23；//或者，条件只要满足一个

distinct去重复查询：select distinct 字段名 from 表名

Orderby 和sortby 的区别（前者是要mapreduce操作后者在本机上排序）

分组查询 group by 属性名 [having 条件表达式][with rollup]

常用函数：count group_concat rollup

1.select gradeName,count(stuName) from t_student group by gradeName;

2.select gradeName,count(stuName) from t_student group by gradeName having count(stuName)>3;

3.select gradeName,group_concat(stuName) from t_student group by gradeName with rollup;

子查询

0.一般嵌套子查询

1.带比较运算符的子查询（子查询可以使用比较运算符）

select * from t_book where price>=(select price from t_priceLevel where priceLevel=1);

2. 带in关键字的子查询（一个查询语句的条件可能落在另一个select语句的查询结果中）

select * from t_book where bookType in(select id from t_bookType);

select * from t_book where bookType not in(select id from t_bookType);

3.带exists关键字的子查询（加入子查询查询到记录，则进行外层查询，否则，不执行外层查询）

select * from t_book where exists(select * from t_booktype);

select * from t_book where not exists(select * from t_booktype);

4.带any关键字的子查询（any关键字表示满足其中任一条件）

select * from t_book where price>= any(select price from t_priceLevel);

5.带all关键字的子查询（all关键字表示满足所有条件）

select * from t_book where price>= all(select price from t_priceLevel);

2,3,4,5 目前仅mysql支持

Hive中有基于partition的查询，从效率上讲是一个剪枝的过程

多表连接查询

Mysql中支持内连接，左右外连接（注意外连接的工作原理，没有匹配项返回null，可用where过滤），级联多表连接的时候，从中间解读；

与此对应hive中有内连接join，外连接（left/right outer join）加上full outer join（全表关联），semi join是用来在hive中解决in exists子查询的问题。

Hive的join可大致划分为common join 和map join ,两者的区别在于后者应用于大小表数据倾斜的情况具体参考http://www.cnblogs.com/1130136248wlxk/articles/5517628.html

Map完输出为相同key的list，然而按照hash分发到不同reduce的task中。

合并查询

1.union

使用union关键字是，数据库系统会将所有的查询结果合并到一起，然后去掉相同的记录；

select id from t_book union select id from t_bookType;

2.union all

使用union all，不会去除掉重复的记录；

select id from t_book union all select id from t_bookType;

补充:hive 性能优化方向

列剪裁分区剪裁需要设定相关参数

join 小表依次放在前面，左边的在reduce阶段要放进内存，减少内存发生溢出的几率

map join 用于小表和大表的倾斜情况

对比hive和mysql查询汇总的更多相关文章

对比hive和mysql 复杂逻辑流处理
1.Mysql中可用存储过程和函数来实现复杂逻辑处理,两者的对比如下:存储过程作为可执行文件,编译一次放在数据库中,函数又返回值.可设定使用权限. 存储过程中可使用游标,声明变量.用call调用. ...
MySQL查询不使用索引汇总 + 如何优化sql语句
不使用索引原文 : http://itlab.idcquan.com/linux/MYSQL/918330.html MySQL查询不使用索引汇总众所周知,增加索引是提高查询速度的有效途径,但是很多 ...
Hive笔记——技术点汇总
目录 · 概况 · 手工安装 · 引言 · 创建HDFS目录 · 创建元数据库 · 配置文件 · 测试 · 原理 · 架构 · 与关系型数据库对比 · API · WordCount · 命令 · 数 ...
Mysql查询优化汇总 order by优化例子，group by优化例子，limit优化例子，优化建议
Mysql查询优化汇总 order by优化例子,group by优化例子,limit优化例子,优化建议索引索引是一种存储引擎快速查询记录的一种数据结构. 注意 MYSQL一次查询只能使用一个索引 ...
mysql查询性能优化
mysql查询过程: 客户端发送查询请求. 服务器检查查询缓存,如果命中缓存,则返回结果,否则,继续执行. 服务器进行sql解析,预处理,再由优化器生成执行计划. Mysql调用存储引擎API执行优化 ...
[转]向facebook学习，通过协程实现mysql查询的异步化
FROM : 通过协程实现mysql查询的异步化前言最近学习了赵海平的演讲,了解到facebook的mysql查询可以进行异步化,从而提高性能.由于facebook实现的比较早,他们不得不对php ...
MySQL笔记汇总
[目录] MySQL笔记汇总一.mysql简介数据简介结构化查询语言二.mysql命令行操作三.数据库(表)更改表相关字段相关索引相关表引擎操作四.数据库类型数字型字符串型日 ...
MySQL查询数据表中数据记录（包括多表查询）
MySQL查询数据表中数据记录(包括多表查询) 在MySQL中创建数据库的目的是为了使用其中的数据. 使用select查询语句可以从数据库中把数据查询出来. select语句的语法格式如下: sele ...
Mysql查询库、表存储量(Size)
Mysql查询库.表存储量(Size) 1.要查询表所占的容量,就是把表的数据和索引加起来就可以了. SELECT SUM(DATA_LENGTH) + SUM(INDEX_LENGTH) FROM ...

随机推荐

mac中apache+mysql+php+phpMyAdmin配置备忘
Mac OS X 内置Apache 和 PHP,使用起来非常方便.本文以Mac OS X 10.6.3和为例.主要内容包括: 启动Apache 运行PHP 安装MySQL 使用phpMyAdmin 配 ...
easyui datagrid 禁止选中行 EF的增删改查（转载） C# 获取用户IP地址（转载） MVC EF 执行SQL语句（转载）在EF中执行SQL语句（转载） EF中使用SQL语句或存储过程 .net MVC使用Session验证用户登录 PowerDesigner 参照完整性约束(转载)
easyui datagrid 禁止选中行没有找到可以直接禁止的属性,但是找到两个间接禁止的方式. 方式一: //onClickRow: function (rowIndex, rowData) ...
Java编程中经常用到代码
http://www.toutiao.com/i6429293556086604289/
iOS开发——高级篇——iOS 强制退出程序APP代码
1.先po代码 UIAlertView* alert = [[UIAlertView alloc] initWithTitle:self.exitapplication message:@" ...
【bzoj2748】[HAOI2012]音量调节
设F[i][j]表示在第i首歌曲结束后,音量能否刚好为j 转移:F[i][j]=F[i][j-C[i]] or F[i][j+C[i]] 初始化:F[0][beginlevel]=true 最后在所有 ...
Message: unknown error: Element is not clickable at point
Message: unknown error: Element is not clickable at point google chrome - Debugging "Element is ...
Vijos 1523 贪吃的九头龙【树形DP】
贪吃的九头龙背景安徽省芜湖市第二十七中学测试题 NOI 2002 贪吃的九头龙(dragon) Description:OfficialData:OfficialProgram:Converted ...
ios30---pthread, NSThread, GCD, NSOperation
pthread(线程库,很早就有的技术,了解):一套通用的多线程API适用于Unix\Linux\Windows等系统(java开发也有pthread)跨平台\可移植使用难度大(全是C函数) C语言 ...
【CSU 1079】树上的查询
http://acm.csu.edu.cn/OnlineJudge/problem.php?id=1079 现有一棵有N个顶点的树,顶点的标号分别为1, 2, …, N.对于每个形如a b k的询问, ...
[2017SEERC]Divide and Conquer
https://www.zybuluo.com/ysner/note/1308834 题面一个有\(n\)个点的图,上面有有两棵不同的生成树.问至少切断几条边,可以使原图不联通.并输出方案数. \( ...

对比hive和mysql查询汇总

对比hive和mysql查询汇总的更多相关文章

随机推荐

热门专题