Spark SQL概念学习系列之分布式SQL引擎

　　不多说，直接上干货！

parkSQL作为分布式查询引擎：两种方式

　　除了在Spark程序里使用Spark SQL，我们也可以把Spark SQL当作一个分布式查询引擎来使用，有以下两种使用方式：

　　1.Thrift JDBC/ODBC服务

　　2.CLI

SparkSQL作为分布式查询引擎：Thrift JDBC/ODBC服务

　　Thrift JDBC/ODBC服务与Hive 1.2.1中的HiveServer2一致

　　启动JDBC/ODBC服务：

　　./sbin/start-thriftserver.sh

　　sbin/start-thriftserver.sh命令接收所有 bin/spark-submit 命令行参数，添加一个 --hiveconf 参数来指定Hive的属性。详细的参数说明请执行命令　　./sbin/start-thriftserver.sh --help 。

　　服务默认监听端口为localhost:10000。有两种方式修改默认监听端口：

　　修改环境变量：

　　　　export HIVE_SERVER2_THRIFT_PORT=

　　　　export HIVE_SERVER2_THRIFT_BIND_HOST=

　　　　./sbin/start-thriftserver.sh \

　　　　--master \

　　　　...

SparkSQL作为分布式查询引擎：Thrift JDBC/ODBC服务

　　Thrift JDBC/ODBC服务默认监听端口为localhost:10000。有两种方式修改默认监听端口：

　　修改环境变量：

　　　　export HIVE_SERVER2_THRIFT_PORT=

　　　　export HIVE_SERVER2_THRIFT_BIND_HOST=

　　　　./sbin/start-thriftserver.sh \

　　　　--master \

　　　　...

　　修改系统属性：

　　　　./sbin/start-thriftserver.sh \

　　　　--hiveconf hive.server2.thrift.port= \

　　　　--hiveconf hive.server2.thrift.bind.host= \

　　　　--master

　　　　...

　　SparkSQL作为分布式查询引擎： beeline

　　使用 beeline 来测试Thrift JDBC/ODBC服务：

　　　　./bin/beeline

　　连接到Thrift JDBC/ODBC服务：

　　　　beeline> !connect jdbc:hive2://localhost:10000

　　连接Hive需要拷贝hive-site.xml、core-site.xml、hdfs-site.xml到Spark 的./conf/ 目录。

　　SparkSQL作为分布式查询引擎： Spark SQL CLI

　　Spark SQL CLI是一个方便的工具，以本地模式运行Hive的metastore服务和执行从命令行输入查询语句。

　　Spark SQL CLI不能与Thrift JDBC server交互。

　　连接Hive需要拷贝hive-site.xml、core-site.xml、hdfs-site.xml到Spark 的./conf/ 目录。

Spark SQL概念学习系列之分布式SQL引擎的更多相关文章

Spark SQL概念学习系列之Spark SQL概述
很多人一个误区,Spark SQL重点不是在SQL啊,而是在结构化数据处理! Spark SQL结构化数据处理概要: 01 Spark SQL概述 02 Spark SQL基本原理 03 Spark ...
Spark入门实战系列--10.分布式内存文件系统Tachyon介绍及安装部署
[注]该系列文章以及使用到安装包/测试数据可以在<倾情大奉送--Spark入门实战系列>获取 .Tachyon介绍 1.1 Tachyon简介随着实时计算的需求日益增多,分布式内存计算 ...
Zookeeper概念学习系列之分布式事务
不多说,直接上干货! 初学者来说,肯定会有这么一个疑问.为什么会在zookeeper里牵扯到分布式事务? zookeeper到底是什么? zookeeper实际上是yahoo开发的,用于分布式中一致性 ...
Spark RDD概念学习系列之为什么会引入RDD？（一）
为什么会引入RDD? 我们知道,无论是工业界还是学术界,都已经广泛使用高级集群编程模型来处理日益增长的数据,如MapReduce和Dryad.这些系统将分布式编程简化为自动提供位置感知性调度. ...
Spark SQL概念学习系列之Spark SQL 优化策略（五）
查询优化是传统数据库中最为重要的一环,这项技术在传统数据库中已经很成熟.除了查询优化, Spark SQL 在存储上也进行了优化,从以下几点查看 Spark SQL 的一些优化策略. (1)内存列式存 ...
Spark SQL概念学习系列之Spark SQL 架构分析（四）
Spark SQL 与传统 DBMS 的查询优化器 + 执行器的架构较为类似,只不过其执行器是在分布式环境中实现,并采用的 Spark 作为执行引擎. Spark SQL 的查询优化是Catalyst ...
Spark SQL概念学习系列之SQL on Spark的简介（三）
AMPLab 将大数据分析负载分为三大类型:批量数据处理.交互式查询.实时流处理.而其中很重要的一环便是交互式查询. 大数据分析栈中需要满足用户 ad-hoc.reporting. iterative ...
Spark SQL概念学习系列之Spark SQL的简介（一）
Spark SQL提供在大数据上的SQL查询功能,类似于Shark在整个生态系统的角色,它们可以统称为SQL on Spark. 之前,Shark的查询编译和优化器依赖于Hive,使得Shark不得不 ...
Spark SQL概念学习系列之DataFrame与RDD的区别
不多说,直接上干货! DataFrame的推出,让Spark具备了处理大规模结构化数据的能力,不仅比原有的RDD转化方式更加简单易用,而且获得了更高的计算性能.Spark能够轻松实现从MySQL到Da ...

随机推荐

关于javascript中静态成员和实例成员的详细解释
关于javascript中静态成员和实例成员的详细解释在我们了解什么是静态成员和实例成员之前,我们首先来了解一下什么是实例? 实例就是由构造函数创建出来的对象. 例如案例中 p 就是实例: fun ...
02--C编程细节整理（一）
用C语言比较多,这篇是平时攒下的.有些内容在工作后可能会很常见,但是不用容易忘,所以就写篇博客吧. 1. printf的用法 %*可以用来跳过字符,可以用于未知缩进.像下面一样. for ...
<轉>APUE:mmap函数
起初看过一遍内存映射I/O,意思大概是懂了,就是直接操作文件再而直接通过缓冲区来操作,减少一些read.write调用所花费的时间.加上文中给出一个copy的例子,意思也好理解的.不过困扰的来了,我 ...
IIS访问php页面问题，报告404错误
IIS访问php页面出现问题,所有php页面找不到,显示404页面,html页面可以正常访问. 搜索结果: 方案1: 打开WEB服务扩展,把“所有未知ISAPI扩展”设为允许! 方案2: PHP没有完 ...
Django之瀑布流
一. 小功能瀑布流的实现 1.完成效果图 2.代码部分 <1>models.py from django.db import models # Create your models her ...
【XSY3347】串后缀
原题:2018 ICPC Asia-East Continent Final J 想看原题解的可以去看吉老师的直播题解题意: 题解: (dllca膜你赛搬原题差评) 考虑题目中给出的式子的含义,实际 ...
jquery.lazyload滚动不起作用
昨天同事在开发图片懒加载功能时用到了lazyload,使用相当标准,然而结果却不如人意,在滚动时未能起作用.引用https://cdn.bootcss.com/jquery_lazyload/1.9. ...
【JavaScript框架封装】实现一个类似于JQuery的属性框架的封装
// 属性框架 (function (xframe) { // 需要参与链式访问的(必须使用prototype的方式来给对象扩充方法) xframe.extend({ /** * 获取/设置某一个元素 ...
正则表达式和豆瓣Top250的爬取练习
datawhale任务2-爬取豆瓣top250 正则表达式豆瓣250页面分析完整代码参考资料正则表达式正则表达式的功能用于实现字符串的特定模式精确检索或替换操作. 常用匹配模式常用修饰符 ...
用Python图像处理
前几天弄了下django的图片上传,上传之后还需要做些简单的处理,python中PIL模块就是专门用来做这个事情的. 于是照葫芦画瓢做了几个常用图片操作,在这里记录下,以便备用. 这里有个字体文件,大 ...

Spark SQL概念学习系列之分布式SQL引擎

Spark SQL概念学习系列之分布式SQL引擎的更多相关文章

随机推荐

热门专题