[Spark SQL_1] Spark SQL 配置

0. 说明

　　Spark SQL 的配置基于 Spark 集群搭建 && Hive 的安装&配置

1. 简介

　　Spark SQL 是构建在 Spark Core 模块之上的四大模块之一，提供 DataFrame 等丰富 API，可以采用传统的 SQL 语句进行数学计算。运行期间，会通过 Spark 查询优化器翻译产物理执行计划，并行计算后输出结果。底层计算原理仍然采用 RDD 计算实现。

2. Spark 与 Hive 集成

　　2.1 在 Spark 配置目录下创建指向 [hive-site.xml ] 文件的同名符号链接

cd /soft/spark/conf

ln -s /soft/hive/conf/hive-site.xml hive-site.xml

　　2.2 复制 Hive 元数据库使用的驱动程序到 Spark 的 jars 目录下，比如 MySQL

cd /soft/hive/lib/

cp mysql-connector-java-5.1..jar /soft/spark/jars

　　2.3 关闭 Hive 配置文件 [hive-site.xml] 文件中版本检查，否则会报版本不一致异常

[centos@s101 ~]$ cd /soft/hive/conf/

[centos@s101 /soft/hive/conf]$ sudo vi hive-site.xml

  <property>

    <name>hive.metastore.schema.verification</name>

    <value>false</value>

  </property>

3. 在 Spark shell 中访问 Hive

　　3.0 开启 ZooKeeper & HDFS & Spark 集群

　　略

　　3.1 启动 spark-shell，观察输出内容，打印 Hive 配置信息

spark-shell --master spark://s101:7077

　　若成功则如下图所示

　　3.2 在 Scala 命令行执行如下命令

# 显示所有数据库

spark.sql("show databases").show()

# 使用指定数据库

spark.sql("use mydb").show() 

# 显示当前数据库中的数据表

spark.sql("show tables").show()

# 查询 customers 表数据

spark.sql("select * from customers").show(1000,false)

# 构造 RDD

val rdd1= sc.parallelize(Array((1,"tom1",12) ,(2,"tom2",13) ,(2,"tom3",14) ))

# 转换 RDD 成DataFrame

val df = rdd1.toDF("id" , "name" , "age")

# 通过 DataFrame select API 实现 SQL 中的 select 语句

df.select("id").show()

# 注册临时表

df.registerTempTable("_cust")

# 通过临时表进行数据操纵

spark.sql("select * from _cust").show(1000 ,false) ;

[Spark SQL_1] Spark SQL 配置的更多相关文章

大数据技术之_27_电商平台数据分析项目_02_预备知识 + Scala + Spark Core + Spark SQL + Spark Streaming + Java 对象池
第0章预备知识0.1 Scala0.1.1 Scala 操作符0.1.2 拉链操作0.2 Spark Core0.2.1 Spark RDD 持久化0.2.2 Spark 共享变量0.3 Spark ...
Hive on Spark和Spark sql on Hive，你能分的清楚么
摘要:结构上Hive On Spark和SparkSQL都是一个翻译层,把一个SQL翻译成分布式可执行的Spark程序. 本文分享自华为云社区<Hive on Spark和Spark sql o ...
spark集群安装配置
spark集群安装配置一. Spark简介 Spark是一个通用的并行计算框架,由UCBerkeley的AMP实验室开发.Spark基于map reduce 算法模式实现的分布式计算,拥有Hadoo ...
Spark学习笔记2（spark所需环境配置
Spark学习笔记2 配置spark所需环境 1.首先先把本地的maven的压缩包解压到本地文件夹中,安装好本地的maven客户端程序,版本没有什么要求不需要最新版的maven客户端. 解压完成之后 ...
[Spark][Python][DataFrame][SQL]Spark对DataFrame直接执行SQL处理的例子
[Spark][Python][DataFrame][SQL]Spark对DataFrame直接执行SQL处理的例子 $cat people.json {"name":" ...
[Spark][Hive][Python][SQL]Spark 读取Hive表的小例子
[Spark][Hive][Python][SQL]Spark 读取Hive表的小例子$ cat customers.txt 1 Ali us 2 Bsb ca 3 Carls mx $ hive h ...
Spark记录-spark-env.sh配置
环境变量含义 SPARK_MASTER_IP master实例绑定的IP地址,例如,绑定到一个公网IP SPARK_MASTER_PORT mater实例绑定的端口(默认7077) SPARK_MA ...
Spark记录-Spark on mesos配置
1.安装mesos #用centos6的源yum安装 # rpm -Uvh http://repos.mesosphere.io/el/6/noarch/RPMS/mesosphere-el-repo ...
Spark 性能相关参数配置详解－任务调度篇
随着Spark的逐渐成熟完善, 越来越多的可配置参数被添加到Spark中来, 本文试图通过阐述这其中部分参数的工作原理和配置思路, 和大家一起探讨一下如何根据实际场合对Spark进行配置优化. 由于篇 ...

随机推荐

面试：atoi和itoa的实现
1.int atoi(const char* src) nullptr指针空白字符' ','\t','\n' 符号位避免值溢出出错信息保存在全局变脸errnum中 ; int atoi(cons ...
揭开Future的神秘面纱——结果获取
前言在前面的两篇博文中,已经介绍利用FutureTask任务的执行流程,以及利用其实现的cancel方法取消任务的情况.本篇就来介绍下,线程任务的结果获取. 系列目录揭开Future的神秘面纱—— ...
第一次项目上Linux服务器（六：Nginx安装及相关命令（转））
1.下载nginx 方法一 wget http://nginx.org/download/nginx-1.11.6.tar.gz 方法二 http://nginx.org/en/download.ht ...
【一个小功能】从js判断ie版本，浅谈navigator对象的appName属性
判断IE版本主要的是获取两个属性,a.当前浏览器名称,b.当前浏览器版本,为此不得不了解navigator对象. 先贴代码 window.onload = function() { var brows ...
访问 .obj文件，由于扩展配置问题而无法提供您请求的页面。如果该页面是脚本，请添加处理程序。如果应下载文件，请添加 MIME 映射
一.错误描述 HTTP 错误 404.3 - Not Found 由于扩展配置问题而无法提供您请求的页面.如果该页面是脚本,请添加处理程序.如果应下载文件,请添加 MIME 映射. 最可能的原因: 可 ...
二叉搜索树（hdu3791）
二叉搜索树 Time Limit: 2000/1000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Others) Total Subm ...
漫画 | Redis常见面试问题（二）
上期,小知和阿音在进行面试问答,可是呢,还没问完小知就表示累了想休息一会,然后就休息去了,但是,以为这样就完了吗? 当然不是,还得继续啊,嘿嘿嘿注:对于第一种,需要应用程序自己处理资源的同步,可以使 ...
Into outfile禁用情况下另类方法拿webshell
首先环境如下: OS:Windows 2003 WAF:Safe Dog 4.0正式版 phpmyadmin:4.7(许多都可以) Mysql:5.5+ PHP:5.3 Apache:2.x 总结方法 ...
01-MySql的前戏
[转]01-MySql的前戏 MySql的前戏在学习Mysql之前,我们先来想一下一开始做的登录注册案例,当时我们把用户的信息保存到一个文件中: #用户名 |密码root|123321 alex|1 ...
怎么给SharePoint得视图设置多个过滤条件？ How to set multiple complex filter conditions to the SharePoint list view ?
平时会很容易遇到需要给视图设置复杂得过滤条件,如果是一两个条件还好多,如果条件超过四个,会比较麻烦,很容易会出现逻辑不清,或者没有按照你得意愿来过滤数据得问题. 解决方案: 设置计算列,calcula ...

[Spark SQL_1] Spark SQL 配置

0. 说明

1. 简介

2. Spark 与 Hive 集成

2.1 在 Spark 配置目录下创建指向 [hive-site.xml ] 文件的同名符号链接

2.2 复制 Hive 元数据库使用的驱动程序到 Spark 的 jars 目录下，比如 MySQL

2.3 关闭 Hive 配置文件 [hive-site.xml] 文件中版本检查，否则会报版本不一致异常

3. 在 Spark shell 中访问 Hive

3.0 开启 ZooKeeper & HDFS & Spark 集群

3.1 启动 spark-shell，观察输出内容，打印 Hive 配置信息

3.2 在 Scala 命令行执行如下命令

[Spark SQL_1] Spark SQL 配置的更多相关文章

随机推荐

热门专题

　　2.1 在 Spark 配置目录下创建指向 [hive-site.xml ] 文件的同名符号链接

　　2.2 复制 Hive 元数据库使用的驱动程序到 Spark 的 jars 目录下，比如 MySQL

　　2.3 关闭 Hive 配置文件 [hive-site.xml] 文件中版本检查，否则会报版本不一致异常

　　3.0 开启 ZooKeeper & HDFS & Spark 集群

　　3.1 启动 spark-shell，观察输出内容，打印 Hive 配置信息

　　3.2 在 Scala 命令行执行如下命令