[DB] Spark SQL
概述
- 基于Spark,兼容Hive
- 集成在Spark中,不需单独安装
- 提供统一的数据访问方式
- 结构化的数据类型:JDBC、JSON、Hive、Parquet(Saprk SQL 默认数据源)
- 支持标准的数据连接:JDBC、ODBC
- Hive把sql解析成了mapreduce程序,sparksql把sql语句解析成了Spark任务
- spark core 操作RDD,spark sql 操作DataFrame
- RDD内部元素是java对象,DataFrame内部是Row对象,相比于RDD多了元信息
- DataFrame是一种以RDD为基础的分布式数据集,类似MySQL的表
- DataSet是分布式的数据集合,提供了强类型支持,在RDD每行增加类型约束,解决了DataFrame缺乏编译时类型安全
- DataSet包含了DataFrame功能,Spark2.0中两者统一,DataFrame表示为DataSet[Row]
- 表(DataFrame)= 结构(Schema) + 数据(RDD)
- Spark on Hive:通过Sparksql加载Hive配置文件,获取元信息,底层运行Spark RDD(Spark主导,拿到Hive元信息),例如通过Spark程序将Hive数据写入ES
- Hive on Spark:把Hive查询从mr操作替换为Spark RDD操作,需重新编译Spark,操作较复杂(Hive主导,替换计算引擎)
RDD
DataFrame
或
DataSet

优缺点
RDD
- 优点
- 编译时类型安全
- 面向对象开发风格
- 缺点
- 构建java对象会占用heap堆空间,导致频繁GC
- 数据序列化,反序列化开销大
DataFrame
- 优点
- 引入off-heap,对象构建不占用堆内存,避免频繁GC,运行效率高
- 引入schema,传输数据量减小,序列化反序列化开销减小
- 缺点
- 编译时不安全
- 不具有面向对象开发风格
DataSet
- 优点
- 结合RDD和DataFrame
- 支持自定义对象存储
- 支持结构化数据sql查询
- 采用堆外存储,gc友好
- 类型转换安全,代码友好
创建DataFrame
- 使用 case class 样本类
- 定义表的 schema
- 导入HDFS的dept.csv作为数据
- 使用 Spark Session
- 包括 Spark Context、SQL Context、Streaming Context
- 2.0后引入的统一访问接口,可访问所有spark组件
- 使用StructType创建schema
- 读取带格式文件
- Json

操作DataFrame
- DSL语句
- SQL语句
DataSet
视图
- 虚表,不存储数据
- 普通视图:本地视图,只在当前session中有效
- 全局视图:在不同session中都有效,把全局视图创建命名空间,global_temp
数据源
- load() 和 save()
- Parquet文件
- 列式存储文件,Spark SQL默认数据源
- 把其它文件转为Parquet文件
- 支持Schema的合并:项目开始的时候,表(schema)很简单,逐步向表中增加新的列
- Json文件
- val testResult = spark.read.json("/usr/local/tmp_files/emp.json")
- JDBC
- Hive
自定义函数
- UDF
- UDAF
性能优化
- 缓存方式:在内存中缓存数据
- 性能优化参数
IDE中开发
- 关闭log4j
参考
官网
Spark 集成 Hive
https://www.cnblogs.com/juncaoit/p/6545092.html
https://blog.csdn.net/qq_16633405/article/details/78278786
https://blog.csdn.net/weixin_37677769/article/details/83580893
http://bcxw.net/article/550.html
https://blog.csdn.net/qq_38704184/article/details/86482948
https://blog.csdn.net/xiaohu21/article/details/108960672
[DB] Spark SQL的更多相关文章
- Spark SQL Thrift Server 配置 Kerberos身份认证和权限管理
转载请注明出处:http://www.cnblogs.com/xiaodf/ 之前的博客介绍了通过Kerberos + Sentry的方式实现了hive server2的身份认证和权限管理功能,本文主 ...
- Spark SQL概念学习系列之Spark SQL 架构分析(四)
Spark SQL 与传统 DBMS 的查询优化器 + 执行器的架构较为类似,只不过其执行器是在分布式环境中实现,并采用的 Spark 作为执行引擎. Spark SQL 的查询优化是Catalyst ...
- Spark SQL 初步
已经Spark Submit 2013哪里有介绍Spark SQL.就在很多人都介绍Catalyst查询优化框架.经过一年的发展后,.今年Spark Submit 2014在.Databricks放弃 ...
- 大数据技术之_19_Spark学习_03_Spark SQL 应用解析 + Spark SQL 概述、解析 、数据源、实战 + 执行 Spark SQL 查询 + JDBC/ODBC 服务器
第1章 Spark SQL 概述1.1 什么是 Spark SQL1.2 RDD vs DataFrames vs DataSet1.2.1 RDD1.2.2 DataFrame1.2.3 DataS ...
- spark SQL读取ORC文件从Driver启动到开始执行Task(或stage)间隔时间太长(计算Partition时间太长)且产出orc单个文件中stripe个数太多问题解决方案
1.背景: 控制上游文件个数每天7000个,每个文件大小小于256M,50亿条+,orc格式.查看每个文件的stripe个数,500个左右,查询命令:hdfs fsck viewfs://hadoop ...
- 通过spark sql 将 hdfs上文件导入到mongodb
功能:通过spark sql 将hdfs 中文件导入到mongdo 所需jar包有:mongo-spark-connector_2.11-2.1.2.jar.mongo-java-driver-3.8 ...
- Spark SQL笔记
HDFS HDFS架构 1.Master(NameNode/NN) 对应 N个Slaves(DataNode/NN)2.一个文件会被拆分成多个块(Block)默认:128M例: 130M ==> ...
- Spark SQL快速离线数据分析
拷贝hive-site.xml到spark的conf目录下面 打开spark的conf目录下的hive-site.xml文件 加上这段配置(我这里三个节点的spark都这样配置) 把hive中的mys ...
- Caused by: java.sql.SQLException: Failed to start database 'metastore_db' with class loader org.apache.spark.sql.hive.client.IsolatedClientLoader$$anon$1@d7c365, see the next exception for details.
解决方法:https://stackoverflow.com/questions/37442910/spark-shell-startup-errors 异常: 18/01/29 19:04:27 W ...
随机推荐
- TypeError: 'list' object cannot be interpreted as an integer Python常见错误
想要通过索引来迭代一个list或者string的元素, 这需要调用 range() 函数.要记得返回len 值而不是返回这个列表.
- java面试一日一题:java线程池
问题:请讲下java中的线程池 分析:在面试中经常问到线程池的问题,要掌握其基本概念,使用方法,注意事项等,引申下tomcat中默认的线程数是多少 回答要点: 主要从以下几点去考虑, 1.为什么要使用 ...
- Java集合--Java核心面试知识整理(二)
目前CSDN,博客园,简书同步发表中,更多精彩欢迎访问我的gitee pages 目录 JAVA集合 2.1 接口继承关系和实现 2.2 List 2.2.1 ArrayList(数组) 2.2.2 ...
- 仅使用css实现点击 控制元素的显示与隐藏!
视频教程:https://www.bilibili.com/video/BV1uE411Q7tx?p=15&spm_id_from=pageDriver 大致方法:在被点击的元素后面 放一个c ...
- java面试系列<2>——java容器
1.概览 容器主要包括Collection和Map两种,Collection存储着对象的集合,而map存储着键值对(两个对象)的映射表 Collection 1.set TreeSet:基于红黑树实现 ...
- 生产环境中的redis是怎么部署的?
redis cluster,10台机器,5台机器部署了redis主实例,另外5台机器部署了redis的从实例,每个主实例挂了一个从实例,5个节点对外提供读写服务,每个节点的读写高峰qps可能可以达到每 ...
- 解决JDK9以上的非法反射访问警告
1 问题描述 JDK9以上很多库都有这种非法反射访问的警告,比如protostuff: 解决方法两个: JDK降级 添加JVM参数 2 原因 降到JDK8能解决以上问题. 但是这不是本文的重点. 先说 ...
- 指方画圆之Java设计模式:适配器模式
目录 应用场景 适配器模式 定义 意图 主要解决问题 何时使用 优缺点 指鹿为马VS指方为圆 指鹿为马 指方为圆 应用场景 使用者依赖的接口与提供者的接口不匹配时,就加一层适配,而不修改两端的代码 生 ...
- Day07_37_深度剖析集合中的contains()方法
深度剖析集合中的 contains()方法 contains()方法查找集合中是否包含某个元素 contains() 底层使用的是 equals()方法 当contains()方法拿到一个对象的时候, ...
- Android埋点技术概览
注:本文同步发布于微信公众号:stringwu的互联网杂谈Android无埋点技术概览 本文是Android无埋点系列的开篇---埋点技术概览 1 背景 埋点是数据产品经理(分析师)基于业务需求,对用 ...