通过DF，Spark可以跟大量各型的数据源（文件/数据库/大数据）进行交互。前面我们已经看到DF可以生成视图，这就是一个非常使用的功能。

简单的读写流程如下：

通过read方法拿到DataFrameReader对象，与之类似的就有DataFrameWriter对象，通过DF的write方法拿到，通过其save方法将数据保存到文件或数据库。

Spark官方列出的支持的数据格式有：

parquet，这是Apache的一种序列化格式，我没有用过
json
text
csv，逗号或其他分隔符分割的text
orc，也是apache的一种数据格式，没有用过
avro，也是apache的一种数据格式，没有用过
JDBC，spark也是Java的，支持jdbc数据源天经地义
Hive，它本来就干这个的

我们来尝试几个例子。

JSON

我们的json文件还是之前那种不规范格式，我期望读到DF后能变成规范的格式：

Dataset<Row> json = session.read().json("spark-core/src/main/resources/people.json");
json.show();
json.write().save("spark-core/src/main/resources/people.json");

这样执行会报错，说文件已经存在。

于是换一个文件people1.json，这样会生成一个文件夹people1.json，而任务报错：

网上找了一个答案试一下：Exception in thread "main" java.lang.UnsatisfiedLinkError: org.apache.hadoop.io.nativeio.NativeIO$Windows.access0(Ljava/lang/String;I)Z - Stack Overflow

到https://github.com/steveloughran/winutils/blob/master/hadoop-3.0.0/bin 下载hadoop.dll到hadoop的bin目录，执行了一下倒是没报错（看来只是win系统的原因，linux应该不报错吧），产生了一个文件夹：

真奇怪，为什么spark非要使用parquet呢？可这样保存了该咋用呢？

parquet

根据 Parquet Files - Spark 3.2.0 Documentation (apache.org) 的说明，Parquet是apache的一款列式存储数据文件。spark会自动解析它的格式（有哪些字段），并把每一列都作为可空的。主要还是在hadoop相关的环境下使用。

上面生成的parquet文件时可以直接读取的。和读取json文件一样，spark提供了parquet()方法：

除了save方法，spark也支持通过parquet方法直接保存：

JDBC

这种方式对于我们来说可能是使用最多的。从数据库中读取数据，经过处理再写回到数据库。

使用JDBC连接有两种方法，第一种方法是通过option传入连接参数：

DataFrameReader jdbc = session.read().format("jdbc");
jdbc.option("url", "jdbc:mysql://localhost:3306/enn");
jdbc.option("dbtable", "config_info");
jdbc.option("user", "root");
jdbc.option("password", "123456");
Dataset<Row> jdbcDf = jdbc.load();
jdbcDf.show();

直接执行会报错，因为找不到数据库驱动

通过maven引入驱动（实际开发中如果不是使用maven项目，需要把驱动jar包放到服务器上指定classpath）即可成功

除了option参数，spark还提供了通过Jdbc方法来生成DF，这样没有load的显式过程：

可以看到代码更短更面向对象，所以推荐第二种。

另外库名可以放到url中也可以放到表名前面。下面这样也可以，这是驱动提供的能力，和编码无关

现在要把一个DF保存到数据库，使用write即可：

注意要保存的表不能提前存在，不然会说表已经有了。那spark自己怎么创建表呢？它会根据推断的类型创建一个字段都可空的表：

如果想追加数据呢？总不能每次都创建新表吧。可以使用mode方法指定，可以看到插入了两遍：

还有一个问题是汉字编码问题，我们需要指定一下：

这里使用一张已经存在的表，表定义是复制的原始表：

Spark3 学习【基于Java】4. Spark-Sql数据源的更多相关文章

Spark SQL数据源
[TOC] 背景 Spark SQL是Spark的一个模块,用于结构化数据的处理. ++++++++++++++ +++++++++++++++++++++ | SQL | | Dataset API ...
4. Spark SQL数据源
4.1 通用加载/保存方法 4.1.1手动指定选项 Spark SQL的DataFrame接口支持多种数据源的操作.一个DataFrame可以进行RDDs方式的操作,也可以被注册为临时表.把DataF ...
spark sql数据源--hive
使用的是idea编辑器 spark sql从hive中读取数据的步骤:1.引入hive的jar包 2.将hive-site.xml放到resource下 3.spark sql声明对hive的支持案 ...
大数据技术之_19_Spark学习_03_Spark SQL 应用解析 + Spark SQL 概述、解析、数据源、实战 + 执行 Spark SQL 查询 + JDBC/ODBC 服务器
第1章 Spark SQL 概述1.1 什么是 Spark SQL1.2 RDD vs DataFrames vs DataSet1.2.1 RDD1.2.2 DataFrame1.2.3 DataS ...
Apache Spark 2.2.0 中文文档 - Spark SQL, DataFrames and Datasets Guide | ApacheCN
Spark SQL, DataFrames and Datasets Guide Overview SQL Datasets and DataFrames 开始入门起始点: SparkSession ...
Apache Spark 2.2.0 中文文档 - Spark SQL, DataFrames and Datasets
Spark SQL, DataFrames and Datasets Guide Overview SQL Datasets and DataFrames 开始入门起始点: SparkSession ...
DataFrame编程模型初谈与Spark SQL
Spark SQL在Spark内核基础上提供了对结构化数据的处理,在Spark1.3版本中,Spark SQL不仅可以作为分布式的SQL查询引擎,还引入了新的DataFrame编程模型. 在Spark ...
Spark3学习入门【基于Java】
Spark 是离线数据处理的一种大数据技术,和Flick相比数据处理要延后,因为Flick是实时数据处理,而Spark需要先读取数据到内存. Spark的库是基于Scala写的,虽然Scala也是运行 ...
spark SQL学习（数据源之json）
准备工作数据文件students.json {"id":1, "name":"leo", "age":18} {&qu ...
Spark学习之路（十）—— Spark SQL 外部数据源
一.简介 1.1 多数据源支持 Spark支持以下六个核心数据源,同时Spark社区还提供了多达上百种数据源的读取方式,能够满足绝大部分使用场景. CSV JSON Parquet ORC JDBC/ ...

随机推荐

nim 2. 变量与函数
对于系统的学习,官网上的相应的资料, 这里通过一个简单的例程,演示一下. 这个例程里有一个根据半径计算圆面积的方法,以及调用的示例: 演示代码 1 #计算圆的面积 2 proc calcArea(r: ...
Linux部署Apache 网站服务器（httpd服务）
一.项目导入: 某学院组建了校园网,建设了学院网站.现需要架设Web服务器来为学院网站安家,同时在网站上传和更新时,需要用到文件上传和下载,因此还要架设FTP服务器,为学院内部和互联网用户提供WWW. ...
批量删除WordPress文章和页面的数据库命令和从后台直接删除
批量删除wordpress的方法有两种:1.从wp后台可以调整展示:最多999条 2.选择"Bulk"--"Apply" 通过批量删除wordpress文章和页 ...
C语言：如何打印星星
//打印星星 //k是两个上下部分都一样的空格 /*i j k k ...
OpenNESS & OpenVINO Demo 部署
目录文章目录目录部署架构部署 Edge Controller 基础配置配置 Proxy 配置防火墙 Install necessary package Install MySQL Insta ...
关于.net Core在华为云的鲲鹏服务器上部署的细节纪要
由于鲲鹏使用的是ARM的cpu,,非x86的,我们公司买的是Centos,,由于需要在上面部署.net core 3.0/3.1的应用,,在按照官方的文章进行部署之后,会提示 FailFast: Co ...
Python：用tqdm模块绘制进度条
在计算密集型迭代计算中,我们常常需要知道当前的迭代轮次,最传统的方法就是打印当前迭代计数器的轮数.那有没有更好的方法呢?我们可以使用tqdm模块(非py内置,需要单独按照)来在控制台绘制进度条,这样更 ...
全网首一份！你最需要的PPTP MS-CHAP V2 挑战响应编程模拟计算教程！代码基于RFC2759，附全部源码！
本文基于网络密码课上的实验本来想水一水就过去,代码就网上找找,不行就GPT写,但是!一份都找不到,找到的代码都是跑不了的,总会是就是乱七八糟.所以准备认真的写一份. 代码编译成功的前提是要预先装好o ...
.NET Core 中使用GBK GB2312编码报错的问题
错误描述环境 dotnet core 2.1 2.2 dotnet core 3.1 dotnet core 5.0 现象当代码中使用 System.Text.Encoding.GetEnco ...
Android启动过程-万字长文(Android14)
在计算机启动过程和Linux内核Kernel启动过程介绍了计算机启动和内核加载,本篇文章主要介绍Android系统是如何启动的. 一.Android启动流程 Android系统的启动流程与Linux接 ...

Spark3 学习【基于Java】4. Spark-Sql数据源

JSON

parquet

JDBC

Spark3 学习【基于Java】4. Spark-Sql数据源的更多相关文章

随机推荐

热门专题