一、动机

　　我们已经学了很多在 Spark 中对已分发的数据执行的操作。到目前为止，所展示的示例都是从本地集合或者普通文件中进行数据读取和保存的。但有时候，数据量可能大到无法放在一台机器中，这时就需要探索别的数据读取和保存的方法了。

　　Spark 及其生态系统提供了很多可选方案。本章会介绍以下三类常见的数据源。

　　• 文件格式与文件系统：对于存储在本地文件系统或分布式文件系统（比如 NFS、HDFS、Amazon S3 等）中的数据，Spark 可以访问很多种不同的文件格式，包括文本文件、JSON、SequenceFile，以及 protocol buffer。我们会展示几种常见格式的用法，以及 Spark 针对不同文件系统的配置和压缩选项。

　　• Spark SQL中的结构化数据源：后面会学习 Spark SQL 模块，它针对包括 JSON 和 Apache Hive 在内的结构化数据源，为我们提供了一套更加简洁高效的 API。此处会粗略地介绍一下如何使用 SparkSQL。

　　• 数据库与键值存储：概述 Spark 自带的库和一些第三方库，它们可以用来连接 Cassandra、HBase、Elasticsearch 以及 JDBC 源。

二、文件格式

　　Spark 对很多种文件格式的读取和保存方式都很简单。从诸如文本文件的非结构化的文件，到诸如 JSON 格式的半结构化的文件，再到诸如 SequenceFile 这样的结构化的文件，Spark都可以支持（见表）。Spark 会根据文件扩展名选择对应的处理方式。这一过程是封装好的，对用户透明。

1、文本文件

　　在 Spark 中读写文本文件很容易。当我们将一个文本文件读取为 RDD 时，输入的每一行都会成为 RDD 的一个元素。( SparkContext.wholeTextFiles() 方法)也可以将多个完整的文本文件一次性读取为一个 pair RDD，其中键是文件名，值是文件内容。

import org.apache.spark.SparkContext

import org.apache.spark.SparkConf

object Test {

  def main(args: Array[String]): Unit = {

    // Scala 中读取一个文本文件

    val conf = new SparkConf().setAppName("wordcount").setMaster("local")

    val sc = new SparkContext(conf)

    sc.setLogLevel("WARN")  // 设置日志显示级别

    val input = sc.textFile("words.txt")

    input.foreach(println)

  }

}

2、保存文本文件

　　输出文本文件也相当简单。saveAsTextFile(outputFile) 方法接收一个路径，并将RDD 中的内容都输入到路径对应的文件中。Spark 将传入的路径作为目录对待，会在那个目录下输出多个文件。这样，Spark 就可以从多个节点上并行输出了。在这个方法中，我们不能控制数据的哪一部分输出到哪个文件中，不过有些输出格式支持控制。

3、读取JSON

　　JSON 是一种使用较广的半结构化数据格式。这里有两种方式解析JSON数据，一种是通过Scala自带的JSON包(import scala.util.parsing.json.JSON)。后面还会展示使用Spark SQL读取JSON数据。

import org.apache.spark.SparkContext

import org.apache.spark.SparkConf

import scala.util.parsing.json.JSON

object Test {

  def main(args: Array[String]): Unit = {

    val conf = new SparkConf().setAppName("JSONTest").setMaster("local")

    val sc = new SparkContext(conf)

    sc.setLogLevel("WARN")  // 设置日志显示级别

    val inputFile = "pandainfo.json"//读取json文件

    val jsonStr = sc.textFile(inputFile);

    val result = jsonStr.map(s => JSON.parseFull(s));//逐个JSON字符串解析

    result.foreach(

        {

            r => r match {

            case Some(map:Map[String,Any]) => println(map)

            case None => println("parsing failed!")

            case other => println("unknown data structure" + other)

            }

        }

    );

  }

}

　　第二种方法是通过json4s来解析JSON文件。

import org.apache.spark.SparkContext

import org.apache.spark.SparkConf

import org.json4s.jackson.Serialization

import org.json4s.ShortTypeHints

import org.json4s.jackson.JsonMethods._

import org.json4s.DefaultFormats

object Test {

  def main(args: Array[String]): Unit = {

    // 第二种方法解析json文件

    val conf = new SparkConf().setAppName("wordcount").setMaster("local")

    val sc = new SparkContext(conf)

    sc.setLogLevel("WARN")  // 设置日志显示级别

    implicit val formats = Serialization.formats(ShortTypeHints(List()))

    val input = sc.textFile("pandainfo.json")

    input.collect().foreach(x=>{

      var c = parse(x).extract[Panda]

      println(c.name+","+c.lovesPandas)

    })

    case class Panda(name:String,lovesPandas:Boolean)

  }

}

4、保存JSON

　　写出 JSON 文件比读取它要简单得多。

import org.apache.spark.SparkContext

import org.apache.spark.SparkConf

import org.json4s.jackson.Serialization

import org.json4s.ShortTypeHints

import org.json4s.jackson.JsonMethods._

import org.json4s.DefaultFormats

object Test {

  def main(args: Array[String]): Unit = {

    // 第二种方法解析json文件

    val conf = new SparkConf().setAppName("wordcount").setMaster("local")

    val sc = new SparkContext(conf)

    sc.setLogLevel("WARN")  // 设置日志显示级别

    implicit val formats = Serialization.formats(ShortTypeHints(List()))

    val input = sc.textFile("pandainfo.json")

    input.collect().foreach(x=>{

      var c = parse(x).extract[Panda]

      println(c.name+","+c.lovesPandas)

    })

    case class Panda(name:String,lovesPandas:Boolean)

    // 保存json

    val datasave = input.map{  myrecord =>

      implicit val formats = DefaultFormats

      val jsonObj = parse(myrecord)

      jsonObj.extract[Panda]

    }

    datasave.saveAsTextFile("savejson")

  }

}

5、逗号分隔值与制表符分隔值

　　逗号分隔值（CSV）文件每行都有固定数目的字段，字段间用逗号隔开（在制表符分隔值文件，即 TSV 文件中用制表符隔开）。记录通常是一行一条，不过也不总是这样，有时也可以跨行。读取 CSV/TSV 数据和读取 JSON 数据相似，都需要先把文件当作普通文本文件来读取数据，再对数据进行处理。

import org.apache.spark.SparkContext

import org.apache.spark.SparkConf

import au.com.bytecode.opencsv.CSVReader

import java.io.StringReader

import java.io.StringWriter

import au.com.bytecode.opencsv.CSVWriter

object Test {

  def main(args: Array[String]): Unit = {

    // 在Scala中使用textFile()读取CSV

    val conf = new SparkConf().setAppName("wordcount").setMaster("local")

    val sc = new SparkContext(conf)

    sc.setLogLevel("WARN")  // 设置日志显示级别

    val inputFile = "favourite_animals.csv"//读取csv文件

    val input = sc.textFile(inputFile)

    val result = input.map{

      line => val reader = new CSVReader(new StringReader(line))

      reader.readNext()

    }

    // result.foreach(println)

    for(res <- result)

      for(r <- res)

        println(r)

  }

}

6、SequenceFile

　　SequenceFile 是由没有相对关系结构的键值对文件组成的常用 Hadoop 格式。SequenceFile文件有同步标记，Spark 可以用它来定位到文件中的某个点，然后再与记录的边界对齐。这可以让 Spark 使用多个节点高效地并行读取 SequenceFile 文件。SequenceFile 也是Hadoop MapReduce 作业中常用的输入输出格式，所以如果你在使用一个已有的 Hadoop 系统，数据很有可能是以 SequenceFile 的格式供你使用的。

　　由于 Hadoop 使用了一套自定义的序列化框架，因此 SequenceFile 是由实现 Hadoop 的 Writable接口的元素组成。下表列出了一些常见的数据类型以及它们对应的 Writable 类。标准的经验法则是尝试在类名的后面加上 Writable 这个词，然后检查它是否是 org.apache.hadoop.io.Writable 已知的子类。如果你无法为要写出的数据找到对应的 Writable 类型（比如自定义的 case class），你可以通过重载 org.apache.hadoop.io.Writable 中的 readfields 和 write 来实现自己的 Writable 类。

　　读取SequenceFile：Spark 有专门用来读取 SequenceFile 的接口。在 SparkContext 中，可以调用 sequenceFile(path,keyClass, valueClass, minPartitions) 。前面提到过，SequenceFile 使用 Writable 类，因此 keyClass 和 valueClass 参数都必须使用正确的 Writable 类。

　　保存SequenceFile：在 Scala 中将数据写出到 SequenceFile 的做法也很类似。可以直接调用 saveSequenceFile(path) 保存你的 PairRDD ，它会帮你写出数据。

7、对象文件

　　对象文件看起来就像是对 SequenceFile 的简单封装，它允许存储只包含值的 RDD。和SequenceFile 不一样的是，对象文件是使用 Java 序列化写出的。要保存对象文件，只需在 RDD 上调用 saveAsObjectFile 就行了。读回对象文件也相当简单：用 SparkContext 中的 objectFile() 函数接收一个路径，返回对应的 RDD。

Spark学习之数据读取与保存总结(一)的更多相关文章

Spark学习之数据读取与保存（4）
Spark学习之数据读取与保存(4) 1. 文件格式 Spark对很多种文件格式的读取和保存方式都很简单. 如文本文件的非结构化的文件,如JSON的半结构化文件,如SequenceFile结构化文件. ...
Spark学习之数据读取与保存总结(二)
8.Hadoop输入输出格式除了 Spark 封装的格式之外,也可以与任何 Hadoop 支持的格式交互.Spark 支持新旧两套Hadoop 文件 API,提供了很大的灵活性. 要使用新版的 Ha ...
Spark学习笔记——数据读取和保存
spark所支持的文件格式 1.文本文件在 Spark 中读写文本文件很容易. 当我们将一个文本文件读取为 RDD 时,输入的每一行都会成为 RDD 的一个元素. 也可以将多个完整的文本文件一次 ...
【原】Learning Spark (Python版) 学习笔记(二)----键值对、数据读取与保存、共享特性
本来应该上周更新的,结果碰上五一,懒癌发作,就推迟了 = =.以后还是要按时完成任务.废话不多说,第四章-第六章主要讲了三个内容:键值对.数据读取与保存与Spark的两个共享特性(累加器和广播变量). ...
Spark学习笔记4：数据读取与保存
Spark对很多种文件格式的读取和保存方式都很简单.Spark会根据文件扩展名选择对应的处理方式. Spark支持的一些常见文件格式如下: 文本文件使用文件路径作为参数调用SparkContext中 ...
Spark基础：（四）Spark 数据读取与保存
1.文件格式 Spark对很多种文件格式的读取和保存方式都很简单. (1)文本文件读取: 将一个文本文件读取为一个RDD时,输入的每一行都将成为RDD的一个元素. val input=sc.text ...
Spark(十二)【SparkSql中数据读取和保存】
一. 读取和保存说明 SparkSQL提供了通用的保存数据和数据加载的方式,还提供了专用的方式读取:通用和专用保存保存有四种模式: 默认: error : 输出目录存在就报错 append: 向 ...
【Spark机器学习速成宝典】基础篇03数据读取与保存（Python版）
目录保存为文本文件:saveAsTextFile 保存为json:saveAsTextFile 保存为SequenceFile:saveAsSequenceFile 读取hive 保存为文本文件:s ...
matlab各格式数据读取与保存函数
数据处理及matlab的初学者,可能最一开始接触的就是数据的读取与保存: %matlab数据保存与读入 function datepro clear all; %产生随机数据 mat = rand(, ...

随机推荐

GNSS相关网站汇总
转载: https://blog.csdn.net/zzh_my/article/details/78449972 一.bernese 数据表文件下载 ftp://nfs.kasi.re.kr rin ...
Angular5 宏观把控
1.首先,Angular5相对于Angular4有了一些新的特性: (1)i18n国际化管道: (2)一个组件可以以多个名称导出: (3)使用httpClient: 相比于http,httpClien ...
Spring中IOC和AOP的理解
IOC和AOP是Spring的核心 IOC:控制反转:将创建对象以及维护对象之间的关系由代码交给了spring容器进行管理,也就是创建对象的方式反转了,交由spring容器进行管理. DI:依赖注入: ...
架构之微服务(zookeeper)
ZooKeeper是一个分布式的,开放源码的分布式应用程序协调服务,它包含一个简单的原语集,分布式应用程序可以基于它实现同步服务,配置维护和命名服务等.Zookeeper是hadoop的一个子项目,其 ...
BOM,DOM常见操作和DHML
BOM (Browser Object Model)浏览器对象模型,控制浏览器的一些行为 window对象代表一个HTML文档属性页面导航的5个属性 self, parent, top, ope ...
主成分分析PCA详解
转载请声明出处:http://blog.csdn.net/zhongkelee/article/details/44064401 一.PCA简介 1. 相关背景上完陈恩红老师的<机器学习与知识 ...
linux中~/cut/argus/
1.Linux shell 截取字符变量的前8位实现方法有如下几种: expr substr "$a" 1 8 echo $a|awk '{print substr(,1,8)} ...
ASP.NET后台中调用前台Javascript函数的几种方法
做web开发,用的技术是aspx.net,可是由于比较习惯于ASP现在做起来,觉得非常别扭,原因在于有很多功能其实在前台可以处理的,但是因为用到了很多webcontrol,导致不断postback.如 ...
全局唯一ID发号器的几个思路
标识(ID / Identifier)是无处不在的,生成标识的主体是人,那么它就是一个命名过程,如果是计算机,那么它就是一个生成过程.如何保证分布式系统下,并行生成标识的唯一与标识的命名空间有着密不可 ...
关于Linux虚拟化技术KVM的科普科普四(From humjb_1983)
另一组关于KVM的分析文档,虚拟化相关概念.KVM基本原理和架构一-概念和术语.KVM基本原理和架构二-基本原理.KVM基本原理及架构三-CPU虚拟化.KVM基本原理及架构四-内存虚拟化.KVM基本原 ...

Spark学习之数据读取与保存总结(一)