Spark之 RDD转换成DataFrame的Scala实现

依赖

<dependency>

    <groupId>org.apache.spark</groupId>

    <artifactId>spark-sql_2.11</artifactId>

    <version>2.1.3</version>

</dependency>

RDD转化成DataFrame:通过StructType指定schema

package com.zy.sparksql

import org.apache.spark.SparkContext

import org.apache.spark.rdd.RDD

import org.apache.spark.sql.types.{IntegerType, StringType, StructType}

import org.apache.spark.sql.{DataFrame, Row, SparkSession}

/**

  * RDD转化成DataFrame:通过StructType指定schema

  */

object StructTypeSchema {

  def main(args: Array[String]): Unit = {

    //创建sparkSession对象

    val sparkSession: SparkSession = SparkSession.builder().appName("StructTypeSchema").master("local[2]").getOrCreate()

    //获取sparkContext

    val sc: SparkContext = sparkSession.sparkContext

    //设置日志级别

    sc.setLogLevel("WARN")

    //读取文件

    val textFile: RDD[String] = sc.textFile("D:\\person.txt")

    //切分文件

    val lineArrayRDD: RDD[Array[String]] = textFile.map(_.split(","))

    //关联对象

    val rowRDD: RDD[Row] = lineArrayRDD.map(x => Row(x(0).toInt, x(1), x(2).toInt))

    //创建rdd的schema信息

    val schema: StructType = (new StructType)

      .add("id", IntegerType, true, "id")

      .add("name", StringType, false, "姓名")

      .add("age", IntegerType, true, "年龄")

    //根据rdd和schema信息创建DataFrame

    val personDF: DataFrame = sparkSession.createDataFrame(rowRDD, schema)

    //DSL操作

    personDF.show()

    //sql 操作

    //将df注册成表

    personDF.createTempView("person")

    sparkSession.sql("select * from person where id =3").show()

    sparkSession.stop()

  }

}

RDD转化成DataFrame:利用反射机制推断schema

package com.zy.sparksql

import org.apache.spark.SparkContext

import org.apache.spark.rdd.RDD

import org.apache.spark.sql.{DataFrame, SparkSession}

/**

  * RDD转化成DataFrame:利用反射机制推断schema

  */

//todo 定义一个样例类

case class Person(id: Int, name: String, age: Int)

object CaseClassSchema {

  def main(args: Array[String]): Unit = {

    //构建sparkSession 指定appName和master地址(本地测试local)

    val sparkSession: SparkSession = SparkSession.builder().appName("CaseClassSchema").master("local[2]").getOrCreate()

    //获取sparkContext

    val sc: SparkContext = sparkSession.sparkContext

    //设置日志输出级别

    sc.setLogLevel("WARN")

    //加载数据

    val dataRDD: RDD[String] = sc.textFile("D:\\person.txt")

    //切分数据

    val lineArrayRDD: RDD[Array[String]] = dataRDD.map(_.split(","))

    //将rdd和person样例类关联

    val personRDD: RDD[Person] = lineArrayRDD.map(x => Person(x(0).toInt, x(1), x(2).toInt))

    //将rdd转换成dataFrame 导入隐式转换

    import sparkSession.implicits._

    val personDF: DataFrame = personRDD.toDF

    //DSL语法

    personDF.show()

    personDF.printSchema()

    personDF.select("name").show()

    personDF.filter($"age" > 30).show()

    println("---------------------------------------------")

    //sql语法

    //首先要创建临时视图

    personDF.createTempView("person")

    sparkSession.sql("select * from person where id>1").show()

    sparkSession.stop()

  }

}

Spark之 RDD转换成DataFrame的Scala实现的更多相关文章

Spark中RDD转换成DataFrame的两种方式（分别用Java和Scala实现）
一:准备数据源在项目下新建一个student.txt文件,里面的内容为: ,zhangsan, ,lisi, ,wanger, ,fangliu, 二:实现 Java版: 1.首先新建一个s ...
RDD转换成DataFrames
官方提供了2种方法 1.利用反射来推断包含特定类型对象的RDD的schema.这种方法会简化代码并且在你已经知道schema的时候非常适用. 先创建一个bean类 case class Person( ...
spark的RDD如何转换为DataFrame
1.Dataset与RDD之间的交互 Spark仅支持两种方式来将RDD转成Dataset.第一种方式是使用反射来推断一个RDD所包含的对象的特定类型.这种基于反射的方式会让代码更加地简洁,当你在编写 ...
RDD转换成为DataFrame
方式一: 通过case class创建DataFrames(反射) TestDataFrame1.scala package com.bky // 隐式类的导入 // 定义case class,相当于 ...
python 使用csv.reader和csv.writer读写文件并转换成dataframe格式
import csv import pandas as pd ###csv.reader用法 ''' f=open(r"C:\Users\admin\pycdtest\wanyue\yuee ...
sparksql 用反射的方式将rdd转换成dataset/dataframe
java public class ReflectionDemo { private static SparkConf conf = new SparkConf().setAppName(" ...
sparksql 动态设置schema将rdd转换成dataset/dataframe
java public class DynamicDemo { private static SparkConf conf = new SparkConf().setAppName("dyn ...
Python访问MongoDB，并且转换成Dataframe
#!/usr/bin/env python # -*- coding: utf-8 -*- # @Time : 2018/7/13 11:10 # @Author : baoshan # @Site ...
Spark SQL中 RDD 转换到 DataFrame (方法二）
强调它与方法一的区别:当DataFrame的数据结构不能够被提前定义.例如:(1)记录结构已经被编码成字符串 (2) 结构在文本文件中,可能需要为不同场景分别设计属性等以上情况出现适用于以下方法.1. ...

随机推荐

军哥LNMP优化
http://bbs.vpser.net/thread-8914-1-1.html http://www.zxsdw.com/index.php/archives/881/ 修改/usr/local/ ...
Window下SVN使用总结
1 地址:http://subversion.apache.org/packages.html#windows 找到windows下的svn客户端工具.选择Win32Svn 进行安装. 一般环境变量会 ...
js正则表达式验证大全--转载
转载来源:http://www.cnblogs.com/hai-ping/articles/2997538.html#undefined //判断输入内容是否为空 function IsNull(){ ...
汇编_指令_CS与DS的区别
cs是值cpu执行的当前指令的段地址,ds是数据开始的段地址. CS是告诉CPU,去哪个位置找内容当成指令去执行:DS是告诉CPU,去哪个位置找内容当成数据被使用. datastring =ds co ...
read/write/fsync与fread/fwrite/fflush的关系和区别
read/write/fsync: 1. linux底层操作: 2. 内核调用, 涉及到进程上下文的切换,即用户态到核心态的转换,这是个比较消耗性能的操作. fread/fwrite/fflush: ...
【洛谷】P2434 [SDOI2005]区间（暴力）
题目描述现给定n个闭区间[ai, bi],1<=i<=n.这些区间的并可以表示为一些不相交的闭区间的并.你的任务就是在这些表示方式中找出包含最少区间的方案.你的输出应该按照区间的升序排列 ...
oracle 监听静态注册举例解析
网上有很多关于oracle 监听静态注册的文章,但大多都是简单说说,并没有详细的例子,这里,将结合linux as3 下的oracle 10gR2.0.1 举一个具体的例子 1.在 $ORACLE_H ...
Firefox显示您的链接不安全的解决办法
Firefox浏览器,今天突然打开网页的时候提醒,“您的链接不安全”,于是网页怎么刷新都打不开.后来几经查询终于解决,下面告诉大家该如何解决这种情况. 百度经验:jingyan.baidu.com 工 ...
python mac下使用多进程报错解决办法
使用pychram运行python web,web使用了多进程 mac下运行会提示如下: may have been in progress in another thread when fork() ...
histroy.back和histroy.go的区别
histroy.back(-1):直接返回当前页的上一页,数据全部消失,是个新的页面: histroy.go(-1):直接返回当前页的上一页,不过表单里的数据全部还在: histroy.back(0) ...

Spark之 RDD转换成DataFrame的Scala实现

依赖

RDD转化成DataFrame:通过StructType指定schema

RDD转化成DataFrame:利用反射机制推断schema

Spark之 RDD转换成DataFrame的Scala实现的更多相关文章

随机推荐

热门专题