spark复习总结03

1.DataFrame的创建方式

　　1.1 通过加载外部文件创建

//通过sqlContext读取json文件创建DataFrame

DataFrame dataFrame=sqlContext.read().json("src/main/resources/datafromcreate.txt");
//通过两种方式加载json文件
//sqlContext.read().json("src/main/resources/datafromcreate.txt");
sqlContext.read().format("json").load("src/main/resources/datafromcreate.txt"）；

　　1.2 通过RDD和元数据进行转换

　　　　1.2.1 通过使用动态构建的元数据的方式创建DataFrame

//创建sqlContext

SQLContext sqlContext=new SQLContext(context);

//使用程序构建DataFrame的元数据

StructType structType=new StructType(new StructField[]{

                DataTypes.createStructField("id", DataTypes.IntegerType, false),

                DataTypes.createStructField("name", DataTypes.StringType, true),

                DataTypes.createStructField("age", DataTypes.IntegerType, true)

        });

//创建studentsRdd

JavaRDD<Row> studentsRdd=context.textFile("src/main/resources/students.txt").map(new Function<String, Row>() {

            private static final long serialVersionUID = 1L;

            public Row call(String line) throws Exception {

                String[] words=line.split(" ");

                return RowFactory.create(Integer.parseInt(words[]),words[],Integer.parseInt(words[]));

            }

        });

//使用动态构建的元数据创建DataFrame

DataFrame studentDataFrame= sqlContext.createDataFrame(studentsRdd, structType);

　　　　1.2.2 通过反射的方式，使用javabean的属性作为DataFrame的元数据进行创建DataFrame

//封装为Student JavaRDD

JavaRDD<Student> students=context.textFile("src/main/resources/students.txt").map(new Function<String, Student>() {

            private static final long serialVersionUID = 1L;

            public Student call(String line) throws Exception {

                String[] words=line.split(" ");

                return new Student(Integer.parseInt(words[]), words[], Integer.parseInt(words[]));

            }

        });

//使用反射技术,将javaRdd转换为DataFrame，使用javabean的属性定义DataFrame的元数据

DataFrame studentDataFrame= sqlContext.createDataFrame(students, Student.class);

　　　　1.2.3　使用hiveContext.table方法将hive表中的数据装换为DataFrame

DataFrame goodStudentDF=hiveContext.table("sqark.good_student_info");

　　1.3 加载分区表的parquet文件，自动推断分区字段

//加载parquet文件为DataFrame

 DataFrame usersDF=sqlContext.read().parquet("src/main/resources/parquet/users.parquet");

/**

 * root

    |-- name: string (nullable = true)

    |-- age: long (nullable = true)

*/

usersDF.printSchema();   

/**

* 加载区别表中的数据是会自动推断分区列，
　　users.parquet只有两个字段name,age;
　　female和coutry为分区字段

*/

usersDF=sqlContext.read().parquet("src/main/resources/parquet/female=male/coutry=US/users.parquet");

/**

* root

|-- name: string (nullable = true)

|-- age: long (nullable = true)

|-- female: string (nullable = true)

|-- coutry: string (nullable = true)

*/

usersDF.printSchema();

　　1.4 合并分区

　　　　开启合并元数据的两种方式：
　　　　　　1) sqlContext.read().option("mergeSchema", "true")
　　　　　　 2) SparkConf().set("spark.sql.parquet.mergeSchema", "true")

/**

* megerschema/idandage.txt 中的内容只有id和age两个属性

* megerschema/idandname.txt 中的内容只有id和name两个属性

* 合并以后的元素为id,name,age三个属性

*/

DataFrame personDF=sqlContext.read().option("mergeSchema", "true").format("json").load("src/main/resources/megerschema");

personDF.printSchema();

2.将DataFrame进行保存到外部文件系统

//将DataFrame,默认以parquet类型进行保存，可以使用format修改保存的文件格式

personDF.write().save("src/main/resources/output/persons");

//将DataFrame使用json格式保存
personDF.write().format("json").save("src/main/resources/output/persons");

spark复习总结03的更多相关文章

【spark 深入学习 03】Spark RDD的蛮荒世界
RDD真的是一个很晦涩的词汇,他就是伯克利大学的博士们在论文中提出的一个概念,很抽象,很难懂:但是这是spark的核心概念,因此有必要spark rdd的知识点,用最简单.浅显易懂的词汇描述.不想用学 ...
spark复习笔记(1)
使用spark实现work count ---------------------------------------------------- (1)用sc.textFile(" &quo ...
spark复习笔记(7):sparkstreaming
一.介绍 1.sparkStreaming是核心模块Spark API的扩展,具有可伸缩,高吞吐量以及容错的实时数据流处理等.数据可以从许多来源(如Kafka,Flume,Kinesis或TCP套接字 ...
spark复习笔记(7):sparkSQL
一.saprkSQL模块,使用类sql的方式访问Hadoop,实现mr计算,底层使用的是rdd 1.hive //hadoop mr sql 2.phenoix //hbase上构建sql的交互过 ...
spark复习笔记(6):RDD持久化
在spark中最重要的功能之一是跨操作在内存中持久化数据集.当你持久化一个RDD的时候,每个节点都存放了一个它在内存中计算的一个分区,并在该数据集的其他操作中进行重用,持久化一个RDD的时候,节点上的 ...
spark复习笔记(6):数据倾斜
一.数据倾斜 spark数据倾斜,map阶段对key进行重新划分.大量的数据在经过hash计算之后,进入到相同的分区中,zao
spark复习笔记(4):RDD变换
一.RDD变换 1.返回执行新的rdd的指针,在rdd之间创建依赖关系.每个rdd都有一个计算函数和指向父rdd的指针 Spark是惰性的,因此除非调用某个转换或动作,否则不会执行任何操作,否则将触发 ...
spark复习笔记(5):API分析
0.spark是基于hadoop的mr模型,扩展了MR,高效实用MR模型,内存型集群计算,提高了app处理速度. 1.特点:(1)在内存中存储中间结果 (2)支持多种语言:java scala pyt ...
spark复习笔记(4):spark脚本分析
1.[start-all.sh] #!/usr/bin/env bash # # Licensed to the Apache Software Foundation (ASF) under one ...

随机推荐

python-javascript之bom
BOM BOM介绍全称 Browser Object Mode 浏览器对象模式操作浏览器的API接口.比如浏览器自动滚动 Windows对象的顶层部分是BOM的顶层(核心)对象,所有的对象都是通过 ...
es6 Promise.reject()方法
es6 Promise.reject()方法:https://blog.csdn.net/ixygj197875/article/details/79188195
Oracle学习笔记<4>
多表查询 1.什么是多表查询? 一次select语句需要查询的内容来自于不止一张表. 同时从多张表中查询数据. 单表查询: select id,last_name,salary from s_emp ...
docker--container之间的link,bridge create
container的name和ID一样,也是唯一的,当不知道container的IP时,可以用name替代,但需要先配置link 下面创建两个container 时,未配置link所以ping nam ...
mutt配置太繁琐，如果lz你只是单纯为了发邮件的话，其实用mailx就足以了
mutt配置太繁琐,如果lz你只是单纯为了发邮件的话,其实用mailx就足以了复制内容到剪贴板代码: yum -y install mailx echo "Server port fa ...
html中插入css的4种方法
#1:链入外部样式表 <head> <link href="mystyle.css" rel="stylesheet" type=" ...
Linux 下安装sql server 时 2G内存限制的最新（2019-08-15）解决方案
关于 sqlserver 在linux下安装时有最小内存限制的问题,网上有很多类似的说明,那些操作都是正确的,如果不成功可能 “姿势”不对. 需要注意的是:不能使用最新版本!!! 不能在线下载!!! ...
五、properties编写
1.properties和yml编写对比 2.properties中文乱码解决上面的内容输出的结果原因 idea 默认编码是UTF-8,properties需要修改对应的编码设置编码后的结果正常 ...
String 字符串和StringBuffer的知识点总结
String字符串 1 字符串.equals(); equals和length的区别:equals ...
js调用浏览器
定义和用法 open() 方法用于打开一个新的浏览器窗口或查找一个已命名的窗口. 语法 window.open(URL,name,specs,replace) 参数说明 URL 可选.打开指定的页面 ...

spark复习总结03

spark复习总结03的更多相关文章

随机推荐

热门专题