Spark Java创建DataFrame

以前用Python和Scala操作Spark的时候比较多，毕竟Python和Scala代码写起来要简洁很多。

今天一起来看看Java版本怎么创建DataFrame，代码写起来其实差不多，毕竟公用同一套API。测试数据可以参考我之前的文章。

先来总结下Spark的一般流程：

1，先创建Spark基础变量，spark，sc

2，加载数据，rdd.textFile，spark.read.csv/json等

3，数据处理，mapPartition, map，filter，reduce等一系列transformation操作

4，数据保存，saveAstextFile，或者其他DataFrame方法

祭出代码

package dev.java;

import dev.utils.Utils;

import org.apache.spark.api.java.JavaRDD;

import org.apache.spark.api.java.JavaSparkContext;

import org.apache.spark.sql.Dataset;

import org.apache.spark.sql.Row;

import org.apache.spark.sql.RowFactory;

import org.apache.spark.sql.SparkSession;

import org.apache.spark.sql.types.StructType;

import scala.Tuple2;

import java.util.List;

public class Spark1 {

    private static final String fileData = "seed";

    private static final String fileSave = "result";

    private static SparkSession spark = SparkSession.builder()

                .appName("Java-Spark")

                .master("local[*]")

                .config("spark.default.parallelism", 100)

                .config("spark.sql.shuffle.partitions", 100)

                .config("spark.driver.maxResultSize", "3g")

                .getOrCreate();

    private static JavaSparkContext sc = JavaSparkContext.fromSparkContext(spark.sparkContext());

    public static void main(String[] args) {

        Utils.delete(fileSave);

        //

        t1();

    }

    private static void t1() {

        JavaRDD<Row> rdd = sc.textFile(fileData)

                .map(v -> {

                    String[] parts = v.split("\t");

                    return RowFactory.create(parts[0], Long.parseLong(parts[1]));

                })

                .filter(v -> v.getLong(1) >= 10000)

                .sortBy(v -> v.getLong(1), false, 100)

                .coalesce(2);

        Dataset<Row> df = spark.createDataFrame(rdd, StructType.fromDDL("title string, qty long"));

        df.write().csv(fileSave);

        spark.stop();

    }

}

Spark Java创建DataFrame的更多相关文章

spark sql 创建DataFrame
SQLContext是创建DataFrame和执行SQL语句的入口通过RDD结合case class转换为DataFrame 1.准备:hdfs上提交一个文件,schema为id name age, ...
Spark 基础 —— 创建 DataFrame 的三种方式
1.自定义 schema(Rdd[Row] => DataSet[Row]) import org.apache.spark.sql.types._ val peopleRDD = spark. ...
【Spark篇】---SparkSQL初始和创建DataFrame的几种方式
一.前述 1.SparkSQL介绍 Hive是Shark的前身,Shark是SparkSQL的前身,SparkSQL产生的根本原因是其完全脱离了Hive的限制. SparkSQL支持查询原 ...
Spark SQL初始化和创建DataFrame的几种方式
一.前述 1.SparkSQL介绍 Hive是Shark的前身,Shark是SparkSQL的前身,SparkSQL产生的根本原因是其完全脱离了Hive的限制. SparkSQL支持查询原 ...
JAVA SparkSQL初始和创建DataFrame的几种方式
建议参考SparkSQL官方文档:http://spark.apache.org/docs/latest/sql-programming-guide.html 一.前述 1.SparkSQ ...
大数据学习day25------spark08-----1. 读取数据库的形式创建DataFrame 2. Parquet格式的数据源 3. Orc格式的数据源 4.spark_sql整合hive 5.在IDEA中编写spark程序（用来操作hive） 6. SQL风格和DSL风格以及RDD的形式计算连续登陆三天的用户
1. 读取数据库的形式创建DataFrame DataFrameFromJDBC object DataFrameFromJDBC { def main(args: Array[String]): U ...
Spark SQL怎么创建编程创建DataFrame
创建DataFrame在Spark SQL中,开发者可以非常便捷地将各种内.外部的单机.分布式数据转换为DataFrame.以下Python示例代码充分体现了Spark SQL 1.3.0中DataF ...
Spark SQL 之 DataFrame
Spark SQL 之 DataFrame 转载请注明出处:http://www.cnblogs.com/BYRans/ 概述(Overview) Spark SQL是Spark的一个组件,用于结构化 ...
spark1.4加载mysql数据创建Dataframe及join操作连接方法问题
首先我们使用新的API方法连接mysql加载数据创建DF import org.apache.spark.sql.DataFrame import org.apache.spark.{SparkCo ...

随机推荐

PHP boolval() 函数
boolval 函数用于获取变量的布尔值.高佣联盟 www.cgewang.com 版本要求:PHP 5 >= 5.5.0, PHP 7. 语法 boolean boolval ( mixed ...
PHP lcg_value() 函数
实例返回范围为 (0, 1) 的一个伪随机数: <?phpecho lcg_value();?>高佣联盟 www.cgewang.com 定义和用法 lcg_value() 函数返回范围 ...
PHP xml_get_current_column_number() 函数
定义和用法 xml_get_current_column_number() 函数获取 XML 解析器的当前列号. 如果成功,该函数则返回当前列号.如果失败,则返回 FALSE.高佣联盟 www.cge ...
7.18 NOI模拟赛因懒无名线段树分治线段树维护直径
LINK:因懒无名 20分显然有\(n\cdot q\)的暴力. 还有20分每次只询问一种颜色的直径不过带修改. 容易想到利用线段树维护直径就可以解决了. 当然也可以进行线段树分治每种颜色存一下直 ...
4.17 斐波那契数列 K维斐波那契数列矩阵乘法构造
一道矩阵乘法的神题早上的时候我开挂了想了2h想出来了. 关于这道题我推了很多矩阵最终推出两个核心矩阵发现这两个矩阵放在一起做快速幂就行了. 当k==1时显然的矩阵乘法多开一个位置维护前缀和 ...
asp.net core 3.1 自定义中间件实现jwt token认证
asp.net core 3.1 自定义中间件实现jwt token认证话不多讲,也不知道咋讲!直接上代码认证信息承载对象[user] /// <summary> /// 认证用户信息 ...
java交换两个参数值的四种方法
第一种:添加中间变量,算是最经典最简易的一种了. //添加一个中间变量 int x = 1, y = 2; int z; z = x;x = y;y = z; System.out.println(x ...
time模块 random模块
time模块 time.sys等模块是C语言实现的,内置到了python解释器的.而不是py文件. 导入模块的时候,优先到python解释器,然后才会找py文件. #时间戳 #计算 # print(t ...
每日一道 LeetCode (8)：删除排序数组中的重复项和移除元素
每天 3 分钟,走上算法的逆袭之路. 前文合集每日一道 LeetCode 前文合集代码仓库 GitHub: https://github.com/meteor1993/LeetCode Gitee ...
【Linux】zookeeper-3.5.6最新版安装攻略，以及安装问题汇总
第一步下载:https://mirrors.tuna.tsinghua.edu.cn/apache/zookeeper/zookeeper-3.5.6/ 浏览器打开这个地址下载我们需要的安装包 apa ...

Spark Java创建DataFrame

Spark Java创建DataFrame的更多相关文章

随机推荐

热门专题