Scala构建元数据

阿文awen 2024-09-04 15:00:34 原文

反射方式构建元数据:　

　　通过反射来获取RDD中的Schema信息。这种方式适合于列名(元数据)已知的情况下

　　　　步骤:

　　　　　　1.SparkConf配置环境

　　　　　　2.SparkContext初始化上下文

　　　　　　3.SQLContext初始化SparkSQL上下文

　　　　　　4.创建一个普通的RDD(sc.textFile)

　　　　　　5.使用map方法切割行数据,切割取出数据放入case类中

　　　　　　　　　studented(lines(0).toInt, lines(1), lines(2).toInt)

　　　　　　6.反射方式中普通RDD创建DataFrame需要导入隐式转换

　　　　　　　　　//注意：需要导入一个隐式转换
　　　　　　　　　import sQLContext.implicits._
　　　　　　　　　val df: DataFrame = rdd2.toDF()

　　　　　　7.注册临时表

　　　　　　　　　方式一:　df.createTempView("student1")
　　　　　　　　　方式二:　df.registerTempTable("student") //过时了

　　　　　　8.写SQL语句,自由的浪起来

　　　　　　　　　val sql = sQLContext.sql("select * from student")

　　　　　　9.保存结果到本地或者HDFS

　　　　　　　　//保存查询结果到本地
　　　　　　　　sql.write.json("c:\\demo\\gaoyong.json")
　　　　　　　　//保存查询结果到HDFS
　　　　　　　　sql.write.json("hdfs://awen01:9000/json")

编程接口方式构建元数据:

　　通过编程接口的方式将Schema信息应用于RDD，这种方式可以处理那种在运行时才能知道列的方式。

一般不知道元数据的情况下使用.

　　　　步骤:

　　　　　　1.SparkConf配置环境

　　　　　　2.SparkContext初始化上下文

　　　　　　3.SQLContext初始化SparkSQL上下文

　　　　　　4.创建一个普通的RDD(sc.textFile)

　　　　　　5.使用map切割行数据,将需要的字段放入到Row类中

　　　　　　　　val lines: RDD[Row] = rdd.map(t => {
　　　　　　　　val str = t.split(",")
　　　　　　　　　　Row(str(0).toInt, str(1), str(2).toInt)
　　　　　　　　})

　　　　　　6.编程结构的方式需要构建表的框架,构建StructType,及其元数据

val structType: StructType = StructType(Array(

      StructField("ids",IntegerType,true)

      StructField("names",StringType,true)

      StructField("ages",IntegerType,true)

))

　　　　　　7.构建DataFrame

　　　　　　　　val df = sQLContext.createDataFrame(lines,structType)

　　　　　　8.注册临时表

　　　　　　　　　方式一:　df.createTempView("student1")
　　　　　　　　　方式二:　df.registerTempTable("student") //过时了

　　　　　　9.写SQL语句,自由的浪起来

　　　　　　　　　val sql = sQLContext.sql("select * from student")

　　　　　　10.保存结果到本地或者HDFS

　　　　　　　　//保存查询结果到本地
　　　　　　　　sql.write.json("c:\\demo\\gaoyong.json")
　　　　　　　　//保存查询结果到HDFS
　　　　　　　　sql.write.json("hdfs://awen01:9000/json")

Scala构建元数据的更多相关文章

scala构建类似java的pojo
主要看以下代码: package com.test.scalaw.test.demo import scala.beans.BeanProperty /** * scala构建类似java 的pojo ...
【Scala-ML】怎样利用Scala构建并行机器学习系统
引言在学习Scala的过程中,我发现其在构建大规模分布式计算系统上有与生俱来的特质. 其丰富的类型系统能够帮助编程设计提供非常好的信息隐藏和抽象,其monoids和monads概念利用Scala高阶 ...
【Scala-ML】使用Scala构建机器学习工作流
引言在这一小节中.我将介绍基于数据(函数式)的方法来构建数据应用.这里会介绍monadic设计来创建动态工作流,利用依赖注入这种高级函数式特性来构建轻便的计算工作流. 建模过程在统计学和概率论中, ...
Scala构建工具SBT
SBT(Simple Build Tool)是Scala的项目构建工具,拥有依赖管理,构建过程管理和打包等功能. SBT官网上给出各平台的安装方法: MAC: 使用homebrew安装 brew in ...
Scala构建工具sbt的配置
时间是17年12月24日.初学Scala,想使用它的标配构建工具sbt,结果好大一轮折腾,因为公司隔离外网,需要内部代理,所以尤其折腾.下面的配置参考了好多篇不同的文章,已经没法一一留下出处了.而且还 ...
scala泛函编程是怎样被选中的
现在计算机技术发展现象是:无论硬件技术如何发展都满足不了软件需求:无论处理器变得能跑多快,都无法满足软件对计算能力的需要.按照摩尔定律(Moore's Law)处理器(CPU)每平方面积上包含的半导体 ...
利用Google开源Java容器化工具Jib构建镜像
转载:https://blog.csdn.net/u012562943/article/details/80995373 一.前言容器的出现让Java开发人员比以往任何时候都更接近“编写一次,到处运 ...
加速和简化构建Docker(基于Google jib)
赵安家 2019年02月11日阅读 1518 关注加速和简化构建Docker(基于Google jib) 介绍其实jib刚发布时就有关注,但是一直没有用于生产,原因有二基于 spotify/do ...
Scala学习一——基础
一.使用Scala解释器如果以命令行的方式运行,输出的结果会把类型带上,且结果名默认为res0递增.且Scala解释器读到一个解释器求值打印然后读取下一个(这个过程为读取-求值-打印-循环[REPL ...

随机推荐

AFNetworking 3.0修改指南
AFNetworking是一款在OS X和iOS下都令人喜爱的网络库.为了迎合iOS新版本的升级, AFNetworking在3.0版本中删除了基于NSURLConnectionAPI的所有支持.如果 ...
Socket网络通信之BIO
Socket网络通信之BIO 如果要让两台计算机实现通信,需要的条件:ip,port,协议. 目前我们用的最多的就是TCP/IP协议和UDP协议.TCP三次握手,所以比较慢,且安全:UDP速度快,但是 ...
软件测试技术第一次试验之——JUnit的安装与使用
众所周知,在一个大型的软件项目中,测试是必不可少的.传统的测试方法往往要自己编写测试函数再结合测试用例进行验证,这样会显得比较繁琐.所以我们可以使用JUnit框架进行测试. 使用junit的好处就是这 ...
nopCommerce 4.10 发布了
我们的开发工作主要集中在将nopCommerce转移到.NET Core 2.1,性能和架构改进,进一步增强和修复错误. NopChommerce 中文社区:http://www.nopcn.com ...
Unified Service Desk Overview
As we implement CRM in enterprise, we usually integrate with many other information system such as E ...
CSS 笔记之 CSS 选择器
/*先设置背景再设置前景*/ pre{ background-color: #f8f8f8; border: solid 1px #ccc; border-radius: 3px; overflow: ...
如何找到Android app启动activity和页面元素信息
在实施app自动化的时候,我们需要知道app 的启动activity和页面元素信息,以此启动app和定位页面元素,那么如何在没有源码的情况下找打他们呢?当然是有好的工具啦,有Android sdk自带 ...
Excel操作之VLOOKUP函数
1.作用 VLOOKUP函数是Excel中的一个纵向查找函数,它与LOOKUP函数和HLOOKUP函数属于一类函数,在工作中都有广泛应用,例如可以用来核对数据,多个表格之间快速导入数据等函数功能.功能 ...
python从字符串中提取数字，使用正则表达式
使用正则表达式 import re D = re.findall(r"\d+\.?\d*",line) print(D) -7.23246 10.8959 5.19534 0.06 ...
chromedp下载文件的方法，备忘一下。
sect := `//a[@href="v/443.json"]` wd,_ := os.Getwd() fmt.Println(wd) return chromedp.Tasks ...