1.单列转化方法

import org.apache.spark.sql.types._

val data = Array(("1", "2", "3", "4", "5"), ("6", "7", "8", "9", "10"))

val df = spark.createDataFrame(data).toDF("col1", "col2", "col3", "col4", "col5")

import org.apache.spark.sql.functions._

df.select(col("col1").cast(DoubleType)).show()

2.循环转变

val colNames = df.columns

var df1 = df

for (colName <- colNames) {

  df1 = df1.withColumn(colName, col(colName).cast(DoubleType))

}

df1.show()

3.通过:_*

val cols = colNames.map(f => col(f).cast(DoubleType))

df.select(cols: _*).show()

+----+----+----+----+----+

|col1|col2|col3|col4|col5|

+----+----+----+----+----+

| 1.0| 2.0| 3.0| 4.0| 5.0|

| 6.0| 7.0| 8.0| 9.0|10.0|

+----+----+----+----+----+

查询指定多列和转变指定列的类型了：

val name = "col1,col3,col5"

df.select(name.split(",").map(name => col(name)): _*).show()

df.select(name.split(",").map(name => col(name).cast(DoubleType)): _*).show()

+----+----+----+

|col1|col3|col5|

+----+----+----+

|   1|   3|   5|

|   6|   8|  10|

+----+----+----+

+----+----+----+

|col1|col3|col5|

+----+----+----+

| 1.0| 3.0| 5.0|

| 6.0| 8.0|10.0|

+----+----+----+

上部分完整代码：

import org.apache.spark.sql.SparkSession

import org.apache.spark.sql.types._

import org.apache.spark.sql.DataFrame

object ChangeAllColDatatypes {

  def main(args: Array[String]): Unit = {

    val spark = SparkSession.builder().appName("ChangeAllColDatatypes").master("local").getOrCreate()

    import org.apache.spark.sql.types._

    val data = Array(("1", "2", "3", "4", "5"), ("6", "7", "8", "9", "10"))

    val df = spark.createDataFrame(data).toDF("col1", "col2", "col3", "col4", "col5")

    import org.apache.spark.sql.functions._

    df.select(col("col1").cast(DoubleType)).show()

    val colNames = df.columns

    var df1 = df

    for (colName <- colNames) {

      df1 = df1.withColumn(colName, col(colName).cast(DoubleType))

    }

    df1.show()

    val cols = colNames.map(f => col(f).cast(DoubleType))

    df.select(cols: _*).show()

    val name = "col1,col3,col5"

    df.select(name.split(",").map(name => col(name)): _*).show()

    df.select(name.split(",").map(name => col(name).cast(DoubleType)): _*).show()

  }

上部分原文地址：董可伦

Spark 将DataFrame所有的列类型改为double的更多相关文章

OpenMesh 将默认的 float 类型改为 double 类型
OpenMesh 中默认的数据类型都是 float 类型的,如果要将其默认的 float 类型改为 double 类型,可以这么做: #include <OpenMesh/Core/Mesh/P ...
Spark SQL DataFrame新增一列的四种方法
方法一:利用createDataFrame方法,新增列的过程包含在构建rdd和schema中方法二:利用withColumn方法,新增列的过程包含在udf函数中方法三:利用SQL代码,新增列的过程 ...
Spark:将DataFrame写入Mysql
Spark将DataFrame进行一些列处理后,需要将之写入mysql,下面是实现过程 1.mysql的信息 mysql的信息我保存在了外部的配置文件,这样方便后续的配置添加. //配置文件示例: [ ...
Oracle中表列由VARCHAR2类型改成CLOB
情景原来表中的列定义成VARCHAR2类型,众所周知,VARCHAR2类型最大支持长度为4000.假设因为业务须要.想把此列转换为CLOB类型,在Oracle中直接通过ALTER语句转换是行不通的. ...
Spark获取DataFrame中列的方式--col，$，column，apply
Spark获取DataFrame中列的方式--col,$,column,apply 1.官方说明 2.使用时涉及到的的包 3.Demo 原文作者:大葱拌豆腐原文地址:Spark获取DataFrame ...
Spark获取DataFrame中列的几种姿势--col，$，column，apply
1.doc上的解释(https://spark.apache.org/docs/2.1.0/api/java/org/apache/spark/sql/Column.html) df("c ...
Spark Dataset DataFrame 操作
Spark Dataset DataFrame 操作相关博文参考 sparksql中dataframe的用法一.Spark2 Dataset DataFrame空值null,NaN判断和处理 1. ...
【spark】dataframe常见操作
spark dataframe派生于RDD类,但是提供了非常强大的数据操作功能.当然主要对类SQL的支持. 在实际工作中会遇到这样的情况,主要是会进行两个数据集的筛选.合并,重新入库. 首先加载数据集 ...
Spark：DataFrame批量导入Hbase的两种方式(HFile、Hive)
Spark处理后的结果数据resultDataFrame可以有多种存储介质,比较常见是存储为文件.关系型数据库,非关系行数据库. 各种方式有各自的特点,对于海量数据而言,如果想要达到实时查询的目的,使 ...

随机推荐

JAVA的一些笔记
/*一般函数与构造函数的区别构造函数:对象创建时,就会调用与之对应的构造函数,对对象进行初始化一般函数:对象创建时,需要函数功能时才调用构造函数:一个对象对象创建时,只调用一次一般函数:对象创 ...
reactor模式前序：传统IO的WEB服务器设计
先看一段经典的WEB JAVA服务器设计 JAVA代码为(伪代码) 1 ServerSocket serverSocket = ...; 2 serverSocket.bind(8899); 3 4 ...
AI驱动的超分辨技术落地实践
近年来,随着深度学习技术的快速发展,基于AI的超分辨技术在图像恢复和图像增强领域呈现出广阔的应用前景,受到了学术界和工业界的关注和重视.但是,在RTC视频领域中,很多AI算法并不能满足实际场景下的应用 ...
加薪攻略之UI组件库实践—storybook
目录加薪攻略之UI组件库实践-storybook 一.业务背景二.选用方案三.引入分析项目结构项目效果四.实现步骤 1.添加依赖 2.添加npm执行脚本 3.添加配置文件 4.添加必要的w ...
linux系统重启网卡后网络不通（NetworkManager篇）
一.故障现象 RHEL7.6系统,使用nmcli绑定双网卡后,再使用以下命令重启network服务后主机网络异常,导致无法通过ssh远程登录系统. # systemctl restart n ...
jQuery中toggle与slideToggle以及fadeToggle的显示、隐藏方法的比较
1.区别 ①动画效果的比较: toggle:直接显示.隐藏,如果有[时间参数]且[匹配的元素有宽度属性],则动态效果为左上角-右下角拉卷效果,透明度0-1之间的变化:若有时间参数但是[匹配的元素没有宽 ...
Educational Codeforces Round 102 (Rated for Div. 2)
比赛地址 A(水题) 题目链接题目: 给出一个数组$a$并能进行一个操作使得数组元素更改为数组任意其他两元素之和,问是否可以让数组元素全部小于等于$d$ 解析: 排序后判断最大值是否小于等于 ...
pip不是内部或外部命令解决方法
问题已经配置好Python环境,但是安装依赖时,出现pip不是内部或外部命令. 解决方法找到pip.exe文件所在的目录,将所在路径配置到环境变量path中. 再次输入pip
SpringMVC文件的上传与下载实现
单文件上传首先创建项目,开发工具是IDEA,选择Spring项目,勾选上Spring和SpringMVC. 然后命名,最后完成. 默认生成配置文件在web/WEB-INF下. 首先导入需要的jar包 ...
python模块详解 | unittest（单元测试框架）（持续更新中）
目录: why unittest? unittest的四个重要概念加载测试用例的三个方法自动加载测试用例忽略测试和预期失败生成html测试报告 why unittest? 简介: Unitte ...

Spark 将DataFrame所有的列类型改为double

Spark 将DataFrame所有的列类型改为double

1.单列转化方法

2.循环转变

3.通过:_*

Spark 将DataFrame所有的列类型改为double的更多相关文章

随机推荐

热门专题