Spark中SQL列和并为一行

在使用数据库的时候，需要将查询出来的一列按照逗号合并成一行。

原表名字为 TABLE ，表中的部分原始数据为：

+---------+------------------------+

| BASIC | NAME               |

+----------+------------------------+

| 1        | 有害程序事件(MI)       |

| 0        | 计算机病毒事件         |

| 0        | 蠕虫事件               |

| 0        | 特洛伊木马事件         |

+----------+------------------------+

查询代码为：

select GROUP_CONCAT(NAME SEPARATOR  ',') as NAME from TABLE where BASIC=0;

得到部分结果为：

+---------------------------------------------------------+

 | NAME               |

+---------------------------------------------------------+

| 计算机病毒事件,蠕虫事件,特洛伊木马事件         |

+---------------------------------------------------------+

但是在 spark 中没有 GROUP_CONCAT 命令，查找后发现命令 concat_ws ：

ResultDF.createOrReplaceTempView("BIGDATA")

val dataDF=spark.sql("select BASIC,concat_ws(',',collect_set(NAME)) as NAMES from BIGDATA group by BASIC")

得到结果：

+----------+------------------------------------------------+

| BASIC | NAMES               |

+----------+------------------------------------------------+

| 1        | 有害程序事件(MI)       |

| 0        | 计算机病毒事件,蠕虫事件,特洛伊木马事件         |

+----------+------------------------------------------------+

也可以用另一个方法：

import org.apache.spark.sql.functions._

ResultDF.groupBy("BASIC ")

           .agg(collect_set("NAME"))

           .show(10,false)

但是得到的结果为 List ：

+----------+------------------------------------------------+

| BASIC | NAMES               |

+----------+------------------------------------------------+

| 1        | 有害程序事件(MI)       |

| 0        | [计算机病毒事件,蠕虫事件,特洛伊木马事件]        |

+----------+------------------------------------------------+

Spark中SQL列和并为一行的更多相关文章

Spark(Hive) SQL中UDF的使用（Python）
相对于使用MapReduce或者Spark Application的方式进行数据分析,使用Hive SQL或Spark SQL能为我们省去不少的代码工作量,而Hive SQL或Spark SQL本身内 ...
Spark(Hive) SQL中UDF的使用（Python）【转】
相对于使用MapReduce或者Spark Application的方式进行数据分析,使用Hive SQL或Spark SQL能为我们省去不少的代码工作量,而Hive SQL或Spark SQL本身内 ...
神奇的 SQL 之层级 → 为什么 GROUP BY 之后不能直接引用原表中的列
前言开心一刻感觉不妙呀,弟弟舔它! 不该舔的,舔到怀疑人生了...... GROUP BY 后 SELECT 列的限制标准 SQL 规定,在对表进行聚合查询的时候,只能在 SELECT 子句中写 ...
[转]神奇的 SQL 之层级 → 为什么 GROUP BY 之后不能直接引用原表中的列
原文:https://www.cnblogs.com/youzhibing/p/11516154.html 这篇文章,对group by的讲解不错 -------------------------- ...
拆分Sql列中内容的拆分
拆分Sql列中内容的拆分. /*按照符号分割字符串*/ create function [dbo].[m_split](@c varchar(2000),@split varchar(2)) retu ...
sql得到表中的列信息
取列全部用的 sys. 中的表 CTE:WITH name AS() 用法: sql树形查询 ①主键信息 SELECT ic.column_id, ic.index_column_id, ic.o ...
Python：读取txt中按列分布的数据，并将结果保存在Excel文件中 && 保存每一行的元素为list
import xlwt import os def write_excel(words,filename): #写入Excel的函数,words是数据,filename是文件名 wb=xlwt.Wor ...
【SQL】Update中使用表别名、如何用表中一列值替换另一列的所有值
Update中使用表别名 select中的表别名: select * from TableA as ta update中的表别名: update ta from TableA as ta 如何用表中一 ...
Spark(Hive) SQL数据类型使用详解(Python)
Spark SQL使用时需要有若干“表”的存在,这些“表”可以来自于Hive,也可以来自“临时表”.如果“表”来自于Hive,它的模式(列名.列类型等)在创建时已经确定,一般情况下我们直接通过Spar ...

随机推荐

POSIX-Data Structure
struct sigevent The <signal.h> header shall define the sigeventstructure, which shall include ...
DevExpress控件库开发使用经验总结2 DevExpress汉化之WinForm开发模式汉化
2015-01-24 DevExpress控件库默认安装后,使用的本地资源为英文.Developer Express .NET产品都有本地化资源,比如按钮属性,控件属性描述,菜单项,确认和错误的信息等 ...
异步简析之BlockingCollection实现生产消费模式
目前市面上有诸多的产品实现队列功能,比如Redis.MemCache等... 其实c#中也有一个基础的集合类专门用来实现生产/消费模式 (生产模式还是建议使用Redis等产品) 下面是官方的一些资料和 ...
net core体系-web应用程序-4asp.net core2.0 项目实战（CMS）-第一章入门篇-开篇及总体规划
.NET Core实战项目之CMS 第一章入门篇-开篇及总体规划原文地址:https://www.cnblogs.com/yilezhu/p/9977862.html 写在前面千呼万唤始出来 ...
java-数组排序--计数排序、桶排序、基数排序
计数排序引入不难发现不论是冒泡排序还是插入排序,其排序方法都是通过对每一个数进行两两比较进行排序的,这种方法称为比较排序,实际上对每个数的两两比较严重影响了其效率,理论上比较排序时间复杂度的最低下限 ...
使用Anaconda虚拟环境编译caffe-gpu pycaffe
1. 前提: 安装前服务器情况,已经安装好了: CUDNN=7.3.0 CUDA=10.0.130 Opencv 2.4.13 相应命令为: cuda 版本 cat /usr/local/cuda/v ...
docker报错Service 'pwn_deploy_chroot' failed to build: Get https://registry-1.docker.io/v2/library/ubuntu/manifests/16.04:net/http: request canceled
这几天碰到师傅让我帮忙做pwn题环境,结果遇到了坑第一种方法是:https://blog.csdn.net/zhaoyayua/article/details/60141660 解决办法是执行 vi ...
hdu 2005 java
题意: 输入数据格式为YYYY/MM/DD,对于每组输入数据,输出一行,表示该日期是该年的第几天. 思路: 使用Calendar.DAY_OF_YEAR import java.text.ParseE ...
python 日常错误整理
1.NameError: name 'raw_input' is not defined 问题原因:python 3 中raw_input已经被input 替代
php 按月创建日志
public function log($log_string){ //$_SERVER['DOCUMENT_ROOT'].DIRECTORY_SEPARATOR."files". ...

Spark中SQL列和并为一行

Spark中SQL列和并为一行的更多相关文章

随机推荐

热门专题