在spark中操作mysql数据 ---- spark学习之七

使用spark的 DataFrame 来操作mysql数据。

DataFrame是比RDD更高一个级别的抽象，可以应用SQL语句进行操作，详细参考：

https://spark.apache.org/docs/latest/sql-programming-guide.html

这里暂时使用spark-shell进行操作，

1.首先，必须要先下载一个mysql的jdbc的驱动

可以从这里下载

2.然后呢，就好办了。

#具体的启动spark-shell的方法（带上mysql的driver）
$~/spark-shell --driver-class-path /path-to-mysql-jar/mysql-connector-java-5.1.-bin.jar


#定义mysql的信息
val url="jdbc:mysql://10.181.176.226:3306/geo_info"

val prop = new java.util.Properties

prop.setProperty("user","geo")

prop.setProperty("password","xxxxxx”)


#指定读取条件,这里 Array("country_code='CN'") 是where过滤条件

val cnFlight = sqlContext.read.jdbc(url,"gps_location",Array("country_code='CN'"),prop)


#然后进行groupby 操作,获取数据集合

val emailList = cnFlight.groupBy("gps_city", "user_mail”)


#计算数目，并根据数目进行降序排序

val sorted = emailList.count().orderBy( desc("count") )

#显示前10条

sorted.show()

#存储到文件（这里会有很多分片文件。。。）

sorted.rdd.saveAsTextFile("/home/qingpingzhang/data/flight_top”)

#存储到mysql表里
sorted.write.jdbc(url,"table_name",prop)

3.具体文件编写代码，然后提交worker也类似，主要是DataFrame的 sqlContext声明会不一样。

val sc: SparkContext // An existing SparkContext.

val sqlContext = new org.apache.spark.sql.SQLContext(sc)

这里如果要用spark-submit，则会有坑，即便你是用sbt的assembly来打包的一个全的jar包：

参考：http://www.iteblog.com/archives/1300

[itelbog@iteblog ~]$  bin/spark-submit --master local[]     --driver-class-path lib/mysql-connector-java-5.1..jar    --class  spark.SparkToJDBC ./spark-test_2.-1.0.jar

在spark中操作mysql数据 ---- spark学习之七的更多相关文章

ScalikeJDBC，操作mysql数据，API
ScalikeJDBC,操作mysql数据,API 一.构建maven项目,添加pom.xml依赖二.resource文件下创建application.conf文件,并配置以下内容三.操作mysq ...
Python中操作mysql的pymysql模块详解
Python中操作mysql的pymysql模块详解前言 pymsql是Python中操作MySQL的模块,其使用方法和MySQLdb几乎相同.但目前pymysql支持python3.x而后者不支持 ...
(转)Python中操作mysql的pymysql模块详解
原文:https://www.cnblogs.com/wt11/p/6141225.html https://shockerli.net/post/python3-pymysql/----Python ...
openresty开发系列28--openresty中操作mysql
openresty开发系列28--openresty中操作mysql Mysql客户端应用中最常使用的就是数据库了,尤其mysql数据库,那openresty lua如何操作mysql呢? ...
Go中操作mysql
Go中操作mysql 首先在mysql里的test数据库中创建数据表 CREATE TABLE `userinfo` ( `uid` INT(10) NOT NULL AUTO_INCREMENT, ...
解决spark中遇到的数据倾斜问题
一. 数据倾斜的现象多数task执行速度较快,少数task执行时间非常长,或者等待很长时间后提示你内存不足,执行失败. 二. 数据倾斜的原因常见于各种shuffle操作,例如reduceByKey ...
Dos中查看mysql数据时中文乱码
使用jsp页面查看数据时可以正确显示中文,但是dos窗口查看数据时中文显示乱码. 上网查了一下原因:之所以会显示乱码,就是因为MySQL客户端输出窗口显示中文时使用的字符编码不对造成的,可以使用如下的 ...
docker 使用mysqldump命令备份导出项目中的mysql数据
下图为镜像重命名后的镜像名为uoj,现在要把这个镜像中的mysql导出运行如下命令: docker exec -it uoj mysqldump -uroot -proot app_uoj233 & ...
python中操作mysql
import pymysql # 连接数据库 connect = pymysql.Connect( host='localhost', port=3306, user='root', passwd=' ...

随机推荐

SpringMVC学习系列（9）之实现注解式权限验证
对大部分系统来说都需要权限管理来决定不同用户可以看到哪些内容,那么如何在Spring MVC中实现权限验证呢?当然我们可以继续使用servlet中的过滤器Filter来实现.但借助于Spring MV ...
android 常见分辨率（mdpi、hdpi 、xhdpi、xxhdpi ）屏幕适配
http://www.tuicool.com/articles/nuyMZb 1 Android手机目前常见的分辨率 1.1 手机常见分辨率: 4:3 VGA 640*480 (Video G ...
python---dict字典
Python 字典字典是另一种可变容器模型,且可存储任意类型对象. 字典的每个键值(key=>value)对用冒号(:)分割,每个对之间用逗号(,)分割,整个字典包括在花括号({})中 ,格式 ...
使用C#访问SQLLite
1.SQLLite如何集成在C#中 2.相关C#与SQLLite资源,及说明 3.简单示例
WebService---Android中访问WebService接口的方法
最近公司有个项目需要从Android平台访问WebService接口,实现向发布的函数传递对象.在网上找了一些资料,发现使用ksoap2可以调用WebService传递对象. 需要引入ksoap ...
bootstrap-面包屑和分页
<div class="container"> <div class="row"> <ul class="breadcr ...
git初始化
git init:初始化 git status:查看当前目录下文件状态 git add -A(表示添加当前目录下所有文件)/文件名(表示只添加该一个文件) git commit -m '':提交到本地 ...
立体匹配：关于用OpenCV彩色化middlebury网站给定的视差
#include "XYZ.h" void readPFM(Mat_<float> &disp, float &scale, string path) ...
The default for KeyValuePair
if (getResult.Equals(new KeyValuePair<T,U>())) or this: if (getResult.Equals(default(KeyValueP ...
random、面向对象编程
一.random模块:随机数 import random print random.random() print random.randint(,) print random.randrange(,) ...

在spark中操作mysql数据 ---- spark学习之七

在spark中操作mysql数据 ---- spark学习之七的更多相关文章

随机推荐

热门专题