spark任务提交到yarn上命令总结

1. 使用spark-submit提交任务

集群模式执行 SparkPi 任务，指定资源使用,指定eventLog目录

spark-submit  --class org.apache.spark.examples.SparkPi \

    --master yarn \

    --conf spark.eventLog.dir=hdfs://dbmtimehadoop/tmp/spark2 \

    --deploy-mode cluster \

    --driver-memory 4g \

    --executor-memory 2g \

    --executor-cores 1 \

    --queue thequeue \

    $SPARK_HOME/examples/jars/spark-examples*.jar \

    10

不指定资源，使用yarn的默认资源分配。

spark-submit  --class org.apache.spark.examples.SparkPi \

    --master yarn \

    --conf spark.eventLog.dir=hdfs://dbmtimehadoop/tmp/spark2 \

    --deploy-mode cluster \

    $SPARK_HOME/examples/jars/spark-examples*.jar 10

动态的加载spark配置

./bin/spark-submit --name "My app" --master local[4] --conf spark.eventLog.enabled=false

  --conf "spark.executor.extraJavaOptions=-XX:+PrintGCDetails -XX:+PrintGCTimeStamps" myApp.jar

客户端模式执行 SparkPi 任务:spark-submit

spark-submit  --class org.apache.spark.examples.SparkPi \

    --conf spark.eventLog.dir=hdfs://dbmtimehadoop/tmp/spark2 \

    --master yarn \

    --deploy-mode client \

    --driver-memory 4g \

    --executor-memory 2g \

    --executor-cores 1 \

    $SPARK_HOME/examples/jars/spark-examples*.jar \

    10

2. 使用spark-shell提交任务到yarn上

使用spark-shell测试wordcont:使用-jars加载任务运行依赖的jar包，多个jar包以逗号分隔。

spark-shell --master yarn --conf spark.eventLog.dir=hdfs://dbmtimehadoop/tmp/spark2 --jars /home/fxzhao/hadoop-lzo-0.4.20-SNAPSHOT.jar

在随后的终端框中如下scala脚本：统计hdfs://dbmtimehadoop/tmp/fuxin.zhao/wordcounttest 中各个单词的数量。

在scala终端中输入 “：paste”可以输入多条scala语句。按CRTL+d 结束。

val textFile = sc.textFile("hdfs://dbmtimehadoop/tmp/fx.zhao/wordcounttest")

val counts = textFile.flatMap(line => line.split(" "))

                 .map(word => (word, 1))

                 .reduceByKey(_ + _)

counts.saveAsTextFile("hdfs://dbmtimehadoop/tmp/fx.zhao/wordcounttest_res")

##########将统计结果按照key排序。

val textFile = sc.textFile("hdfs://dbmtimehadoop/tmp/fx.zhao/wordcounttest")

val counts = textFile.flatMap(line => line.split(" "))

                 .map(word => (word, 1))

                 .reduceByKey(_ + _)

                 .sortByKey()

counts.saveAsTextFile("hdfs://dbmtimehadoop/tmp/fx.zhao/wordcounttest_res")

Spark-shell 启动时添加添加依赖jar包：

spark-shell --conf spark.eventLog.dir=hdfs://dbmtimehadoop/tmp/spark2 --jars $HADOOP_HOME/share/hadoop/common/lib/hadoop-lzo-0.4.20-SNAPSHOT.jar

3.spark-sql提交任务到spark的两种方式：

本地模式：

$ spark-sql --master local
yarn模式

$ spark-sql --master yarn

//启动spark-sql时指定eventLog的位置等其他配置（可以通过--conf 来配置修改默认的多个参数）。

$ spark-sql --master yarn --conf spark.eventLog.dir=hdfs://dbmtimehadoop/tmp/spark2 --conf spark.sql.hive.metastore.version=2.1.0

spark任务提交到yarn上命令总结的更多相关文章

Spark作业提交至Yarn上执行的一个异常
(1)控制台Yarn(Cluster模式)打印的异常日志: client token: N/A diagnostics: Application application_1584359 ...
【原创】大叔经验分享（6）Oozie如何查看提交到Yarn上的任务日志
通过oozie job id可以查看流程详细信息,命令如下: oozie job -info 0012077-180830142722522-oozie-hado-W 流程详细信息如下: Job ID ...
Spark程序提交到Yarn集群时所遇异常
Exception 1:当我们将任务提交给Spark Yarn集群时,大多会出现以下异常,如下: 14/08/09 11:45:32 WARN component.AbstractLifeCycle: ...
spark（四）yarn上的运行模式
架构图 yarn-cluster yarn-client 区别 Yarn-cluster spark的driver运行在applicationMaster内,启动流程为: 这张图可能比较直观 Yarn ...
在Yarn上运行spark-shell和spark-sql命令行
转载自:http://lxw1234.com/archives/2015/08/448.htm 如果你已经有一个正常运行的Hadoop Yarn环境,那么只需要下载相应版本的Spark,解压之后做为S ...
Yarn上运行spark-1.6.0
目录目录 1 1. 约定 1 2. 安装Scala 1 2.1. 下载 2 2.2. 安装 2 2.3. 设置环境变量 2 3. 安装Spark 2 3.1. 下载 2 3.2. 安装 2 3.3. ...
运行在YARN上的MapReduce应用程序（以MapReduce为例）
client作用:提交一个应用程序查看一个应用程序的运行状态(通过application master) 第一步:提交MR程序到ResourceManager,ResourceManager为这个应用 ...
客户端MapReduce提交到YARN过程
在Mapreduce v1中是使用JobClient来和JobTracker交互完成Job的提交,用户先创建一个Job,通过JobConf设置好参数,通过JobClient提交并监控Job的进展,在J ...
【原创】大叔经验分享（1）在yarn上查看hive完整执行sql
hive执行sql提交到yarn上的任务名字是被处理过的,通常只能显示sql的前边一段和最后几个字符,这样就会带来一些问题: 1)相近时间提交了几个相近的sql,相互之间无法区分: 2)一个任务有问题 ...

随机推荐

ggplot map
ggplot {ggplot2} R Documentation Create a new ggplot Description ggplot() initializes a ggplot objec ...
django-csrf_exempt
from django.views.decorators.csrf import csrf_exempt @csrf_exempt # 前端ajax请求时需要验证,否则403def fun(reque ...
Discuz 任务、道具、任务和验证类插件制作
一.广告类脚本位置:source/class/adv/adv_name.php语言包位置:source/language/adv/lang_name.php <?php class adv_na ...
Nginx 文件下载资源配置
下面配置是针对所有.apk文件下载本人需要.apk文件放在Linux里面作为下载, 放在/root目录下面出现403 Forbinden, (暂时不清楚), 放在其他目录正常然后新建目录/re ...
artZoom 图片可放大旋转
资源下载:http://www.sucaijiayuan.com/Js/TuPianDaiMa/774.html 第一步:引入文件 <link rel="stylesheet" ...
centos7 配置dns服务器
yum install bind ----------------------------------------------------------------------------------- ...
Common Lisp
[Common Lisp] 1.操作符是什么? 2.quote. 3.单引号是quote的缩写. 4.car与cdr方法. 5.古怪的if语句. 6.and语句. 7.判断是真假. null 与 no ...
Socket调用方式（同步，异步，阻塞，非阻塞）
同步: 我调用一个功能,该功能没有结束前,我死等结果. 异步: 当一个异步过程调用发出后,调用者不能立刻得到结果.该功能在完成后,通过状态.通知和回调来通知调用者. 同步和非同步关注的是调用者是否等待 ...
java解析json串获取key和value
网上例子巨多,纯属个人笔记: JSONObject maleArray = maleObject.getJSONObject("extension"); Iterator<S ...
基于Dcoker的ZooKeeper集群的搭建
背景原来学习 ZK 时, 我是在本地搭建的伪集群, 虽然说使用起来没有什么问题, 但是总感觉部署起来有点麻烦. 刚好我发现了 ZK 已经有了 Docker 的镜像了, 于是就尝试了一下, 发现真是爽 ...

spark任务提交到yarn上命令总结

spark任务提交到yarn上命令总结

1. 使用spark-submit提交任务

2. 使用spark-shell提交任务到yarn上

3.spark-sql提交任务到spark的两种方式：

spark任务提交到yarn上命令总结的更多相关文章

随机推荐

热门专题