SPARK安装三：SPARK集群部署

使用2.3.0版本，因为公司生产环境是这个版本

一、下载安装

cd /opt

wget https://archive.apache.org/dist/spark/spark-2.3.0/spark-2.3.0-bin-hadoop2.7.tgz

tar -xzvf spark-2.3.-bin-hadoop2..tgz

rm -rf spark-2.3.-bin-hadoop2..tgz

二、配置文件
spark相对于hadoop配置文件和配置项目都比较少，但是spark有5中运行模式，每种模式对应的配置和情况都不一样所以spark的重点是深入了解spark的5中运行模式

配置文件在$SPARK_HOME/conf下，需要配置3个文件

1.spark-env.sh

cp spark-env.sh.template spark-env.sh

vi spark-env.sh

编辑

export JAVA_HOME=/opt/jdk1..0_181

export HADOOP_CONF_DIR=/opt/hadoop-2.7./etc/hadoop

export YARN_CONF_DIR=/opt/hadoop-2.7./etc/hadoop

export SPARK_HOME=/opt/spark-2.3.-bin-hadoop2.

export SPARK_MASTER_HOST=pangu10

export SPARK_HISTORY_OPTS="-Dspark.history.ui.port=18080 -Dspark.history.retainedApplications=30 -Dspark.history.fs.logDirectory=hdfs://pangu10:9000/spark/log"

2.slaves

cp slaves.template slaves

vi slaves

编辑

pangu10

pangu11

pangu12

说明：如果是yarn模式，hadoop配置了slaves文件之后，spark就不需要配置了

3、spark-defaults.conf
HistoryServer用来查看SPARK运行时的计算过程

cp spark-defaults.conf.template spark-defaults.conf

vi spark-defaults.conf

编辑

spark.master spark://pangu10:7077

spark.eventLog.enabled true

spark.eventLog.dir hdfs://pangu10:9000/spark/log

spark.history.fs.logDirectory hdfs://pangu10:9000/spark/log

创建spark日志目录

hadoop fs -mkdir /spark

hadoop fs -mkdir /spark/log

四、环境变量

设置/etc/profile

export JAVA_HOME=/opt/jdk1..0_181

export SCALA_HOME=/opt/scala-2.12.

export CLASSPATH=.:$JAVA_HOME/lib/dt.jar:$JAVA_HOME/lib/tools.jar

export HADOOP_HOME=/opt/hadoop-2.7.

export SPARK_HOME=/opt/spark-2.3.-bin-hadoop2.

export PATH=$PATH:$JAVA_HOME/bin:$SCALA_HOME/bin:$HADOOP_HOME/bin:$SPARK_HOME/bin

SPARK安装三：SPARK集群部署的更多相关文章

ElasticSearch 深入理解三：集群部署设计
ElasticSearch 深入理解三:集群部署设计 ElasticSearch从名字中也可以知道,它的Elastic跟Search是同等重要的,甚至以Elastic为主要导向. Elastic即可 ...
Mongo DB 安装-及分布式集群部署(初稿)
一.安装步骤, 1, 下载最新的Mongo DB数据库:http://www.mongodb.org/downloads?_ga=1.44426535.2020731121.1421844747\ 下 ...
Spark standalone安装（最小化集群部署）
Spark standalone安装-最小化集群部署(Spark官方建议使用Standalone模式) 集群规划: 主机 IP ...
Spark概述及集群部署
Spark概述什么是Spark (官网:http://spark.apache.org) Spark是一种快速.通用.可扩展的大数据分析引擎,2009年诞生于加州大学伯克利分校AMPLab,2010 ...
消息中间件kafka+zookeeper集群部署、测试与应用
业务系统中,通常会遇到这些场景:A系统向B系统主动推送一个处理请求:A系统向B系统发送一个业务处理请求,因为某些原因(断电.宕机..),B业务系统挂机了,A系统发起的请求处理失败:前端应用并发量过大, ...
Kubernetes集群部署篇（一）
K8S集群部署有几种方式:kubeadm.minikube和二进制包.前两者属于自动部署,简化部署操作,我们这里强烈推荐初学者使用二进制包部署,因为自动部署屏蔽了很多细节,使得对各个模块感知很少,非常 ...
Nacos（九）：Nacos集群部署和遇到的问题
前言前面的系列文章已经介绍了Nacos的如何接入SpringCloud,以及Nacos的基本使用方式之前的文章中都是基于单机模式部署进行讲解的,本文对Nacos的集群部署方式进行说明环境准备 J ...
ELK5.2+kafka+zookeeper+filebeat集群部署
架构图考虑到日志系统的可扩展性以及目前的资源(部分功能复用),整个ELK架构如下: 架构解读 : (整个架构从左到右,总共分为5层) 第一层.数据采集层最左边的是业务服务器集群,上面安装了file ...
Spark On YARN 分布式集群安装
一.导读最近开始学习大数据分析,说到大数据分析,就必须提到Hadoop与Spark.要研究大数据分析,就必须安装这两个软件,特此记录一下安装过程.Hadoop使用V2版本,Hadoop有单机.伪分布 ...
Scala进阶之路-Spark独立模式（Standalone）集群部署
Scala进阶之路-Spark独立模式(Standalone)集群部署作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 我们知道Hadoop解决了大数据的存储和计算,存储使用HDFS ...

随机推荐

【RestTemplete】使用RestTemplete传Json或者 {} 报错--解决
https://jira.spring.io/browse/SPR-9220?focusedCommentId=76760&page=com.atlassian.jira.plugin.sys ...
学习笔记之Fluent Python
Fluent Python by Luciano Ramalho https://learning.oreilly.com/library/view/fluent-python/97814919462 ...
Qt中三种解析xml的方式
在下面的随笔中,我会根据xml的结构,给出Qt中解析这个xml的三种方式的代码.虽然,这个代码时通过调用Qt的函数实现的,但是,很多开源的C++解析xml的库,甚至很多其他语言解析xml的库,都和下面 ...
Python 面向对象（三）
继承的实现原理 Python支持多继承多继承的时候属性查找的顺序研究经典类和新式类在属性查找的不同主要是形成菱形关系才有深度跟广度广度优先 Python的继承原理 Python3的内置方 ...
vue源码核心部分
1.模板编译初始化时做的:template ==parse()==>ASTtree ==generate()==>render函数 ==> mount(调用dom方法) 每次 ...
c# 抽象类抽象函数接口
抽象类与抽象方法: 被abstract关键字修饰的类叫做抽象类被abstract关键字修饰的方法叫做抽象方法 1.抽象方法必须放在抽象类中 2.抽象方法不可以实现代码,用空语句替代 3.抽象方法可以 ...
8、Curator的监听机制
原生的zookeeper的监听API所实现的方法存在一些缺点,对于开发者来说后续的开发会考虑的细节比较多. Curator所实现的方法希望摒弃原声API 的不足,是开发看起来更加的简单,一些重连等操作 ...
gitea 源码阅读笔记 002 生成无依赖单文件可执行包
gitea bindata static gitea 可以通过 make generate 生成一个单文件可执行程序, 该文件不需要任何其它依赖,直接可以单独执行. 对于用户的安装.升级和生成dock ...
nodejs通过mocha处理运行文件路径下所有js文件
1.获取文件路径: 方式一:整个js文件使用 var path=require('path');var public_path=path.resolve('../testcase/listData/* ...
性能监控工具以及java堆分析OOM
一.性能监控工具 1.系统性能监控 Linux -确定系统运行的整体状态,基本定位问题所在 -uptime: ------系统时间 ------运行时间(例子中为127天) ------连接数(每 ...

SPARK安装三：SPARK集群部署

SPARK安装三：SPARK集群部署的更多相关文章

随机推荐

热门专题