Spark 2.1.1 源码编译

标签（空格分隔）： Spark

Spark 源码编译

环境准备与起因

由于线上Spark On Yarn Spark Streaming程序在消费kafka 写入HDFS table 使用Partition by 和 Savemode.append,在一定条件下导致写入HDFS 超过了处理批次。经过排查应该与 Spark 写入parquet 文件追加时候元数据检查所导致，修改源码后需要对其进行编译。

参考Spark的官方文档

根据Spark官方文档编译模块的介绍（http://spark.apache.org/docs/2.1.1/building-spark.html）的介绍：

环境：centos/ubuntu

软件准备：

spark-2.2.1.tgz源码

jdk-8u144-linux-x64.tar.gz   JDK1.8以上  

apache-maven-3.5.0-bin.tar.gz

scala-2.11.8.tgz

hadoop-2.7.3.tar.gz

注意点

yum -y install git

环境变量更改maven 默认内存

 export MAVEN_OPTS="-Xmx2g -XX:ReservedCodeCacheSize=512m"（官网建议）

pom.xml

修改pom.xml 中属于自己使用的一些hadoop 版本，zookeeper 版本等信息

编译

手动自定义编译

# Apache Hadoop 2.7.X and later（指定hadoop版本）

mvn -Pyarn -Phadoop-2.7 -Dhadoop.version=2.7.3 -DskipTests clean package

# With Hive 1.2.1 support（指定hive的版本）

mvn -Pyarn -Phive -Phive-thriftserver -DskipTests clean package

指定scala版本

./dev/change-scala-version.sh 2.10

mvn -Pyarn -Dscala-2.10 -DskipTests clean package

由于我们生产上的CDH的版本如下： hadoop-2.7.3.tar.gz

mvn -Pyarn -Phive -Phive-thriftserver -Phadoop-2.7 -Dhadoop.version=2.7.3 -DskipTests clean package  （采用这种方式编译出来的不是tar.gz的格式）

官方脚本编译

./dev/make-distribution.sh --name 2.7.3   --tgz   -Phadoop-2.7 -Dhadoop.version=2.7.3 -Phive -Phive-thriftserver  -Pyarn   （这种方法编译出来的就是tgz形式，但是速度不快）

注意事项：

官方脚本自带一些环境变量检查，会导致编译检查耗时，直接强制修改make-distribution.sh脚本

1.将VERSION ，SCALA_VERSION ，SPARK_HADOOP_VERSION ，SPARK_HIVE 注释掉，直接写上自己的版本

#VERSION=$("$MVN" help:evaluate -Dexpression=project.version $@ 2>/dev/null | grep -v "INFO" | tail -n 1)        指的是spark2.1.1这个版本

#SCALA_VERSION=$("$MVN" help:evaluate -Dexpression=scala.binary.version $@ 2>/dev/null\    指的是scala 2.11

#    | grep -v "INFO"\

#    | tail -n 1)

#SPARK_HADOOP_VERSION=$("$MVN" help:evaluate -Dexpression=hadoop.version $@ 2>/dev/null\  指的是hadoop.version=2.7.3

#    | grep -v "INFO"\

#    | tail -n 1)

#SPARK_HIVE=$("$MVN" help:evaluate -Dexpression=project.activeProfiles -pl sql/hive $@ 2>/dev/null\    SPARK_HIVE为1表示支持

#    | grep -v "INFO"\

#    | fgrep --count "<id>hive</id>";\

#    # Reset exit status to 0, otherwise the script stops here if the last grep finds nothing\

#    # because we use "set -o pipefail"

#    echo -n)

将以下的内容贴在注释掉的那个脚本的后面即可

VERSION=2.1.1

SCALA_VERSION=2.11

SPARK_HADOOP_VERSION=2.7.3

SPARK_HIVE=1

if [ "$MAKE_TGZ" == "true" ]; then

TARDIR_NAME=spark-$VERSION-bin-$NAME #打包的文件名spark-2.1.1-bin-2.7.3

TARDIR="$SPARK_HOME/$TARDIR_NAME"     

rm -rf "$TARDIR"

cp -r "$DISTDIR" "$TARDIR"

tar czf "spark-$VERSION-bin-$NAME.tgz" -C "$SPARK_HOME" "$TARDIR_NAME"

rm -rf "$TARDIR"

fi

编译完成

编译完成后包在Spark src 主目录下，

Spark 2.1.1 源码编译的更多相关文章

基于cdh5.10.x hadoop版本的apache源码编译安装spark
参考文档:http://spark.apache.org/docs/1.6.0/building-spark.html spark安装需要选择源码编译方式进行安装部署,cdh5.10.0提供默认的二进 ...
Apache Spark源码走读之9 -- Spark源码编译
欢迎转载,转载请注明出处,徽沪一郎. 概要本来源码编译没有什么可说的,对于java项目来说,只要会点maven或ant的简单命令,依葫芦画瓢,一下子就ok了.但到了Spark上面,事情似乎不这么简单 ...
Spark源码编译
原创文章,转载请注明: 转载自http://www.cnblogs.com/tovin/p/3822995.html spark源码编译步骤如下: cd /home/hdpusr/workspace ...
Spark环境搭建（六）-----------sprk源码编译
想要搭建自己的Hadoop和spark集群,尤其是在生产环境中,下载官网提供的安装包远远不够的,必须要自己源码编译spark才行. 环境准备: 1,Maven环境搭建,版本Apache Maven 3 ...
Spark记录-源码编译spark2.2.0（结合Hive on Spark/Hive on MR2/Spark on Yarn）
#spark2.2.0源码编译 #组件:mvn-3.3.9 jdk-1.8 #wget http://mirror.bit.edu.cn/apache/spark/spark-2.2.0/spark- ...
spark源码编译记录
spark在项目中已经用了一段时间了,趁现在空闲,下个源码编译在IDEA里面阅读下,特此记录过程. 前提已经安装maven和git 1.上官网下载源码的包: 2.然后解压到一个文件夹 3.编译,编译的 ...
1、Spark 2.1 源码编译支持CDH
目前CDH支持的spark版本都是1.x, 如果想要使用spark 2x的版本, 只能编译spark源码生成支持CDH的版本. 一.准备工作找一台Linux主机, 由于spark源码编译会下载很多的 ...
Scala 深入浅出实战经典第61讲：Scala中隐式参数与隐式转换的联合使用实战详解及其在Spark中的应用源码解析
王家林亲授<DT大数据梦工厂>大数据实战视频 Scala 深入浅出实战经典(1-87讲)完整视频.PPT.代码下载: 百度云盘:http://pan.baidu.com/s/1c0noOt ...
Scala 深入浅出实战经典第60讲：Scala中隐式参数实战详解以及在Spark中的应用源码解析
王家林亲授<DT大数据梦工厂>大数据实战视频 Scala 深入浅出实战经典(1-87讲)完整视频.PPT.代码下载:百度云盘:http://pan.baidu.com/s/1c0noOt6 ...

随机推荐

python-day8(正式学习)
目录列表类型内置方法常用操作+内置方法优先掌握(***) 需要掌握(**) 存一个值or多个值有序or无序可变or不可变元组类型内置方法定义常用操作+内置方法优先掌握一个值or多个 ...
tf-图像预处理
tensorflow 中自带了很多图像处理的方法,基本都在 tf.image 模块中,虽然不如 opencv 强大,但也比较常用,这里做个记录. 图像编解码 1. 用 tf 的方法读取图片后,都需要进 ...
Linux的环境变量.bash_profile .bashrc profile文件
Shell变量有局部变量.环境变量之分.局部变量就是指在某个Shell中生效的变量,只在此次登录中有效.环境变量通常又称“全局变量”,虽然在Shell中变量默认就是全局的,但是为了让子Shall继承当 ...
sqlserver2008 必知必会技巧-- 快速索引对象
对象资源管理器里面 -- 数据库 -- 表目录 ,然后按 f7 弹出对象资源管理详细信息 , 里面有搜索栏 , 可以使用 % 进行模糊查询例如我们查包含 student的表 %student% ...
vue.js（2）--v-cloak v-text v-html
v-cloak v-text v-html的使用 (1)实例 <!DOCTYPE html> <html lang="en"> <head> ...
ubuntu apache https设置
上篇文章已经描述过怎么生成证书,点击这里,直接写怎么设置 1.apache加载ssl模块, # a2enmod ssl 2.启动ssl站点 #a2ensite default-ssl 3.加入监听端口 ...
ansible获取远程机器上的ip地址
问题: 想要使用ansible-playbook脚本创建一个以远程机器的IP命名的目录错误的代码:# vim test.yml --- - hosts: all remote_user: root ...
Django的MTV模型
MTV模型 Django框架的设计模式借鉴了MVC框架的思想,也是分成三部分,来降低各个部分之间的耦合性. MTV框架是Django的框架,三部分为: Model Template(模板) View ...
GitHub源码攻击事件
黑客擦除了微软多达392个代码存储库,并提出勒索要求.此前,黑客攻击了包含微软在内的大批受害者的Git存储库,删除了所有源代码和最近提交的内容,并留下了支持比特币支付的赎金票据. 勒索信息如下: “要 ...
Codeforces 909 substr用法思维合并线段目标最少 Py语句逆推DP vecrtor缩点删不同颜色点模拟拓扑排序处理任务
A str.substr(i,j) 从str[i]开始起取j个字符作为返回的字符串 /* Huyyt */ #include <bits/stdc++.h> using namespace ...

Spark 2.1.1 源码编译

Spark 2.1.1 源码编译

Spark 源码编译

环境准备与起因

注意点

pom.xml

编译

手动自定义编译

官方脚本编译

注意事项：

编译完成

Spark 2.1.1 源码编译的更多相关文章

随机推荐

热门专题