1 系统环境

Ubuntu 15.10, Java 1.7, Hadoop 2.6.0 HA, Spark-1.4.0

三台机器

spark-1423-0001: Master, Worker

spark-1423-0002: Master, Worker

spark-1423-0003: Worker

2 tachyon下载地址

源码:https://github.com/Alluxio/alluxio

可执行文件:https://github.com/Alluxio/alluxio/releases

我下载的是0.7.0:https://github.com/amplab/tachyon/archive/v0.7.0.zip

自己用Maven编译,当然也可以使用官网编译好的。

mvn -Dhadoop.version=2.6. clean package -DskipTests=true

因为Spark-1.4.0中已经集成了Tachyon(0.6.*),所以这里使用Tachyon-0.7.0是没有问题的。

3 修改配置文件

下面的配置都是在spark-1423-001上进行的。

3.1 修改tachyon-env.sh

export JAVA_HOME=/usr/lib/jvm/java-1.7.0-openjdk-amd64

if [[ `uname -a` == Darwin* ]]; then
# Assuming Mac OS X
export JAVA_HOME=${JAVA_HOME:-$(/usr/libexec/java_home)}
export TACHYON_RAM_FOLDER=/Volumes/ramdisk
export TACHYON_JAVA_OPTS="-Djava.security.krb5.realm= -Djava.security.krb5.kdc="
else
# Assuming Linux
if [ -z "$JAVA_HOME" ]; then
if [ -d /usr/lib/jvm/java--oracle ]; then
export JAVA_HOME=/usr/lib/jvm/java--oracle
else
# openjdk will set this
if [ -d /usr/lib/jvm/jre-1.7. ]; then
export JAVA_HOME=/usr/lib/jvm/jre-1.7.
fi
fi
fi
export TACHYON_RAM_FOLDER=/mnt/ramdisk
fi if [ -z "$JAVA_HOME" ]; then
export JAVA_HOME="$(dirname $(which java))/.."
fi export JAVA="$JAVA_HOME/bin/java"
export TACHYON_MASTER_ADDRESS=spark-1423-0001
export TACHYON_UNDERFS_ADDRESS=hdfs://hadoop-cluster
#export TACHYON_UNDERFS_ADDRESS=hdfs://localhost:9000
export TACHYON_WORKER_MEMORY_SIZE=10GB
export TACHYON_UNDERFS_HDFS_IMPL=org.apache.hadoop.hdfs.DistributedFileSystem
export TACHYON_WORKER_MAX_WORKER_THREADS=
export TACHYON_MASTER_MAX_WORKER_THREADS= export TACHYON_SSH_FOREGROUND="yes"
export TACHYON_WORKER_SLEEP="0.02" # Prepend Tachyon classes before classes specified by TACHYON_CLASSPATH
# in the Java classpath. May be necessary if there are jar conflicts
#export TACHYON_PREPEND_TACHYON_CLASSES="yes" # Where log files are stored. $TACHYON_HOME/logs by default.
#export TACHYON_LOGS_DIR=$TACHYON_HOME/logs CONF_DIR="$( cd "$( dirname "${BASH_SOURCE[0]}" )" && pwd )" export TACHYON_JAVA_OPTS+="
-Dlog4j.configuration=file:$CONF_DIR/log4j.properties
-Dtachyon.debug=false
-Dtachyon.worker.tieredstore.level.max=1
-Dtachyon.worker.tieredstore.level0.alias=MEM
-Dtachyon.worker.tieredstore.level0.dirs.path=$TACHYON_RAM_FOLDER
-Dtachyon.worker.tieredstore.level0.dirs.quota=$TACHYON_WORKER_MEMORY_SIZE
-Dtachyon.underfs.address=$TACHYON_UNDERFS_ADDRESS
-Dtachyon.underfs.hdfs.impl=$TACHYON_UNDERFS_HDFS_IMPL
-Dtachyon.data.folder=$TACHYON_UNDERFS_ADDRESS/tmp/tachyon/data
-Dtachyon.worker.max.worker.threads=$TACHYON_WORKER_MAX_WORKER_THREADS
-Dtachyon.workers.folder=$TACHYON_UNDERFS_ADDRESS/tmp/tachyon/workers
-Dtachyon.worker.memory.size=$TACHYON_WORKER_MEMORY_SIZE
-Dtachyon.worker.data.folder=/tachyonworker/
-Dtachyon.master.max.worker.threads=$TACHYON_MASTER_MAX_WORKER_THREADS
-Dtachyon.master.worker.timeout.ms=60000
-Dtachyon.master.hostname=$TACHYON_MASTER_ADDRESS
-Dtachyon.master.journal.folder=$TACHYON_UNDERFS_ADDRESS/tachyon/journal/
-Dorg.apache.jasper.compiler.disablejsr199=true
-Djava.net.preferIPv4Stack=true
-Dtachyon.usezookeeper=true
-Dtachyon.zookeeper.address=spark-1421-0000:2181,spark-1421-0003:2181,spark-1421-0004:2181,spark-1421-0005:2181,spark-1421-0006:2181
" # Master specific parameters. Default to TACHYON_JAVA_OPTS.
export TACHYON_MASTER_JAVA_OPTS="$TACHYON_JAVA_OPTS" # Worker specific parameters that will be shared to all workers. Default to TACHYON_JAVA_OPTS.
export TACHYON_WORKER_JAVA_OPTS="$TACHYON_JAVA_OPTS"

这里需要设置Master IP,Hadoop 地址,我这里Hadoop是高可用的

3.2 修改Worker

spark-1423-0001

spark-1423-0002

spark-1423-0003

配置完成之后,将Tachyon分发到Spark-1421-0002,spark-1423-0003,同时修改spark-1423-0002 tachyon-env.sh中的MasterIP,其他不变

4 系统启动

下面的操作都是在spark-1423-0001上进行的,首次启动前需要格式化

tachyon format

然后启动

tachyon-start.sh all SudoMount

启动Tachyon有了更多的选项:

l./tachyon-start.sh all Mount在启动前自动挂载TachyonWorker所使用的RamFS,然后启动TachyonMaster和所有TachyonWorker。由于直接使用mount命令,所以需要用户为root;

l./tachyon-start.sh all SudoMount在启动前自动挂载TachyonWorker所使用的RamFS,然后启动TachyonMaster和所有TachyonWorker。由于使用sudo mount命令,所以需要用户有sudo权限;

l./tachyon-start.sh all NoMount认为RamFS已经挂载好,不执行挂载操作,只启动TachyonMaster和所有TachyonWorker

因此,如果不想每次启动Tachyon都挂载一次RamFS,可以先使用命令./tachyon-mount.sh Mount workers 或./tachyon-mount.sh SudoMount workers挂载好所有RamFS,然后使用./tachyon-start.sh all NoMount 命令启动Tachyon。

单机和集群式模式的区别就在于节点配置和启动步骤,事实上,也可以在集群模式下只设置一个TachyonWorker,此时就成为伪分布模式。

因为Tachyon设置了高可用,那么在spark-1423-002上需要启动Master

./tachyon-start.sh master

启动之后可以在:http://spark-1423-0001:19999上面看到Tachyon的启动情况

为了验证高可用,可以将spark-1423-0001中的Master进程杀死,系统会自行进行切换,大概需要花15秒

5 Spark on Tachyon

5.1 首先需要在SPARK_HOME/conf中新建core-site.xml,内容如下:

<configuration>
<property>
<name>fs.tachyon-ft.impl</name>
<value>tachyon.hadoop.TFSFT</value>
</property>
</configuration>

5.2 修改spark_env.conf,添加如下内容:

export SPARK_JAVA_OPTS="
-Dtachyon.zookeeper.address=spark--:,spark--:,spark--:,spark--:,spark--:
-Dtachyon.usezookeeper=true
$SPARK_JAVA_OPTS"

5.3 spark-shell中测试:

val s = sc.textFile("tachyon-ft://spark-1423-0001:19999/X")
s.count()
s.saveAsTextFile("tachyon-ft://spark-1423-0002:19999/Y")

这里需要注意一点,Tachyon读取文件的顺序是先从本机内存中读取,如果本机内存中没有,Tachyon会从集群中其他Worker节点中寻找,如果集群中Worker节点内存中也没有,那么Tachyon会从UnderFS中寻找,例如HDFS中。

在使用Spark-shell测试时,如果是用的Local模式,那么tachyon-ft://spark-1423-0002:19998 只能读取本机内存中的数据,Tachyon集群其他节点中内存的数据都读不到,HDFS中的数据也是读不到。

6 参考文献

http://www.cnblogs.com/shishanyuan/p/4775400.html

http://www.sxt.cn/u/756/blog/5410

http://www.tachyonproject.org/documentation/v0.7.1/Running-Spark-on-Tachyon.html

Ubuntu 15.10 下Tachyon安装的更多相关文章

  1. Ubuntu 15.10下droidbox安装使用

    DroidBox是一个动态分析Android代码的的分析工具.其目前的安装环境为:Linux/Unix/MacOSX 下面是安装步骤 一. 安装Android SDK 并添加环境变量 export P ...

  2. Ubuntu 15.10 下Redis Cluster使用

    1 Redis Standalone安装 可以参考这篇博文:http://www.cnblogs.com/_popc/p/3684835.html 2 Redis Cluster安装 2.1 环境介绍 ...

  3. Ubuntu 14.10 下DokuWiki安装

    环境说明: Ubuntu 14.10 64位 1 下载DokuWiki:http://download.dokuwiki.org/ 2 解压到 /var/www/html下面 3 如果没有安装Apac ...

  4. Ubuntu 15.10下Qt5的安装实战

    写照篇博客的目的就是因为最近要使用Qt,但是由于本人的系统是Ubuntu的,而网上大部分的讲解全是基于Windows的,所以就花费一些时间总结了一下我的安装过程,当然也是也为了能帮助到更多的博友. 第 ...

  5. Ubuntu 15.10下的WebStorm-11.0.3完美破解

    由于最新的JetBrains 发布了最新版本的IntelliJ IDEA的各个版本,而且更换了注册机的使用方式,这就导致了之前对WebStorm的破解方法不能在使用了.所以我们就必须另寻他法咯.如题, ...

  6. Ubuntu 15.10 下Scala 操作Redis Cluster

    1 前言 Redis Standalone,Redis Cluster的安装在前面介绍过,地址:http://www.cnblogs.com/liuchangchun/p/5063477.html,这 ...

  7. Ubuntu 14.10 下Eclipse安装Hadoop插件

    准备环境 1 安装好了Hadoop,之前安装了Hadoop 2.5.0,安装参考http://www.cnblogs.com/liuchangchun/p/4097286.html 2 安装Eclip ...

  8. Ubuntu 15.04 下apt-get安装JDK

    [From] http://blog.csdn.net/skykingf/article/details/45250017 1.删除自带的OpenJDK [python] view plain cop ...

  9. 求助下 Ubuntu 15.10(64 位)下安装 pyspider 下的问题 - V2EX

    https://www.v2ex.com/t/279405 求助下 Ubuntu 15.10(64 位)下安装 pyspider 下的问题 - V2EX pip 更新到最新 sudo apt inst ...

随机推荐

  1. tuxedo 提供buildserver命令编译服务器进程

    转自:http://blog.sina.com.cn/s/blog_5413cc0f0100nbgc.html 事实上buildserver只完成预编译,它会调用当前操作系统中已经安装的默认C编译器来 ...

  2. Spring在项目中需要的配置

    要想了解Spring,首先要了解三层架构.....自行百度. 1.Spring相关概念: 少数jar+某一个功能的配置文件 Spring容器(轻量级):帮我们管理业务逻辑层,有很多业务逻辑对象,需要对 ...

  3. 剑指Offer 60. 把二叉树打印成多行 (二叉树)

    题目描述 从上到下按层打印二叉树,同一层结点从左至右输出.每一层输出一行. 题目地址 https://www.nowcoder.com/practice/445c44d982d04483b04a54f ...

  4. 201771010141 周强 面向对象程序设计(Java)第12周作业

    实验十二  图形程序设计 实验时间 2018-11-14 1.实验目的与要求 (1) 掌握Java GUI中框架创建及属性设置中常用类的API: (2) 掌握Java GUI中2D图形绘制常用类的AP ...

  5. 运动控制之一_PID控制理论

    PID算法是早期发展起来的控制算法,该算法因其简单.鲁棒性强且可靠性高而被广泛地应用于过程控制和运动控制中. 常规的PID控制系统原理框图如下所示: PID控制系统原理图 误差信号Err(t)输入到控 ...

  6. Python中使用多进程来实现并行处理的方法小结

    进程和线程是计算机软件领域里很重要的概念,进程和线程有区别,也有着密切的联系,先来辨析一下这两个概念: 1.定义 进程是具有一定独立功能的程序关于某个数据集合上的一次运行活动,进程是系统进行资源分配和 ...

  7. 常用git操作命令

     查看远程仓库 ->$ git remote -v    如果你本地有一个项目,想把他放到远程git服务器上,那就用上面的命令把项目 add 到远程服务器 ->$ git remote a ...

  8. React生命周期简单详细理解

    前言 学习React,生命周期很重要,我们了解完生命周期的各个组件,对写高性能组件会有很大的帮助. Ract生命周期 React 生命周期分为三种状态 1. 初始化 2.更新 3.销毁 初始化 1.g ...

  9. flask中需要的基本配置信息

    1.秘钥设置: app.secret_key = '随意设置' 2.SQLALCHEMY配置: # 连接数据库 app.config['SQLALCHEMY_DATABASE_URI'] = 'mys ...

  10. python爬虫之常见的加密方式

    前言 数据加密与解密通常是为了保证数据在传输过程中的安全性,自古以来就一直存在,古代主要应用在战争领域,战争中会有很多情报信息要传递,这些重要的信息都会经过加密,在发送到对应的人手上. 现代 ,在网络 ...