本文详细描述如何在archlinux上搭建twitter storm cluster,转载请注明出处,谢谢。

有关archlinux基本系统安装,请参照archlinux简明安装指南一文,下面以上述为基础讲解如何一步步安装twitter storm cluster.

先列出安装主要步骤

  1. 安装oracle jdk
  2. 安装必须的编译工具gcc, g++, make
  3. 安装python2.7, unzip
  4. 编译安装zeromq
  5. 编译安装jzmq
  6. 下载lein
  7. 下载storm-starter
  8. 下载storm release版本
  9. 安装zookeeper为了自动运行storm cluster,安装supervisord

安装oracle jdk

在linux平台上标配的java是openjdk,如果要安装oracle的jdk的话,需要从官方下载相应的安装包。使用archlinux幸福的一点就是有yaourt,一切可以变得非常简单,:).

#yaourt -S jdk

注意安装完的java路径,应该是在/opt/java, 这个后面会用到。

修改/etc/profile, 添加环境变量JAVA_HOME,为PATH添加/opt/java/bin

PATH="/usr/local/sbin:/usr/local/bin:/usr/bin:/opt/java/bin"
export PATH
export JAVA_HOME="/opt/java"

安装编译工具

在twitter storm中会使用zeromq,因为zeromq是用c&c++编写的,所以需要安装相应的编译工具,不要使用archlinux中的版本,因为目前pacman或aur中的zeromq版本是3.x,而twitter storm中需要的zeromq是2.1.7

#pacman -S gcc g++ libtool pkg-config make autoconf git util-linux

安装python2.7, unzip

#pacman -S python2 unzip 

编译安装zeromq,jzmq

从 http://download.zeromq.org/zeromq-2.1.7.tar.gz下载zeromq 2.1.7

#tar zvxf zeromq-2.1..tar.gz
#config
#make
#make install

安装的路径是/usr/local/lib

编译安装jzmq

#git clone https://github.com/nathanmarz/jzmq.git
#cd jzmq
#./autogen.sh
#./configure --with-zeromq=/usr/local
#make 注意,此处可能会出错,解决办法是修改jzmq/src/Makefile.am,将classdist_noinst.stamp修改为classnoinst.stamp
#make install

安装完zeromq和jzmq之后,修改/etc/ld.so.conf,在该文件中添加如下一行

/usr/local/lib

然后运行

#ldconfig 

为了验证libjzmq确实使用的zeromq是自行编译的版本,可使用如下命令进行检测。

#ldd /usr/local/lib/libjzmq.so
linux-gate.so. (0xb779e000)
libzmq.so.1 => /usr/local/lib/libzmq.so.1 (0xb7749000)
libuuid.so. => /usr/lib/libuuid.so. (0xb7743000)
librt.so. => /usr/lib/librt.so. (0xb773a000)
libpthread.so. => /usr/lib/libpthread.so. (0xb771e000)
libstdc++.so. => /usr/lib/libstdc++.so. (0xb7635000)
libm.so. => /usr/lib/libm.so. (0xb75ee000)
libc.so. => /usr/lib/libc.so. (0xb743e000)
libgcc_s.so. => /usr/lib/libgcc_s.so. (0xb7422000)
/usr/lib/ld-linux.so. (0xb779f000)

如果libzmq.so.1确实指向/usr/local/lib中的版本,则说明版本使用正确。

安装storm-starter

storm-starter是由storm的作者为了storm的初学者快速上手而创建的一个github项目。

#git clone https://github.com/nathanmarz/storm-starter.git

编译运行, 注意这是运行在local模式而非常cluster模式

#lein deps
#lein compile
#java -cp $(lein classpath) storm.starter.ExclamationTopology

注:

    直接从http://leiningen.org/下载lein script,而非直接使用pacman或yaourt来安装

#chmod +x ./lein
#cp ./lein /usr/local/bin
#export LEIN_ROOT=1 如果想以root来运行lein,需要设置该变量  

安装zookeeper

#yaourt -S zookeeper

作简单的配置,修改文件/etc/zookeeper/zoo.cfg,使其内容如下所示

#The number of milliseconds of each tick
tickTime=2000
# The number of ticks that the initial
# synchronization phase can take
initLimit=10
# The number of ticks that can pass between
# sending a request and getting an acknowledgement
syncLimit=5
# the directory where the snapshot is stored.
# do not use /tmp for storage, /tmp here is just
# example sakes.
dataDir=/var/lib/zookeeper
# the port at which the clients will connect
clientPort=2181

因为zookeeper只对IPv6地址进行监听,为了强制其只监听IPv4地址,需要修改/opt/zookeeper-3.4.5/bin/zkServer.sh,在start)一节中加入 "-Djava.net.preferIPv4Stack=true", 整体看起来如下所示

case $ in
start)
echo -n "Starting zookeeper ... "
if [ -f $ZOOPIDFILE ]; then
if kill - `cat $ZOOPIDFILE` > /dev/null >&; then
echo $command already running as process `cat $ZOOPIDFILE`.
exit
fi
fi
nohup $JAVA "-Dzookeeper.log.dir=${ZOO_LOG_DIR}" "-Dzookeeper.root.logger=${ZOO_LOG4J_PROP}" \
"-Djava.net.preferIPv4Stack=true" \
-cp "$CLASSPATH" $JVMFLAGS $ZOOMAIN "$ZOOCFG" > "$_ZOO_DAEMON_OUT" >& < /dev/null &
if [ $? -eq ]
then
if /bin/echo -n $! > "$ZOOPIDFILE"
then
sleep
echo STARTED
else
echo FAILED TO WRITE PID
exit
fi
else
echo SERVER DID NOT START
exit
fi
;;

注意蓝底红字的一行。

启动zookeeper

#/opt/zookeeper-3.4./bin/zkServer.sh start 

下载安装storm

从storm-project.net下载storm-0.8.2,将其解压到/opt目录下

#unzip storm-0.8..zip

修改/opt/storm-0.8.2/conf/storm.yaml, 文件内容如下

########### These MUST be filled in for a storm configuration
storm.zookeeper.servers:
- "localhost"
# - "server2"
#
nimbus.host: "localhost"
#
#
# ##### These may optionally be filled in:
#
## List of custom serializations
# topology.kryo.register:
# - org.mycompany.MyType
# - org.mycompany.MyType2: org.mycompany.MyType2Serializer
#
## List of custom kryo decorators
# topology.kryo.decorators:
# - org.mycompany.MyDecorator
#
## Locations of the drpc servers
# drpc.servers:
# - "server1"
# - "server2" ## Metrics Consumers
# topology.metrics.consumer.register:
# - class: "backtype.storm.metrics.LoggingMetricsConsumer"
# parallelism.hint: 1
# - class: "org.mycompany.MyMetricsConsumer"
# parallelism.hint: 1
# argument:
# - endpoint: "metrics-collector.mycompany.org"
java.library.path: "/usr/local/lib:/usr/local/share/java"
supervisor.slots.ports:
- 6700
- 6701

注意:

  yaml要求配置项必须以空格打头

修改storm脚本,将#!/usr/bin/python改为#!/usr/bin/python2, /usr/bin/python是指向python3的所以需要显示将其改为python2

准备运行cluster模式了

#/opt/storm-0.8./bin/storm nimbus
#/opt/storm-0.8./bin/storm supervisor
#/opt/storm-0.8./bin/storm ui

上述每条指令需要单独运行在一个终端,如果ui启动成功,可以使用浏览器来访问localhost:8080查看整个cluster的状况了。

部署Topology到cluster

#./storm jar $HOME/working/storm-starter/target/storm-starter-0.0.-SNAPSHOT-standalone.jar storm.starter.ExclamationTopology exclamationTopology

一切顺利的话,应该可以看到类似的输出

0    [main] INFO  backtype.storm.StormSubmitter  - Jar not uploaded to master yet. Submitting jar...
91 [main] INFO backtype.storm.StormSubmitter - Uploading topology jar /root/working/storm-starter/target/storm-starter-0.0.1-SNAPSHOT-standalone.jar to assigned location: storm-local/nimbus/inbox/stormjar-c73d28f0-68fc-4e6e-98b5-c4d1355aa94f.jar
667 [main] INFO backtype.storm.StormSubmitter - Successfully uploaded topology jar to assigned location: storm-local/nimbus/inbox/stormjar-c73d28f0-68fc-4e6e-98b5-c4d1355aa94f.jar
670 [main] INFO backtype.storm.StormSubmitter - Submitting topology exclamationTopology in distributed mode with conf {"topology.workers":3,"topology.debug":true}
2449 [main] INFO backtype.storm.StormSubmitter - Finished submitting topology: exclamationTopology

自动化运行storm cluster

每次都要手工启动storm cluster并不是一件很令人愉快的事,最好是能自动启动。解决办法总是有的,使用python supervisor即可。

#pacman -S supervisor
#mkdir -p /var/log/storm

修改supervisor配置文件,在文件最后添加如下内容

[program:storm-nimbus]
environment=JAVA_HOME=/opt/java, PATH="/usr/sbin:/usr/bin:/usr/local/bin:/opt/java/bin"
command=/opt/storm-0.8.2/bin/storm nimbus
;;user=storm
autostart=true
autorestart=true
startsecs=10
startretries=999
log_stdout=true
log_stderr=true
logfile=/var/log/storm/nimbus.out
logfile_maxbytes=20MB
logfile_backups=10 [program:storm-supervisor]
environment=JAVA_HOME=/opt/java, PATH="/usr/sbin:/usr/bin:/usr/local/bin:/opt/java/bin"
command=/opt/storm-0.8.2/bin/storm supervisor
;;user=storm
autostart=true
autorestart=true
startsecs=10
startretries=999
log_stdout=true
log_stderr=true
logfile=/var/log/storm/supervisor.out
logfile_maxbytes=20MB
logfile_backups=10

注:

    在上述配置中显示加入了environment一行,主要是为了解决可执行文件搜索路径的问题,否则会报错说无法找到java可执行程序因其不在标准路径/usr/bin, /usr/sbin, /usr/local/bin, /usr/local/sbin中。

启动supervisord

#systemctl start supervisord

想开机自动运行supervisord的话,执行如下指令

#systemctl enable supervisord

参考资料

  1. Running a Multi-Node Storm Cluster http://www.michael-noll.com/tutorials/running-multi-node-storm-cluster/

在archlinux上搭建twitter storm cluster的更多相关文章

  1. 【原】storm源码之mac os x编译twitter storm源码

    twitter storm是由backtype公司创始人nathanmarz一手研发和开源的流计算(实时计算)框架,堪称实时计算领域的hadoop.nathanmarz也是在mac os x环境下开发 ...

  2. 【转】Twitter Storm: 在生产集群上运行topology

    Twitter Storm: 在生产集群上运行topology 发表于 2011 年 10 月 07 日 由 xumingming 作者: xumingming | 可以转载, 但必须以超链接形式标明 ...

  3. 在CentOS上搭建Storm集群

    Here's a summary of the steps for setting up a Storm cluster: Set up a Zookeeper clusterInstall depe ...

  4. STORM_0002_在做好的zookeeper集群上搭建storm的开发环境

    参考文献http://www.cnblogs.com/panfeng412/archive/2012/11/30/how-to-install-and-deploy-storm-cluster.htm ...

  5. Kafka实战-Storm Cluster

    1.概述 在<Kafka实战-实时日志统计流程>一文中,谈到了Storm的相关问题,在完成实时日志统计时,我们需要用到Storm去消费Kafka Cluster中的数据,所以,这里我单独给 ...

  6. Twitter Storm 安装实战

    实际上安装Twitter Storm是上周三的事情了,周三的时候安装了一个单机版的,用WordCount跑了一下,感觉还不错.周四试着在集群上安装,碰到了一些问题,一直折腾到周五,留了个尾巴(没有做测 ...

  7. Twitter Storm源代码分析之ZooKeeper中的目录结构

    徐明明博客:Twitter Storm源代码分析之ZooKeeper中的目录结构 我们知道Twitter Storm的所有的状态信息都是保存在Zookeeper里面,nimbus通过在zookeepe ...

  8. twitter storm源码走读之1 -- nimbus启动场景分析

    欢迎转载,转载时请注明作者徽沪一郎及出处,谢谢. 本文详细介绍了twitter storm中的nimbus节点的启动场景,分析nimbus是如何一步步实现定义于storm.thrift中的servic ...

  9. [转载] 使用 Twitter Storm 处理实时的大数据

    转载自http://www.ibm.com/developerworks/cn/opensource/os-twitterstorm/ 流式处理大数据简介 Storm 是一个开源的.大数据处理系统,与 ...

随机推荐

  1. context switches per second 上下文切换

    上下文切换对系统来说意味着消耗大量的CPU时间.上下文切换只发生在内核态中.内核态是CPU的一种有特权的模式,在这种模式下只有内核运行并且可以访问所有内存和其它系统资源.

  2. FZU 2183 字符串处理

    Problem Description 现在有一些被简单压缩的字符串,例如:a[120]代表120个a.对于字符串acb[3]d[5]e相对于acbbbddddde 现在给你两个字符串cString, ...

  3. poj 2378(树形dp)

    题目链接:http://poj.org/problem?id=2378 思路:num[u]表示以u为根的子树的顶点个数(包括),如果去掉u之后u的每棵子树都小于等于n/2,则选择u. #include ...

  4. 用JAXP的dom方式解析XML文件

    用JAXP的dom方式解析XML文件,实现增删改查操作 dom方式解析XML原理 XML文件 <?xml version="1.0" encoding="UTF-8 ...

  5. Hark的数据结构与算法练习之堆排序

    前言 堆排序我是看了好半天别人的博客才有了理解,然后又费了九牛二虎之力才把代码写出来,我发现我的基础真的很差劲啊……不过自己选的路一定要坚持走下去.我试着把我的理解描述出来,如有不妥之处希望大家可以指 ...

  6. xcode命令行编译时:codesign命令,抛出“User interaction is not allowed.”异常 的处理

    之前正常运行的hudson iOS编译服务器slave节点,忽然出现编译失败.发现原因有2个: 第一个原因是编译机上用来签名的用户帐号过期,第二个原因是操作系统和xCode升级造成的. 对于第一个,重 ...

  7. SU Demos-02Filtering-05Suk1k2filter

    本人数学不咋地,本demo也是一知半解,敬请谅解. 这是生成的脉冲数据

  8. robotium 新建 android 测试项目:

    注意:新建项目后再运行前一定要修改Manifest文件中的instrumentation 中的target package, 这个是测试的入口 1. 程序开始要通知系统我要测的app是什么 如何知道a ...

  9. 不通过App Store,在iOS设备上直接安装应用程序(转)

    今天在iOS设备上安装天翼云存储app,在safari上直接打开http://cloud.189.cn/wap/index.jsp,点击“点击免费安装”,如下图: 神奇的事情发生了,设备上直接下载ap ...

  10. 1^b+2^b+3^b+...+n^b数列

    首先,这是我自己推出来的,O(n^2),常数巨大.所以无能为力优化!所以求此数列的公式!求优化!!! 主要思想:要算b次的,那么就要先算b+1次的. 首先,我用F(i, j)表示杨辉三角第i层第j个, ...