《OD学Oozie》20160807Oozie
一、引入
MapReduce Job
Hive 脚本任务
同一个业务:先后、定时调度
工作流: 定义工作流程
activity
jbpm
oozie: 大数据工作流定义与调度框架
专门定义与调度MapReduce Job工作流程
拓展:shell、hive、sqoop、hdfs
oozie演变过程:
v1 Workflow 工作流定义
v2 Coordinator 调度
基于时间、基于数据集是否可用
v3 bundle 将某些相关的Cordinator集成在一块
调度批量执行
案例:
nginx收集日志,每天进行分割(一天一个文件) ---> shell
每天分割出来的日志文件,上传到hdfs上 ---> shell/flume
mapreduce job数据清洗/ hive udf udts进行数据清洗
hive hsql 进行业务上的统计分析 pv uv 会话
sqoop导出到mysql里面
定义
start
两类节点:
控制流程节点:
decision选择节点
fork
join
顺序
action节点:
MapReduce action
shell
hive
sqoop
Oozie执行workflow:底层是MapReduce去执行Workflow
工作流引擎:MapReduce
启动一个workflow实例,运行工作流中任务,通过Mapreduce来执行
二、安装部署
1. 下载
2. 解压安装
1)
2)tar -zxvf oozie-hadooplibs-4.0.0-cdh5.3.6.tar.gz -C ../
3)创建目录libext
/opt/modules/cdh/oozie-4.0.0-cdh5.3.6/libext
cp /opt/modules/cdh/oozie-4.0.0-cdh5.3.6/hadooplibs/hadooplib-2.5.0-cdh5.3.6.oozie-4.0.0-cdh5.3.6/*.jar /opt/modules/cdh/oozie-4.0.0-cdh5.3.6/libext/
4)cp /
ext-2.2.zip ---> oozie使用了extjs
ext-2.2.zip copy 到 libext
5)将mysql的驱动包添加到libext
oozie需要有关系型数据库存储工作流运行过程中的状态流转信息
6)修改oozie-site.xml
oozie-env.sh
从CATALINA_OPTS看出,oozie内部使用的tomcat做应用服务器
7)打war包到tomcat中
bin/oozie-setup.sh prepare-war
成功:
New Oozie WAR file with added 'ExtJS library, JARs' at /opt/modules/cdh/oozie-4.0.0-cdh5.3.6/oozie-server/webapps/oozie.war
8)将tar包解压并上传依赖包到hdfs上
bin/oozie-setup.sh sharelib create -fs hdfs://beifeng-hadoop-02:9000 -locallib oozie-sharelib-4.0.0-cdh5.3.6-yarn.tar.gz
<property>
<name>oozie.service.WorkflowAppService.system.libpath</name>
<value>/user/${user.name}/share/lib</value>
<description>
System library path to use for workflow applications.
This path is added to workflow application if their job properties sets
the property 'oozie.use.system.libpath' to true.
</description>
9)初始化mysql中的oozie库
bin/oozie-setup.sh db create -run oozie.sql
10)启动oozie
bin/oozied.sh start
netstat -tlnup | grep 11000
11)访问
http://beifeng-hadoop-02:11000/oozie/
三、oozie使用
1. 运行案例
使用oozie来运行 fof 好友推荐 mapredue,首先要确保MapReduce能正常运行。
mapreduce-example.jar findfof bestfof
2. Oozie:工作流程是通过配置文件进行配置
worflow.xml 参考examples里面的皮遏制
oorzie运行workflow是通过MapReduce运行,所以workflow的配置文件需要先放到hdfs上
如何定义工作流并运行工作流(以MapReduce为例):
(1)先在本地文件系统定义好配置
(2)编写两个配置
job.properties workflow.xml
(3)创建lib目录,将mapreduce jar包放进去
job.properties
YANR 的调度器的队列
yarn调度,其实就是讲mr job放到某个queue上运行
队列:
(1)FIFO
(2)Fair公平队列:先尽可能将资源分配给某个Job
比如只有一个job时,拥有所有资源,当有另一个job要执行,则会分出部分资源
(3)容量队列:多个FIFO队列,每个队列有资源占有率
往YARN上提交Job,根据Job的资源要求安排合适队列运行job任务。
3. 将配置上传到hdfs
4. 运行
bin/oozie job -oozie http://beifeng-hadoop-02:11000/oozie -config /opt/datas/oozie-apps/fof-mr/job.properties -run
补充概念:
DAG有向无环图:
Oozie workflow
storm 数据流
spark 本质核心 DAG
<ok to ="">
1)Map Reduce action
2) shell action
Oozie执行具有本地特性的shell脚本:
引子shell脚本
真正要执行的shell脚本,要在哪台服务器上,引子shell脚本就放在哪台服务器上。
password='beifeng'
/usr/bin/expect
切割日志
3) hive action
4)sqoop action
《OD学Oozie》20160807Oozie的更多相关文章
- 《OD学oozie》20160813
一.日志收集项目案例 1. oozie中依赖jar包 在工作目录下创建lib目录,上传依赖包的lib目录下 2. 作业 将日志收集与处理项目案例使用oozie的workflow执行 3. coordi ...
- 《OD学Hive》第六周20160730
一.Hive的JDBC连接 日志分析结果数据,存储在hive中 <property> <name>hive.server2.thrift.port</name> & ...
- 《OD学hive》第四周0717
一.Hive基本概念.安装部署与初步使用 1. 后续课程 Hive 项目:hadoop hive sqoop flume hbase 电商离线数据分析 CDH Storm:分布式实时计算框架 Spar ...
- 《OD学hadoop》第二周0703
hdfs可视化界面: http://beifeng-hadoop-01:50070/dfshealth.html#tab-overview yarn可视化界面: http://beifeng-hado ...
- 《OD学hadoop》20160903某旅游网项目实战
一.大数据的落地点 1.数据出售 数据商城:以卖数据为公司的核心业务 2. 数据分析 百度统计 友盟 GA IBM analysis 3.搜索引擎 4. 推荐系统 mahout 百分比 5.精准营销 ...
- 《OD学storm》20160827
http://www.cnblogs.com/lujinhong2/p/4686512.html http://blog.csdn.net/paul_wei2008/article/details/2 ...
- 《OD学HBase》20160821
一.HBase性能调优 1. JVM内存调优 MemStore内存空间,设置合理大小 memstore.flush.size 刷写大小 134217728 = 128M memstore.mslab. ...
- 《OD学HBase》20160820
一.案例 微博: 微博内容: 关注用户和粉丝用户: 添加或移除关注用户 查看关注用户的微博内容 微博数据存储: 响应时间 秒级 无延迟 (1)mysql分布式 (2)hbase数据库 使用HBase数 ...
- 《OD学HBase》20160814
一.HBase引入 http://hbase.apache.org/ 大数据的数据库 1. 概述 Hadoop生态系统中的一个分布式.可拓展.面向列.可伸缩,具有自动容错功能的数据库. NoSQL数据 ...
随机推荐
- 关灯问题 dp
题意是一排路灯,每个路灯有耗电量,照明度,需要给这n个路灯按顺序分组,每组内的最大耗电量是电灯数乘t,可以选择关闭一些电灯,求最大的照明度: 这题思路很明显,预处理出一个g[i][j]表示i到j分为一 ...
- (摘抄)HTTP 协议详解
这个是从网上摘抄下来的,原文链接在最底下,原文写的比较详细,我这里只取了一部分自己想要的 什么是HTTP协议 协议是指计算机通信网络中两台计算机之间进行通信所必须共同遵守的规定或规则,超 ...
- jquery中如何退出each循环
在for循环中我们用continue退出当前循环,进入下一循环.用break跳出所有循环. 可是在jQuery中却并没有这两条命令,那么如何退出each循环呢? 经过查询得知: 在jQuery中用 r ...
- VS调试Libevent流程
下载源码包: libevent--stable.tar.gz 第一:编译libevent 进入VS2010命令提示,切换到libevent的所在目录 nmake /f Makefile.nmake 编 ...
- Long和Date数据类型之间相互转换代码 - 调整时间推前往后,截取long型日期方法。
SimpleDateFormat DATETIME_SEC_STR = new SimpleDateFormat("yyyyMMddHHmmss"); SimpleDateForm ...
- tar命令--解压缩
tar命令是linux中的一个解压缩的命令.使用tar命令之前首先要搞清楚两个概念:打包和压缩.打包是指将一大堆文件或目录变成一个总的文件:压缩则是将一个大的文件通过一些压缩算法变成一个小文件. 为什 ...
- $q -- AngularJS中的服务
此 承诺/延迟(promise/deferred)实现 的灵感来自于 Kris Kowal's QCommonJS Promise建议文档 将承诺(promise) 作为和 异步执行操作(action ...
- PYTHON发送邮件时,有的服务器不用密码认证的
#!/usr/bin/python # coding: UTF-8 import smtplib from email.mime.text import MIMEText receivers_list ...
- DB2常用函数:字符串函数
VALUE函数 语法:VALUE(EXPRESSION1,EXPRESSION2) VALUE函数是用返回一个非空的值,当其第一个参数非空,直接返回该参数的值,如果第一个参数为空,则返回第一个参数的值 ...
- 解决xshell连接linux总是异常断开的问题?
找到etc下面的profile文件,可以看到有下面一行: TMOUT=;export TMOUT 注释掉即可解决. #TMOUT=;export TMOUT