1. Oozie简介

Yahoo开发工作流引擎Oozie（驭象者），用于管理Hadoop任务（支持MapReduce、Spark、Pig、Hive），把这些任务以DAG（有向无环图）方式串接起来。Oozie任务流包括：coordinator、workflow；workflow描述任务执行顺序的DAG，而coordinator则用于定时任务触发，相当于workflow的定时管理器，其触发条件包括两类：

数据文件生成
时间条件

Oozie定义了一种基于XML的hPDL （Hadoop Process Definition Language）来描述workflow的DAG。在workflow中定义了

控制流节点（Control Flow Nodes）
动作节点（Action Nodes）

其中，控制流节点定义了流程的开始和结束（start、end），以及控制流程的执行路径（Execution Path），如decision、fork、join等；而动作节点包括Hadoop任务、SSH、HTTP、eMail和Oozie子流程等。控制流节点示例如下：

<workflow-app xmlns='uri:oozie:workflow:0.2' name="ooziedemo-wf">

    <start to="timeCheck"/>

    ...

    <kill name="fail">

    <message>Failed, error message[${wf:errorMessage(wf:lastErrorNode())}]

    </message>

  </kill>

  <end name="end"/>

</workflow-app>

<!-- or -->

<workflow-app xmlns='uri:oozie:workflow:0.2' name="ooziedemo-wf">

    <start ../>

    <fork name="forking">

        <path start="sqoopMerge1"/>

        <path start="sqoopMerge2"/>

    </fork>

    <join name="joining" to="end"/>

    <end ../>

</workflow-app>

其中，fork、join是成对出现，表示了工作流的并发执行，最后汇聚到一个node。从Oozie的工作流调度机制可以看出，Oozie没有能力表达复杂的DAG，比如：嵌套的依赖关系。此外，Oozie工作流可以参数化，比如：在工作流定义中使用像${inputDir}之类的变量，然后通过job.properties配置对应参数，在启动时将这些配置参数传入工作流：

oozie job -oozie http://<host>:11000/oozie/  -config job.properties  -run

2. Workflow

Action Node定义了基本的工作任务节点。（以下介绍版本基于Oozie 4.1.0）

MapReduce

一般地，我用java action启动MapReduce任务，对于任务的动态变化参数，在workflow的configuration进行配置，然后在job.properties指定参数值。

<action name="Data Clean">

	<java>

		<job-tracker>${jobTracker}</job-tracker>

		<name-node>${nameNode}</name-node>

		<configuration>

			<property>

				<name>mapred.reduce.tasks</name>

				<value>${reducerNum}</value>

			</property>

			<property>

				<name>mapreduce.job.queuename</name>

				<value>${queueName}</value>

			</property>

		</configuration>

		<main-class>...</main-class>

		<java-opts>-Xms256m -Xmx512m</java-opts>

		<arg>..</arg>

		<arg>${nameNode}/user/${wf:user()}/xx</arg>

		...

		<arg>${cleanDate}</arg>

		<capture-output />

	</java>

	<ok to="end" />

	<error to="fail" />

</action>

其中， ${wf:user()}为workflow的内置参数，表示当前用户名。一般地，使用该参数，为了保证写权限（毕竟没有写文件到其他用户文件夹的权限）。

Spark

Oozie支持Spark action，不过支持的不是特别好。提交spark任务时，需要加载spark-assembly jar。

<action name="Spark Data Clean">

    <spark xmlns="uri:oozie:spark-action:0.1">

        <job-tracker>${jobTracker}</job-tracker>

        <name-node>${nameNode}</name-node>

        <configuration>

            <property>

                <name>mapred.job.queue.name</name>

                <value>${queueName}</value>

            </property>

        </configuration>

        <master>yarn-cluster</master>

        <mode>cluster</mode>

        <name>etl${cleanDate}</name>

        <class>...</class>

        <jar>/<hdfs>/<path>/lib/xxx.jar</jar>

        <spark-opts>

            --num-executors ${executors} --driver-memory 4g --executor-memory 4g --executor-cores 5 --queue=${queueName}

        </spark-opts>

        <arg>..</arg>

    </spark>

    <ok to="end" />

    <error to="fail" />

</action>

Pig

Oozie内置pig action，其中<script>为pig脚本所在的HDFS路径，param为pig脚本中的参数。Oozie调度pig任务略坑，先随机指定一台机器，然后将pig脚本dist到该机器，然后执行。但是，因为集群中不同机器部署的pig版本可能不一致，而导致任务跑失败。

<action name="Pig Data Clean">

  <pig>

    <job-tracker>${jobTracker}</job-tracker>

    <name-node>${nameNode}</name-node>

    <configuration>

      <property>

        <name>mapreduce.job.queuename</name>

        <value>${queueName}</value>

      </property>

    </configuration>

    <script>/<hdfs>/<path>/data-clean.pig</script>

    <param>CLEANDATE=${cleanDate}</param>

  </pig>

  <ok to="end"/>

  <error to="fail"/>

</action>

在pig脚本中，一般用$ + 大写字母表示输入参数，示例如下：

A = load '/<hdfs>/<path>/$CLEANDATE' using OrcStorage();

...

E = ...

store E into '/<path>/$CLEANDATE';

实际上，在本地执行带参数的pig脚本时，也是用-param命令：

pig -f test.pig -param CLEANDATE=2016-05-26

Hive

Oozie也可以调度Hive任务，一般使用hive2 action通过beeline连接Hive Server 2，然后执行HiveQL:

<action name="Hive2">

  <hive2 xmlns="uri:oozie:hive2-action:0.1">

    <job-tracker>${jobTracker}</job-tracker>

    <name-node>${nameNode}</name-node>

    <configuration>

      <property>

        <name>mapreduce.job.queuename</name>

        <value>${queueName}</value>

      </property>

    </configuration>

    <jdbc-url>jdbc:hive2://host:10000/db-name</jdbc-url>

    <script>${NameNode}/<hdfs>/<path>/test.hql</script>

    <param>DAYTIME=${dayTime}</param>

  </hive2>

  <ok to="end"/>

  <error to="fail"/>

</action>

其中，param为HiveQL中的输入参数，其对应hql为

alter table db.log_tb

add if not exists partition (day_time=date '${DAYTIME}')

location '${DAYTIME}';

hive命令执行本地hql通过--hivevar传入参数：

hive  -f test.hql --hivevar DAYTIME=2016-05-17

此外，在执行hive2 action时需有如下依赖：

<dependency>

  <groupId>org.apache.hive</groupId>

  <artifactId>hive-exec</artifactId>

  <version>${hive.version}</version>

</dependency>

<dependency>

  <groupId>org.apache.hive</groupId>

  <artifactId>hive-beeline</artifactId>

  <version>${hive.version}</version>

</dependency>

在job.properties指定oozie.libpath（对应于依赖jar的目录）。

工作流引擎Oozie（一）：workflow的更多相关文章

工作流引擎Oozie（二）：coordinator
1. 简介 coordinator是workflow的定时提交器,基于时间条件与数据生成触发(based on time and data triggers).简单点说,coordinator按所定义 ...
F2工作流引擎模型
工作流引擎(Workflow Engine ) [编辑] 工作流引擎概述工作流引擎是指workflow(工作流)作为应用系统的一部分,并为之提供对各应用系统有决定作用的根据角色.分工和条件的不同决定 ...
强大的java工作流引擎，可视化开发工作流
我们先来看看什么是工作流? 所谓工作流引擎是指workflow作为应用系统的一部分,并为之提供对各应用系统有决定作用的根据角色.分工和条件的不同决定信息传递路由.内容等级等核心解决方案.工作流引擎包括 ...
基于activity的强大java工作流引擎，可视化开发工作流
我们先来看看工作流引擎和Activity? 工作流引擎所谓工作流引擎是指workflow作为应用系统的一部分,并为之提供对各应用系统有决定作用的根据角色.分工和条件的不同决定信息传递路由.内容等级等 ...
工作流调度引擎---Oozie
Oozie使用教程一． Oozie简介 Apache Oozie是用于Hadoop平台的一种工作流调度引擎. 作用 - 统一调度hadoop系统中常见的mr任务启动hdfs操作.shell调度. ...
Hadoop工作流引擎之Azkaban与Oozie对比（四）
Azkaban是什么?(一) Azkaban的功能特点(二) Azkaban的架构(三) 不多说,直接上干货! http://www.cnblogs.com/zlslch/category/93883 ...
开源工作流引擎 Workflow Core 的研究和使用教程
目录开源工作流引擎 Workflow Core 的研究和使用教程一,工作流对象和使用前说明二,IStepBuilder 节点三,工作流节点的逻辑和操作容器操作普通节点事件条件体和循环体 ...
用Crontab打造简易工作流引擎
1. 引言众所周知,Oozie(1, 2)是基于时间条件与数据生成来做工作流调度的,但是Oozie的数据触发条件只支持HDFS路径,故而面临着这样的问题: 无法判断Hive partition是否已 ...
F2工作流引擎这工作流引擎体系架构（二）
F2工作流体系架构概览图为了能更好的了解F2工作流引擎的架构体系,花了些时间画了整个架构的体系图.F2工作流引擎遵循参考WFCM规范,目标是实现轻量级的工作流引擎,支持多种数据库及快速应用到任何基于 ...

随机推荐

使用JavaScript获取日期加随机数生成单号
今天学习Javascript,得到一个自动生成单号的JavaScript,留下日后备用: function getNowFormatDate() { var day = new Date(); var ...
WPF中的Pack URI
更多资源:http://denghejun.github.io 问题说来也简单:首先,我在WPF项目中建立了一个用户自定义控件(CustomControl),VS模板为我们自动生成了 CustomC ...
如何生成报告来枚举出整个sharepoint环境中的每个页面所使用的所有webpart
背景我的公司的SharePoint环境中购买了大量的第三方webpart,比如Quick Apps, Telerik RadEditor, Nintex Workflow等等..这样做的好处就是成本 ...
JSP里面ajax不能返回后台传出的值得问题。。。。
问题代码: <%@ page contentType="text/html;charset=gb2312"%><html> <head> < ...
用DataGridView导入TXT文件，并导出为XLS文件
使用 DataGridView 控件,可以显示和编辑来自多种不同类型的数据源的表格数据.也可以导出.txt,.xls等格式的文件.今天我们就先介绍一下用DataGridView把导入txt文件,导出x ...
Java NIO1：I/O模型概述
I/O模型在开始NIO的学习之前,先对I/O的模型有一个理解,这对NIO的学习是绝对有好处的.我画一张图,简单表示一下数据从外部磁盘向运行中进程的内存区域移动的过程: 这张图片明显忽略了很多细节,只 ...
ASP.Net请求处理机制初步探索之旅 - Part 1 前奏
开篇:ASP.Net是一项动态网页开发技术,在历史发展的长河中WebForm曾一时成为了ASP.Net的代名词,而ASP.Net MVC的出现让这项技术更加唤发朝气.但是,不管是ASP.Net Web ...
关于Unicode，字符集，字符编码，每个程序员都应该知道的事
关于Unicode,字符集,字符编码,每个程序员都应该知道的事作者:Jack47 李笑来的文章如何判断一个人是否聪明?中提到: 必要.清晰.且准确的概念,是一切思考的基石.所谓思考,很大程度上,就是 ...
ARM的常数表达式
ARM的常数表达式如果说Intel指令中的立即数,相信大家都很熟悉.类似的,Arm指令中的“立即数”就是常数表达式.之所以称为常数表达式,而不称为立即数是有原因的. Intel指令属于CISC指 ...
ASP.NET MVC 过滤器(四)
ASP.NET MVC 过滤器(四) 前言前一篇对IActionFilter方法执行过滤器在框架中的执行过程做了大概的描述,本篇将会对IActionFilter类型的过滤器使用来做一些介绍. ASP ...

工作流引擎Oozie（一）：workflow