部署Kettle做ETL开发并使用Crontab制作调度系统
背景说明:
在数据量较小,且数据源和装载地都是关系型数据库时,使用Kettle做ETL较为简便。
由于调度系统产品因为服务器环境方面的因素,而无法部署,故使用Linux的crontab定时器来制作简易调度系统是一个比较简便的解决方案。
本文旨在记录Kettle的部署及配置文件配置注意事项和如何自制简易调度系统,以便处理类似问题时方案的复用。
一、环境与工具
- CentOS 6.7
- JDK1.8/JDK1.7
- pdi-ce-6.1.0.1-196.zip
二、Linux安装Kettle
2.1 安装JDK并配置环境变量
Kettle的运行需要jdk环境,所以需要先安装jdk。jdk的安装方法此处略去。
2.2 创建kettle用户
# useradd -m kettle
2.3 上传Kettle安装包并解压
创建kettle部署目录
# mkdir /opt/kettle
将安装包pdi-ce-6.1.0.1-196.zip上传至/opt/kettle目录下,并解压:
# unzip /opt/kettle/pdi-ce-6.1.0.1-196.zip
2.4 更改属主属组和执行权限
# chown -R kettle:kettle /opt/kettle
# chmod 755 /opt/kettle/pdi-ce-6.1.0.1-196/data-integration/*.sh
2.5 测试
切换至kettle用户
# su kettle
启动kettle的kitchen或pan
$ cd /opt/kettle/pdi-ce-6.1.0.1-196/data-integration/
$ ./kitchen.sh
如果能正常启动,则说明kettle安装成功。
2.6 配置文件设置
在/home/kettle/.kettle目录下有一个kettle.properties文件,在kettle程序启动时会读取这个文件配置的属性。这里一般可以将数据库的连接信息(包含ip,端口,数据库实例,用户名,密码等)以及自定的一些变量(如etl_path等)。
将这些连接信息配置在配置文件中,而在kettle脚本中使用这些变量名来代替,好处在与脚本的移植与复用时,不需要改动脚本,只需要修改配置文件即可。
三、简易调度系统制作
3.1 创建调度系统目录
- 创建kettle脚本存放目录
# mkdir -p /opt/kettle/scripts
# mkdir -p /opt/kettle/scripts/jobs
# mkdir -p /opt/kettle/scripts/trans
- 创建调度脚本存放目录
# mkdir -p /opt/kettle/scheduler
- 创建日志存放目录
# mkdir -p /opt/kettle/logs
3.2 上传或创建调度脚本kettle_scheduler.sh
上传kettle_scheduler.sh文件到/opt/kettle/scheduler目录下。或者进入目录创建:
编辑文件:
# cd /opt/kettle/scheduler
# vim kettle_scheduler.sh
输入如下内容并保存:
#!/bin/bash
#
cd /opt/kettle/scripts/jobs/
date=`date +%Y%m%d`
files=`ls /opt/kettle/scripts/jobs/*.kjb`
for file in $files
do
file_name=`echo "$file" | awk -F '.' '{print $1}' | awk -F '/' '{print $6}'`
log_name="${file_name}-${date}.log"
mkdir -p /opt/kettle/logs/$file_name
/opt/kettle/pdi-ce-6.1.0.1-196/data-integration/kitchen.sh -file=$file -level=basic>>/opt/kettle/logs/$file_name/$log_name
done
3.3 修改权限
# chown -R kettle:kettle /opt/kettle
# chmod 755 /opt/kettle/scheduler/kettle_scheduler.sh
3.4 配置定时任务
进入crontab编辑界面
# crontab -e
输入如下内容,保存退出
1 0 * * * chown -R kettle:kettle /opt/kettle/scripts
5 0 * * * su - kettle -c "/opt/kettle/scheduler/kettle_scheduler.sh" &
四、调度系统的使用
4.1 kettle脚本的上线
上传开发好的kettle脚本到指定路径。
- 将所有的kettle作业(以.kjb为后缀)上传至/opt/kettle/scripts/jobs目录下;
- 将所有的kettle转换(以.ktr为后缀)上传至/opt/kettle/scripts/trans目录下。
这里开发kettle作业时,需要注意作业和转换的目录位置关系,比如可以在配置文件kettle.properties中配置etl_path=/opt/kettle/scripts。
4.2 日志查看
在/opt/kettle/logs目录下,每一个作业会新建一个对应名称的文件夹用于存储执行的日志,作业的每一次执行都会在这个文件夹下创建一个日志文件并加上日期。
例如,/opt/kettle/scripts/jobs目录下有个test.kjb的作业,则执行完后会在/opt/kettle/logs/test目录下创建一个test-20190823.log
# cd /opt/kettle/logs/test
# cat test-20190823.log
五、日志的清理
5.1 上传或创建日志清理脚本kettle_clean.sh
上传kettle_clean.sh文件到/opt/kettle/scheduler目录下。或者进入目录创建:
编辑文件:
# cd /opt/kettle/scheduler
# vim kettle_clean.sh
输入如下内容并保存:
#!/bin/bash
dir=/opt/kettle/logs
cd ${dir}
reserveDays=7 # 设置要保留的日志天数
sub_dirs=`ls ${dir}`
for sub_dir in ${sub_dirs}; do
count=$(ls ${sub_dir} | wc -l)
if [[ ${count} -gt ${reserveDays} ]]; then
cleanCnt=$((count-reserveDays))
files=$(ls ${dir}/${sub_dir} | head -n ${cleanCnt})
cd ${sub_dir}
rm -rf ${files}
cd ..
fi
done
5.2 更改属主属组和执行权限
# chown kettle:kettle /opt/kettle/scheduler/kettle_clean.sh
# chmod 755 /opt/kettle/scheduler/kettle_clean.sh
5.3 配置定时任务
进入crontab编辑界面
# crontab -e
增加一行如下内容,保存退出
0 2 * * * su - kettle -c "/opt/kettle/scheduler/kettle_clean.sh"
部署Kettle做ETL开发并使用Crontab制作调度系统的更多相关文章
- 开源作业调度工具实现开源的Datax、Sqoop、Kettle等ETL工具的作业批量自动化调度
1.阿里开源软件:DataX DataX 是一个异构数据源离线同步工具,致力于实现包括关系型数据库(MySQL.Oracle等).HDFS.Hive.ODPS.HBase.FTP等各种异构数据源之间稳 ...
- kettle系列-4.kettle定制化开发工具类
要说的话这个工具类还是比较简单的,每个方法体都比较小,但用起来还是可以的,把开发中一些常用的步骤封装了下,不用去kettle源码中找相关操作的具体实现了. 算了废话不多了,直接上重点,代码如下: im ...
- 【转载】在 2016 年做 PHP 开发是一种什么样的体验?(一)
转自:https://www.v2ex.com/t/312651 在 2016 年做 PHP 开发是一种什么样的体验?(一) 嘿,我最近接到一个网站开发的项目,不过老实说,我这两年没怎么接触编程,听说 ...
- 从大公司做.NET 开发跳槽后来到小公司的做.NET移动端微信开发的个人感慨
从14年11月的实习到正式的工作的工作我在上一家公司工作一年多了.然而到16年5月20跳槽后自己已经好久都没有在写博客了,在加上回学校毕业答辩3天以及拿档案中途耽搁了几天的时间,跳槽后虽然每天都在不停 ...
- 【转】在 2016 年做 PHP 开发是一种什么样的体验?(一)
原文: https://www.v2ex.com/t/312651 在 2016 年做 PHP 开发是一种什么样的体验?(一) 嘿,我最近接到一个网站开发的项目,不过老实说,我这两年没怎么接触编程,听 ...
- ETL开发面试问题加吐槽加职业发展建议
写在前面: 作为甲方,对于乙方派来的开发人员,我是会自己面一下.总体来说遇到的水平不一,于是经过这三年多的面(cui)试(can),总结了一套自己的面试套路,中间也遇到过很多想吐槽的东西,于是大概记录 ...
- 【转】Java做服务器开发语言
版权声明:本文为博主原创文章,未经博主允许不得转载. 随着游戏市场的兴起,特别是网页游戏.手机游戏的崛起,对游戏开发技术的需求越来越多.网络游戏开发是一个庞大的体系,总体来说是客户端与服务器端.客户端 ...
- Windows 平台做 Python 开发的最佳组合
在 Windows 上怎样做 Python 开发?是像大神那样使用纯文本编辑器,还是用更加完善的 IDE?到底是用自带的命令行工具,还是需要装新的 Terminal?本文将带你了解如何利用微软官方维护 ...
- Ubuntu部署python3.5的开发和运行环境
Ubuntu部署python3.5的开发和运行环境 1 概述 由于最近项目全部由python2.x转向 python3.x(使用目前最新的 python3.5.1) ,之前的云主机的的默认python ...
随机推荐
- jenkins +Jmeter 完成分布式性能测试
1.Jmeter 压测机器配置. 下载Jmeter 版本:https://jmeter.apache.org/download_jmeter.cgi 我下的是5.1.1 将下载后的版本进行解压. ...
- 微信小程序全局状态管理 wxscv
微信小程序中,数据状态不同页面中不能跨页面同步更新,也就是缺失类似vuex,mobx,redux全局的数据状态管理功能. 有些人移植了这些库,但是毕竟不是微信小程序生态的东西. Tencent也发布了 ...
- python课堂整理19----迭代器和生成器
一.概念 • 迭代器协议: 对象必须提供一个next方法,执行该方法要么返回迭代中的下一项,要么引起一个stopIteration异常,以终止迭代(只能往后走,不能往前退) • 协议是一种约定,pyt ...
- 如何启用linux的路由转发功能
如何使用iptables的NAT功能把红帽企业版Linux作为一台路由器使用? 方法: 提示: 以下方法只适用于红帽企业版Linux 3 以上. 1.打开包转发功能: echo "1&quo ...
- java - 进程和线程的区别及联系
1. 进程 (1)进程主要有两个特征: a. 进程是一个实体,占有一定的地址空间.每一个进程都有它自己的地址空间,一般情况下,包括文本区域(text region).数据区域(data region) ...
- selenium Java中常见等待的几种形式
前言 在自动化测试中,我们经常会碰到编写脚本过程中操作某个元素的时候, 需要等待页面加载完成后,才能对元素操作,否则会报错,提示页面元素不存在异常,我们需要等待元素加载完成后,才能继续操作,而Sele ...
- 单页面(如react,vue)网站的服务器渲染 SSR 之 SEO 大杀器 Rendertron
单页面网站,比如vue.recat框架的网站,一般都是直接从服务器推送index.html,再根据自身路由通过js在客户端浏览器渲染出完整的html页面. 但是搜索引擎的爬虫可没有这么智能(实际上go ...
- flask+uwsgi+nginx+docker-compose部署
简单介绍 Flask这里就不多阐述了,已经是很流行的一个轻量级python框架了,对于小.中型项目特别适合.这里用docker的compose编排部署.uwsgi 简单的说明下,uWSGI是一个Web ...
- 计算机原理以及PythonIDE配置和使用
计算机基础 在巩固了昨日学习知识的基础上,增加了新的内容 整个关于计算机基础的学习可以浓缩为五个问题 什么是编程? 人与计算机之间的交互操作,使人可以奴役计算机从而让其代替人类工作的行为 操作系统有什 ...
- 初次见面C#排坑记录
排一次开发C#遇到的坑,同时说一下自己对C#中文件夹构建方式的体会. 一个开发Java的人留下了痛苦的泪水,变量命名规则不一样,连括号打的都不一样,