简介

Kettle是一款纯Java开发的ETL工具,它是跨平台的,所以它可以在Window、Linux、Unix上运行。注意什么是ETL,读者可以自行百度了解,我的理解是将一个数据库的数据导入到另外一个数据库中,当让这种说法并不严谨,因为数据传输过程中肯定还有很多转换步骤。我们可以在它的官网上下载最新的工具包,也可以在Github上面下载Kettle的源码。

启动Kettle界面

我们从官网下载Kettle的压缩包之后解压到自己想要的目录中,我们可以看到Kettle中根目录叫做data-integration,打开这个文件夹我们可以看到很多脚本,因为我们是在Windows下使用,所以主要关注.bat结尾的脚本。

上面我标示出了四个主要的.bat文件,其中Spoon.bat是与用户界面有关的,我们点击Spoon.bat就可以启动Kettle的用户界面了。 (ps:忘记说了,Kettle是Java写的,所以请务必配置好jdk,不然肯定无法正常使用的)

新建转换(Transformation)

现在假设我们要新建一个转换,它实现的功能是将MySQL中的两张表做Join操作,然后将处理的结果集写入到目标表中,我们来看看如何实现这些步骤。

  • 我们点击菜单栏的文件->新建->转换

  • 新建一个转换之后会打开一个画布,我们可以在上面添加步骤(Step)

    在左边我标红的地方有很多文件夹,这些文件夹中有很多不同功能的组件,比如我们首先要从源表一中抽取数据,这个步骤在表输入目录下,我们可以点击表输入文件夹来看看。

    这个表输入组件我们可以直接拖入到右边的画布中。

  • 编辑表输入 双击上面的表输入步骤会弹出下面这个对话框

    上面的表输入对话框中有很多可以修改的属性,有些我也不是很清楚,我将我了解到的说明一下吧。 步骤名称:该属性应该很好理解,就是该步骤的一个名称,但要注意的是一个转换中的步骤名称应该全局唯一,不能重复。 数据库连接:这个我们新建一个数据库连接,可以选取我们要抽取数据的表 SQL:这个面板中的SQL是根据你数据连接中选中的表动态生成的 记录数量限制:这个属性指的是从源表中抽取多少条数据,默认为0表示数量没有限制,会将源表中所有的数据给抽取出来。

    • 添加JDBC驱动到Kettle的目录 我这里连接的是MySQL,所以需要添加MySQL的JDBC驱动,要注意的是,添加驱动之后需要重启Kettle才能生效。 
  • 新建数据库连接 点击对话中的新建按钮

    填写数据库连接的一些信息,并点击测试,看是否连接成功,如果有异常看自己的信息是否填写正确,数据库的驱动是否有问题。

    这一步做好之后点击“获取SQL查询语句”,选取我们需要的表。

    选中表之后会有一个提示框出来

    点击是就会在SQL面板中生成新的SQL语句,我的最终显示结果如下:

    我们可以点击预览按钮,预览一下我们表中的数据。

    这是一个表输入步骤算是完成了,按照上面的步骤我们再新建一个表输入步骤,这里就不再叙述了。

  • 新建记录集连接

    记录集连接这个步骤可以实现两张表的join操作,记录集连接在连接目录中,将其拖入到画布中。

    接着我们要将“表输入”和“表输入2”连接到“记录集连接”这个步骤上,连接两个步骤的操作方法如下: 按住shift键,将鼠标箭头移至“表输入”上,然后按住鼠标左键并将箭头拖动到记录集连接上,这是一条连线就可以创建成功。 同理连接“表输入2”到“记录集连接”,最终效果如下:

    这是我们在点击“记录集连接”步骤,编辑相关属性

    上面的操作很清晰,首先选取第一个步骤,然后选取第二个步骤,接着点击对应步骤的获取连接字段,比如我们这里要选取第一个步骤的s_id字段,第二个步骤的s_id字段,两个表通过这个字段做inner join操作。 我们可以通过右键来删除不需要的字段:

    修改好之后点击确定:

*新建表输出步骤

将表输入步骤拖入到画布中,表输出步骤在输出目录中

编辑表输出步骤

这里要注意的是,要点击下面的SQL按钮,他会创建或者修改目标表,如果不点这一步的话因为目标表可能不存在或者字段不对应会导致数据插入异常。

  • 保存步骤并运行 点击画布上的小三角会弹出运行的对话框,然后点击启动,任务就会执行。

运行结果

转换运行完成之后界面如下所示:

  • 日志 日志里面记录了一些运行信息,其中有几个比较关键的输出信息: I:表示从表中读取了多少条数据 O:表示向目标表中写入了多少条数据 R:从之前的步骤中读取了多少条数据 W:向下一个步骤写入了多少条数据 上面的解释可能比较晦涩,因为这涉及到Kettle的数据流向,在后面的文章中我会结合源码进行解释。

  • 预览数据 Kettle可以预览每一个Step的部分数据,方便我们进行查看步骤之间的运行情况

kettle_简单入门的更多相关文章

  1. 用IntelliJ IDEA创建Gradle项目简单入门

    Gradle和Maven一样,是Java用得最多的构建工具之一,在Maven之前,解决jar包引用的问题真是令人抓狂,有了Maven后日子就好过起来了,而现在又有了Gradle,Maven有的功能它都 ...

  2. [原创]MYSQL的简单入门

    MYSQL简单入门: 查询库名称:show databases; information_schema mysql test 2:创建库 create database 库名 DEFAULT CHAR ...

  3. Okio 1.9简单入门

    Okio 1.9简单入门 Okio库是由square公司开发的,补充了java.io和java.nio的不足,更加方便,快速的访问.存储和处理你的数据.而OkHttp的底层也使用该库作为支持. 该库极 ...

  4. emacs最简单入门,只要10分钟

    macs最简单入门,只要10分钟  windwiny @2013    无聊的时候又看到鼓吹emacs的文章,以前也有几次想尝试,结果都是玩不到10分钟就退出删除了. 这次硬着头皮,打开几篇文章都看完 ...

  5. 【java开发系列】—— spring简单入门示例

    1 JDK安装 2 Struts2简单入门示例 前言 作为入门级的记录帖,没有过多的技术含量,简单的搭建配置框架而已.这次讲到spring,这个应该是SSH中的重量级框架,它主要包含两个内容:控制反转 ...

  6. Docker 简单入门

    Docker 简单入门 http://blog.csdn.net/samxx8/article/details/38946737

  7. Springmvc整合tiles框架简单入门示例(maven)

    Springmvc整合tiles框架简单入门示例(maven) 本教程基于Springmvc,spring mvc和maven怎么弄就不具体说了,这边就只简单说tiles框架的整合. 先贴上源码(免积 ...

  8. git简单入门

    git简单入门 标签(空格分隔): git git是作为程序员必备的技能.在这里就不去介绍版本控制和git产生的历史了. 首先看看常用的git命令: git init git add git comm ...

  9. 程序员,一起玩转GitHub版本控制,超简单入门教程 干货2

    本GitHub教程旨在能够帮助大家快速入门学习使用GitHub,进行版本控制.帮助大家摆脱命令行工具,简单快速的使用GitHub. 做全栈攻城狮-写代码也要读书,爱全栈,更爱生活. 更多原创教程请关注 ...

随机推荐

  1. Mongoose 对象的特殊性

    一.偶遇难题 在最近使用Mongoose的时候,遇到这样一个问题: 我从DB中查询出来一个对象,比如是Book,这个对象我想在返回时,给他附加一个字段,比如是字段A,正常来说,JS你只需要Book.A ...

  2. Selenium基本用法以及元素定位

    一.Selenium 简介 Selenium是ThroughtWorks公司一个强大的开源Web功能测试工具系列,提供一套测试函数,用于支持Web自动化测试.函数非常灵活,能够完成界面元素定位.窗口跳 ...

  3. 用模板引擎Art-Template渲染空格或换行符引发的一场“命案”

    一.绪论 说实话,真的不知道如何给这篇博客命名,因为我觉得应该有一些小伙伴遇到跟我同样的问题正在抓耳挠腮中. 二.导火索 最近在做一个移动H5翻页的功能,类似于MAKA模板那种.假设大致框架如下 ​ ...

  4. mybatis传单个参数,和<if>标签同时使用的问题

    // Mapper.java EmerEvent selectByAlarmId(Integer alarmId); // Mapper.xml <select id="selectB ...

  5. 个人免签收款接口 bufpay.com 支持限额设置

    有产品希望收款分布到不同的手机,每个当手机达到某一限额以后就停止改手机的收款. bufpay.com 近期上线了收款限额设置功能,配置界面如下图: 每个手机微信或支付宝可以单独设置每日限额,如果该手机 ...

  6. BufPay.com 个人收款接口 接入步骤

    作为独立开发者产品需要收款是非常麻烦的,注册公司维护成本太高,市面上各种收款工具要么手续费太高,要么到账很慢,体验很不好. 看到 「BufPay.com 个人收款」 这个收款工具,挺有意思的.原理是监 ...

  7. Wireshark工具抓包的数据包分析

    Wireshark(前称Ethereal)是一个网络封包分析软件.网络封包分析软件的功能是撷取网络封包,并尽可能显示出最为详细的网络封包资料. Wireshark使用WinPCAP作为接口,直接与网卡 ...

  8. 关于js代码位置的第一次总结

    最近在学习dom树节点操作时,发现查找结点总是返回null,原因在于将js代码放在了head里,因为页面是从上往下逐行加载,在还未加载相关节点时当然查找不到,返回值为null. 而对于另一句老生常谈的 ...

  9. Product Helper

    using System; using Microsoft.Xrm.Sdk; using Microsoft.Crm.Sdk.Messages; /// <summary> /// 产品 ...

  10. 集合之WeakHashMap

    WeakHashMap 底层数据结构是哈希表结构 依赖于键的数据结构特点 不同于HashMap,该类的键是以弱键的形式存在 当该键成为垃圾对象,会被垃圾回收期空闲的时候回收,那么改键所对应值也会被回收 ...