数据层交换和高性能并发处理(开源ETL大数据治理工具--KETTLE使用及二次开发 )

ETL是什么？为什么要使用ETL？KETTLE是什么？为什么要学KETTLE？

ETL是数据的抽取清洗转换加载的过程，是数据进入数据仓库进行大数据分析的载入过程，目前流行的数据进入仓库的过程有两种形式，一种是进入数据库后再进行清洗和转换，另外一条路线是首先进行清洗转换再进入数据库，我们的ETL属于后者。

大数据的利器大家可能普遍说是hadoop，但是大家要知道如果我们不做预先的清洗和转换处理，我们进入hadoop后仅通过mapreduce进行数据清洗转换再进行分析，垃圾数据会导致我们的磁盘占用量会相当大，这样无形中提升了我们的硬件成本（硬盘大，内存小处理速度会很慢，内存大cpu性能低速度也会受影响），因此虽然hadoop理论上解决了烂机器拼起来解决大问题的问题，但是事实上如果我们有更好的节点速度必然是会普遍提升的，因此ETL在大数据环境下仍然是必不可少的数据交换工具。

市场上流行的ETL很多，比如informatica等，但是开源的比较完善的却不是很多，而其中比较有名的要说是pentaho开源的kettle了，该工具被广泛用，并且开源的产品我们从中不仅可以学到ETL的简单应用，并且可以学习到ETL的原理以及通过源码学到更多的东西。

亮点一：KETTLE应用广泛，仅仅学会使用就可以找到一份不错的工作。

亮点二：本课程不仅讲解简单实用，同时讲解二次开发并且配有开发模板，提升工作质量。

亮点三：渗透了大数据的一些处理方法，与目前流行的hadoop配合使用。

亮点四：分析KETTLE源码，即使对ETL兴趣不大，至少可以了解国外开源项目的一些源码，并且KETTLE本身也使用了很多开源项目，因此可以从该工具上学到更多东西。

通过课程可以学到什么：

1.ETL过程原理

2.数据流引擎的原理

3.元数据和数据进行动态数据交换的设计

4.并发运算的原理

课时安排：（15课时）

1.ETL简介—开源KETTLE（1课时）

>介绍KETTLE在大数据应用的位置和作用。

>主要讲解ETL是什么，KETTLE进行简单介绍，并且使用例子进行KETTLE的使用介绍。

>介绍KETTLE流程的部署。

2.KETTLE使用（1课时）

>详细介绍KETTLE的spoon使用

>KETTLE的trans和job入门

>KETTLE的日志和调试工具使用

3. KETTLE之Step流程设计（3课时）

>编写例子介绍KETTLE常用的转换、清洗组件

>主要完成以下插件：

输入插件：

文本文件输入、生成记录、表输入、Fixed file input、Get data from XML

输出插件：

XML输出、删除、插入/更新、文本文件输出、更新、表输出

转换插件：

Add a checksum、Replace in string、Set field value、Unique rows（HashSet）、增加常量、增加序列、字段选择、拆分字段

Flow插件：

Abort、Switch/case、空操作、过滤记录

脚本插件：

Modified Java Script Value、执行SQL脚本

查询插件：

File exists、Table exists、调用DB存储过程

4. KETTLE之Job流程设计（2课时）

>编写例子介绍KETTLE常用的作业组件

>主要完成以下插件：

通用插件：

START、DUMMY、Transformation、Success

文件管理插件：

Copy Files、Compare folders、Create a folder、Create file、Delete files、Delete folders、File Compare、Move Files、Wait for file、Zip file、Unzip file

条件插件：

Check Db connections、Check files locked、Check if a folder is empty、Check if files exist、File Exists、Table exists、Wait for

脚本插件：

Shell、SQL

Utility插件：

Ping a host、Truncate tables

文件传输插件：

Upload files to FTPS、Get a file with FTPS、FTP Delete

>Kettle与Hadoop的联合使用

5. KETTLE之流程性能调优与监控（1课时）

>介绍KETTLE的流程监控功能

>介绍KETTLE的性能优化方法

6. KETTLE之嵌入开发（1课时）

>编写程序介绍KETTLE的流程如何嵌入到我们的java应用中

主要包括java嵌入trans以及job流程

7. KETTLE之自定义Step、Job插件制作（3课时）

>编写Step和Job模板，并给大家作为二次开发的基础工程使用，提高大家的开发效率。

>编写程序说明Step和Job插件的开发方法。

8. KETTLE之数据同步方案（1课时）

>介绍5种数据同步方案，并且这5种方案都是支持异构数据同步的。

包括全量快速同步方案和增量同步方案

9. KETTLE之分区、集群以及原理（1课时）

>介绍KETTLE的分区原理，并且讲解配置使用。

>介绍KETTLE的集群原理，并且讲解配置使用，以及监控方法。

10. KETTLE之源码分析与二次开发（1课时）

>介绍KETTLE的SRC导入ECLIPSE方法，以及打包和运行方法。

>分析KETTLE的包结构以及运行流程，讲解KETTLE的运行原理。

数据层交换和高性能并发处理(开源ETL大数据治理工具--KETTLE使用及二次开发 )的更多相关文章

Facebook 正式开源其大数据查询引擎 Presto
Facebook 正式宣布开源 Presto —— 数据查询引擎,可对250PB以上的数据进行快速地交互式分析.该项目始于 2012 年秋季开始开发,目前该项目已经在超过 1000 名 Faceboo ...
H2O是开源基于大数据的机器学习库包
H2O是开源基于大数据的机器学习库包 H2O能够让Hadoop做数学,H2O是基于大数据的统计分析机器学习和数学库包,让用户基于核心的数学积木搭建应用块代码,采取类似R语言 Excel或JSON等 ...
Druid：一个用于大数据实时处理的开源分布式系统——大数据实时查询和分析的高容错、高性能开源分布式系统
转自:http://www.36dsj.com/archives/28590 Druid 是一个用于大数据实时查询和分析的高容错.高性能开源分布式系统,旨在快速处理大规模的数据,并能够实现快速查询和分 ...
Elastic Stack 开源的大数据解决方案
目的本文主要介绍的内容有以下三点: 一. Elastic Stack是什么以及组成部分二. Elastic Stack前景以及业务应用三. Elasticsearch原理(索引方向) 四. El ...
CYQ.Data 轻量数据层之路使用篇-MProc 存储过程与SQL 视频[最后一集] H (二十八)
2019独角兽企业重金招聘Python工程师标准>>> 说明: 本次录制主要为使用篇:CYQ.Data 轻量数据层之路使用篇五曲 MProc 存储过程与SQL(十六) 的附加视 ...
奇点云数据中台技术汇(一) | DataSimba——企业级一站式大数据智能服务平台
在这个“数据即资产”的时代,大数据技术和体量都有了前所未有的进步,若企业能有效使用数据,让数据赚钱,这必将成为企业数字化转型升级的有力武器. 奇点云自研的一站式大数据智能服务平台——DataSimba ...
IT大数据服务管理高级课程(IT服务，大数据，云计算，智能城市)
个人简历金石先生是马克思主义中国化的研究学者,上海财经大学经济学和管理学硕士,中国民主建国会成员,中国特色社会主义人文科技管理哲学的理论奠基人之一.金石先生博学多才,对问题有独到见解.专于工作且乐于 ...
1.docker 数据卷的备份和恢复（非大数据量）
在生产环境中使用 Docker,很多时候需要对数据进行持久化,或者进行容器间的数据共享. 容器中的管理数据主要有两种方式: 数据卷 (Data Volumes): 容器内数据直接映射到本地主机环境: ...
齐博软件著名的老牌CMS开源系统 X1.0基于thinkphp开发的高性能免费开源PHP开放平台齐博x1.0基于thinkphp框架开发的高性能免费开源系统主推圈子论坛预定拼团分销商城模块
齐博X1--标签变量大全 1.网站名称: {$webdb.webname} 2.网址: {$webdb[www_url]} {:get_url('home')} 3.网站SEO关键词: 首页:{$we ...

随机推荐

[Android] 文件夹下文件的个数限制
Android机子的文件夹下有存放文件的个数限制,做了下测试,如下: 在创建第65534个文件时抛出了异常: java.io.IOException: open failed: ENOSPC (No ...
hibernate一对多关联关系
想了几天,终于知道sql语句的发出问题.查了很多书,感觉都没有说清楚,有的还是错的.请看下面: <?xml version="1.0"?> <!DOCTYPE h ...
Ceph之数据分布：CRUSH算法与一致性Hash
转自于:http://www.cnblogs.com/shanno/p/3958298.html?utm_source=tuicool 数据分布是分布式存储系统的一个重要部分,数据分布算法至少要考虑以 ...
[Swust OJ 893]--Blocks
题目链接:http://acm.swust.edu.cn/problem/893/ Time limit(ms): 1000 Memory limit(kb): 65535 Josh loves ...
Activity跳转
本例中MainActivity为:FirstActivity.java FirstActivity如下: package com.wyl.intentmultiactivitytest; import ...
Python之路Day7
第7天主要是面向对象的内容. 学到现在越来越吃力了,从上节课开始博客就没时间写了,看看别人写的博客都那么棒.又想起了那句话比你牛逼的人都在努力,你却在放羊...唉,我写作业的效率有点低,以后得抓紧时间 ...
Spring MVC整体处理流程
一.spring整体结构首先俯视一下spring mvc的整体结构二.处理流程 1.请求处理的第一站就是DispatcherServlet.它是整个spring mvc的控制核心.与大多数的jav ...
sed学习笔记整理
1.sed简介 sed (Stream Editor)是一种在线编辑器,它一次处理一行内容.处理时,把当前处理的行存储在临时缓冲区中,称为“模式空间”(pattern space),接着用sed命令处 ...
GDG shanghai programming one hour by JavaScript
刚在昨天参加了一场JS入门编程的活动,目的就是提升对JS的兴趣. 因为是针对零基础开发者的,一上来就是“Hello World!”了当然,想用JS输出"Hello World!" ...
如何去掉IE控件的垂直滚动条（使用QAxWidget加载IE控件）
如果使用MFC的CHtmlView或Qt的QAxWidget加载IE控件,载入html文件后都会自动带一个垂直滚动条,我们不想要这个滚动条,改怎么办呢?搜索了一下“隐藏IE控件滚动条”,发现在 htt ...

数据层交换和高性能并发处理(开源ETL大数据治理工具--KETTLE使用及二次开发 )

数据层交换和高性能并发处理(开源ETL大数据治理工具--KETTLE使用及二次开发 )的更多相关文章

随机推荐

热门专题