Hadoop DBOutputFormat的使用

最近在研究数据在HDFS和关系型数据库之间的迁移，主要使用了两种方式：一是，按照数据库要求的文件格式生成文件，然后由数据库提供的导入工具进行导入；二是采用JDBC的方式进行导入。MapReduce默认提供了DBInputFormat和DBOutputFormat，分别用于数据库的读取和数据库的写入。为了使用DBOutputFormat我们需要完成以下工作。

首先，对于每一个数据库表编写对应的bean类，该类需要实现WritableComparable接口和DBWritable接口（如果是DBInputFormat，则需要实现Writable和DBWritable。之所以是这样是因为DBOutputFormat在输出的时候是将key写入到数据库而不是value。根据Hadoop的规定Key需要能够进行比较排序，所以需要实现WritableComparable）。Bean类的实现以下面的代码为例：

　　public void readFields(ResultSet result) throws SQLException {

　　		int index = 1;

　　		this.setTestId(result.getString(index++));

　　		this.setTestName(result.getString(index++));

　　		this.setAge(result.getInt(index++));

　　	}

　　	public void write(PreparedStatement statement) throws SQLException {

　　		int index = 1;

　　		statement.setString(index++, this.getTestId());

　　		statement.setString(index++, this.getTestName());

　　		statement.setInt(index, this.getAge());

　　

　　	}

上面两个方法对应着DBWriteable接口。readFields方法负责从结果集中读取数据库数据（注意ResultSet的下标是从1开始的），一次读取查询SQL中筛选的某一列。Write方法负责将数据写入到数据库，将每一行的每一列依次写入。

完成bean的定义后，进行Mapper的编写，主要是解析数据库的每一行数据然后将每一列赋值给bean对应的属性，这里不再做详细的介绍。

最后进行Job的一些配置，具体如下面代码所示：

　　Configuration conf = new Configuration();

　　conf.set(DBConfiguration.DRIVER_CLASS_PROPERTY, 			                                                       "com.mysql.jdbc.Driver");

　　conf.set(DBConfiguration.URL_PROPERTY,

　　				"jdbc:mysql://localhost:3306/htestdb");

　　conf.set(DBConfiguration.USERNAME_PROPERTY, "root");

　　conf.set(DBConfiguration.PASSWORD_PROPERTY, "");

　　job.setNumReduceTasks(0);

　　DBOutputFormat.setOutput(job, "test", "testid","testname","age");

　　job.setOutputFormatClass(DBOutputFormat.class);

上面的配置主要包括以下几项：

l 数据库驱动的名称：com.mysql.jdbc.Driver

l 数据库URL：jdbc:mysql://localhost:3306/htestdb

l 用户名：root

l 密码：空

l 数据库表以及每列的名称：DBOutputFormat.setOutput(job, "test", "testid","testname","age")

除此之外还有Hadoop基础设置，比如reduce的个数、输入输出方式、输入输出路径等，这里不再做详细介绍。

需要提醒的是DBOutputFormat以MapReduce的方式运行，会并行的连接数据库。在这里需要合适的设置map活着reduce的个数，以便将并行连接的数量控制在合理的范围之内。

Hadoop DBOutputFormat的使用的更多相关文章

Hadoop 中利用 mapreduce 读写 mysql 数据
Hadoop 中利用 mapreduce 读写 mysql 数据有时候我们在项目中会遇到输入结果集很大,但是输出结果很小,比如一些 pv.uv 数据,然后为了实时查询的需求,或者一些 OLAP ...
[Hadoop in Action] 第7章细则手册
向任务传递定制参数获取任务待定的信息生成多个输出与关系数据库交互让输出做全局排序 1.向任务传递作业定制的参数在编写Mapper和Reducer时,通常会想让一些地方可以配 ...
Hadoop相关日常操作
1.Hive相关脚本导数据,并设置运行队列 bin/beeline -u 'url' --outputformat=tsv -e "set mapreduce.job.queuename= ...
Hadoop：输入，输出，key，value格式
map: (K1, V1) → list(K2, V2) reduce: (K2, list(V2)) → list(K3, V3) (K1, V1): jobConf.setInputKeyClas ...
Hadoop学习资料
转自:http://cloud21.iteye.com/blog/607175 第一手资源 hadoop官方网站 hadoop.apache.org 最权威的官方资源之一 dev.yahoo.hado ...
hadoop MapReduce 笔记
1. MapReduce程序开发步骤编写map 和 reduce 程序–> 单元测试 -> 编写驱动程序进行验证-> 本地数据集调试 -> 部署到集群运行用 ...
hadoop之输入输出格式
<STRONG>jobConf.setInputFormat(MyInputFormat. class ); InputFormat:</STRONG> TextInputFo ...
Hadoop中常用的InputFormat、OutputFormat（转）
Hadoop中的Map Reduce框架依赖InputFormat提供数据,依赖OutputFormat输出数据,每一个Map Reduce程序都离不开它们.Hadoop提供了一系列InputForm ...
Hadoop基础教程之高级编程
从前面的学习中,我们了解到了MapReduce整个过程需要经过以下几个步骤: 1.输入(input):将输入数据分成一个个split,并将split进一步拆成<key, value>. 2 ...

随机推荐

【Unity笔记】常用插件
记录一些常见插件,随时补充. iTween动画插件原理:插值法,给出初始值和终点值,自动算出中间值. DoTween Tween动画 Playmaker $45 Playmaker由第三方软件商Hu ...
【WordPress】外网访问WordPress时无法加载样式表CSS
情况: 阿里云ECS服务器,用WampServer搭建的WordPress站点,服务端自身访问该站点时显示正常,但外网访问时不能加载样式表CSS的问题. 重要的参考: https://www.doub ...
Energy Modes能量管理模式
1 EM0 运行模式默认模式; 2 EM1 休眠模式休眠模式主处理器停止,片上系统模块运行; 3 EM2 深度休眠只有异步或低频外设运行; 4 EM3 停止模式与EM2相比,低频晶振 ...
可变参数宏...和__VA_ARGS__
__VA_ARGS__ 是一个可变参数的宏,很少人知道这个宏,这个可变参数的宏是新的C99规范中新增的,目前似乎只有gcc支持(VC6.0的编译器不支持).实现思想就是宏定义中参数列表的最后一个参数为 ...
【高可用HA】Apache (2) —— Mac下安装多个Apache Tomcat实例
Mac 下安装多个Apache Tomcat实例 tomcat版本:tomcat-8.0.29 参考来源: Installing Tomcat 7.0.x on OS X 在mac系统安装Apache ...
Remote Desktop Connection没法全屏解决方案
Remote Desktop Connection无法全屏解决方案Sometimes, Remote Desktop Connection总是一个窗口,不自动全屏,任务栏不能自动隐藏起来,要拖动滚动条 ...
hive & hive beeline常用参数
Hive 1参数如下: usage: hive -d,--define <key=value> Variable substitution to apply to Hive command ...
格林威治时间格式(GMT)与普通时间格式的互相转换
GMT --> 普通时间格式: 方法: function GMTToStr(time){ var date = new Date(time) var Str=date.getFullYear() ...
JQuery _ 定时器(jQuery Timers) 学习
jQuery Timers插件地址: http://plugins.jquery.com/project/timers JQuery Timers应用知识提供了三个函式 1. everyTime(时 ...
python + opencv: kalman 跟踪
之前博文中讲解过kalman滤波的原理和应用,这里用一个跟踪鼠标的例程来演示怎么在opencv里用自带的kalman函数进行目标跟踪,文章的内容对做图像跟踪有借鉴意义.文章主要是网络资源进行整理和简单 ...

Hadoop DBOutputFormat的使用

Hadoop DBOutputFormat的使用的更多相关文章

随机推荐

热门专题