1. 下载并安装配置Sqoop

【需要的环境:Hadoop,Java】

首先  Hadoop版本2.7.2

20161013

找了篇Sqoop的文章就开撸  结果发现什么1.3,1.9,又有什么Sqoop1,Sqoop2.乱了。

先是使用的1.3,两个多小时,各种失败。发现还有一个与hadoop的版本兼容问题。

下午立即开始使用官网的Sqoop2,发现只有1.99.7,先用吧

虽然好了一点,但还是各种问题,一天过去了。。

注意: sqoop1的1.4.x及以下版本是与hadoop-2.6.x以下兼容,sqoop2是与hadoop-2.6.0+兼容,千万不能弄错!

还有,下载的这个压缩包里面都有一个doc文件夹,里面放着文档,因为版本较多且兼容问题严重,所以一定要参照这个文档安装和配置

20161014

昨天捣鼓了一天,先是Sqoop1.3,然后用1.99.7.结果各种问题;

今天早上又去官网游荡了一下,发现这个1.99.7还不是正式发行版,不能放到生产环境的,真够郁闷,没办法,打算尝试一下1.99.6吧。

然而 官网已经把1.99.6的安装包去掉了,只能去网上找了一份。试了一下  顺畅了许多。

具体安装配置过程:(sqoop的shell命令是在$SQOOP_HOME/bin目录下)

  1. 下载解压
  2. 配置~/.bashrc,然后执行 source ~/.bashrc 使变更即刻生效
    export PATH=.......:$SQOOP_HOME/bin:$PATH  #将红字部分插入原来的$PATH前面即可
    export SQOOP_HOME=/home/hadoop/sqoop #Sqoop根目录
    export CATALINE_BASE=$SQOOP_HOME/server
    export LOGDIR=$SQOOP_HOME/logs #log目录  
  3. 配置sqoop server
    1. $SQOOP_HOME/server/conf/catalina.properties文件,修改common.loader属性,引用$HADOOP_HOME/share/hadoop/* 和 */lib

      common.loader=${catalina.base}/lib,${catalina.base}/lib/*.jar,${catalina.home}/lib,${catalina.home}/lib/*.jar,${catalina.home}/../lib/*.jar,/home/hadoop/hadoop-2.7.2/share/hadoop/common/*.jar,/home/hadoop/hadoop-2.7.2/share/hadoop/common/lib/*.jar,/home/hadoop/hadoop-2.7.2/share/hadoop/hdfs/*.jar,/home/hadoop/hadoop-2.7.2/share/hadoop/hdfs/lib/*.jar,/home/hadoop/hadoop-2.7.2/share/hadoop/mapreduce/*.jar,/home/hadoop/hadoop-2.7.2/share/hadoop/mapreduce/lib/*.jar,/home/hadoop/hadoop-2.7.2/share/hadoop/yarn/*.jar,/home/hadoop/hadoop-2.7.2/share/hadoop/yarn/lib/*.jar
    2. $SQOOP_HOME/server/conf/sqoop.properties
      org.apache.sqoop.submission.engine.mapreduce.configuration.directory=$HADOOP_HOME/etc/hadoop  #红字部分要替换成具体的路径,切记!
  4. 修改hadoop配置文件core-site.xml
    <property>
    <name>hadoop.proxyuser.$SERVER_USER.hosts</name>
    <value>*</value>
    </property>
    <property>
    <name>hadoop.proxyuser.$SERVER_USER.groups</name>
    <value>*</value>
    </property>
  5. 验证sqoop2服务器的配置情况 
    sqoop2-tool verify  #如果提示successful 就可以进行下一步了,否则需要查看错误信息和日志文件

到这里 配置就完成了。


Sqoop1.996命令

参考:http://www.mamicode.com/info-detail-411853.html

Show

  • show server --[all,host,port,webapp] #展示服务端信息
  • show option --name verbose  #展示客户端配置
  • show version --[all,client,server,protocol]
  • show connector [--all]
  • show connection [--all,--xid 3]
  • show job [--all,--jid 3]
  • show link [--all, --lid3]

Update

  • update connection --xid 2
  • update job --jid 2
  • update link --lid 3

Delete

  • delete connection --xid 3
  • delete job --jid 1
  • delete link --lid 2

Clone

  • clone connection --xid 2
  • clone job --jid 2
  • clone link --lid 2

Submission

  • start job --jid 2 -s
  • stop job --jid 2
  • status job --jid 2

开始数据传输

开始之前需要准备几个jar包

①如果数据库是MSSQL的话,需要下载这个SqlServerJDBC驱动SQL Server JDBC Driver & Connector

解压后将lib里面的jar文件拷贝到sqoop安装目录的server/lib下面

②mysql的话,需要下载mysql-connector-java

  1. 启动  Sqoop2包含了server和client,所以需要先启动server
  2. sqoop2.sh server start   #服务关闭:sqoop2-server stop 
  3. 以交互模式打开client 
    sqoop2-shell
  4. 配置客户端使用指定的Sqoop server
    set server --host your.host.com --port 12000 --webapp sqoop   #红字部分替换成自己的Sqoop服务器 一般用localhost即可  

创建数据库link

JDBC Driver Class: com.microsoft.sqlserver.jdbc.SQLServerDriver  #驱动名称
JDBC Connection String: jdbc:sqlserver://192.168.1.212:1433;DatabaseName=Test #格式与mysql略有出入,并且这是MSSQL2005以上的格式,2000的话 还有些区别
Username: sa
Password: *************
JDBC Connection Properties:
There are currently 1 values in the map:
protocol = tcp
entry#

创建hdfs link与mysql的方式一致

创建job与mysql仅仅有一点区别

就是Schema name: dbName.dbo  比mysql多了红字部分


Sqoop + MySql + Hadoop(HBase)

创建数据库link

Using Connector generic-jdbc-connector with id 4
Link configuration
JDBC Driver Class: com.mysql.jdbc.Driver
JDBC Connection String: jdbc:mysql://192.168.1.333:3306/someDB
Username: root
Password: 123
JDBC Connection Properties:
protocol = tcp

创建hdfs link

Using Connector hdfs-connector with id 3
Link configuration
HDFS URI: hdfs://hdfs nameservice:port/ #使用hadoop配置文件 core-site.xml中fs.defaultFS的值即可
Hadoop conf directory: /home/hadoop/hadoop/etc/hadoop #hadoop配置文件的路径

创建Job

Job with id 1 and name mysql2hdfs (Enabled: true, Created by hadoop at 16-10-17 下午3:56, Updated by hadoop at 16-10-17 下午4:48)
Throttling resources
Extractors: 2
Loaders: 2
From link: 1
From database configuration
Schema name: dbName
Table name: targetTableName
Table SQL statement:
Table column names:
Partition column name:
Null value allowed for the partition column:
Boundary query:
Incremental read
Check column:
Last value:
To link: 2
To HDFS configuration
Override null value:
Null value:
Output format: TEXT_FILE
Compression format: NONE
Custom compression format:
Output directory: hdfs:/mysqlData/sqoopTableName #要在hdfs中存放的路径
Append mode:

注意事项:

1.在执行job之前  最好执行命令

set option --name verbose --value true

这样如果执行出现问题,会把详细日志打印出来,一目了然。

2.一个job如果执行成功,在hdfs的指定目录下就会有生成的文件,如果想重新start一遍,需要把生成的文件删除才行

$HADOOP_HOME/bin/hadoop dfs -rm /mysqlData/sqoopTableName/*   #之前在job中设置的hdfs路径

查看生成的文件

$HADOOP_HOME/bin/hadoop dfs -cat /mysqlData/sqoopTableName/*
[hadoop@hadoop1 bin]$ ./hadoop dfs -cat /db_data/Cities/*
DEPRECATED: Use of this script to execute hdfs command is deprecated.
Instead use the hdfs command for it. 1,'青岛','0530'
2,'济南','0531' [hadoop@hadoop1 bin]$

To HBase:Sqoop1与Sqoop2的支持程度

Sqoop1的部署及使用

Sqoop2在1.99.6开始通过KiteConnector的方式在一定程度上支持了HBase的读写 传送门

Sqoop2搭建及使用的更多相关文章

  1. Hadoop2.5.0 搭建实录

    目录: 第一步:准备相关材料 第二步:虚拟机环境搭建 第三步:用户信息 第四步 安装.配置Java环境 第五步 Zookeeper安装配置 第六步 Hadoop安装.配置 第七步:HBase安装部署 ...

  2. Sqoop2 环境搭建

    原文地址:http://www.cnblogs.com/luogankun/p/4209017.html 正在准备做Spark SQL external data source与关系型数据库交互的部分 ...

  3. Sqoop2环境搭建

    正在准备做Spark SQL external data source与关系型数据库交互的部分,参考下Sqoop2是如何操作关系型数据库的. 下载地址:http://archive.cloudera. ...

  4. 大数据系列(3)——Hadoop集群完全分布式坏境搭建

    前言 上一篇我们讲解了Hadoop单节点的安装,并且已经通过VMware安装了一台CentOS 6.8的Linux系统,咱们本篇的目标就是要配置一个真正的完全分布式的Hadoop集群,闲言少叙,进入本 ...

  5. 大数据系列(1)——Hadoop集群坏境搭建配置

    前言 关于时下最热的技术潮流,无疑大数据是首当其中最热的一个技术点,关于大数据的概念和方法论铺天盖地的到处宣扬,但其实很多公司或者技术人员也不能详细的讲解其真正的含义或者就没找到能被落地实施的可行性方 ...

  6. Sqoop2入门之导入关系型数据库数据到HDFS上(sqoop2-1.99.4版本)

    sqoop2-1.99.4和sqoop2-1.99.3版本操作略有不同:新版本中使用link代替了老版本的connection,其他使用类似. sqoop2-1.99.4环境搭建参见:Sqoop2环境 ...

  7. 0基础搭建Hadoop大数据处理-集群安装

    经过一系列的前期环境准备,现在可以开始Hadoop的安装了,在这里去apache官网下载2.7.3的版本 http://www.apache.org/dyn/closer.cgi/hadoop/com ...

  8. CDH 6.0.1 集群搭建 「Before install」

    从这一篇文章开始会有三篇文章依次介绍集群搭建 「Before install」 「Process」 「After install」 继上一篇使用 docker 部署单机 CDH 的文章,当我们使用 d ...

  9. Online Judge(OJ)搭建(第一版)

    搭建 OJ 需要的知识(重要性排序): Java SE(Basic Knowledge, String, FileWriter, JavaCompiler, URLClassLoader, Secur ...

随机推荐

  1. windows下React-native 环境搭建

    公司决定试水react-native,mac审批还没下来,没办法,先用windows硬着头皮上吧. 参考文章: React Native 中文网官方文档 史上最全Windows版本搭建安装React ...

  2. 有一个小效果而引出的appendTo()函数。

    在公司做项目的时候,始终不了解信息逐条向上滚的动画效果,后来查阅相关资料,终于明白了,在这个过程中,让我对appendTo这个函数有了一个全新的认识.话不多说,首先是demo: <!DOCTYP ...

  3. 使用原生JS封装一个ajax

    function ajax(data){ //第一步,创建XHR对象 var xhr = null; if(window.XMLHttpRequest){ xhr = new XMLHttpReque ...

  4. iOS 事件处理之UIResponder简介

    在用户使用app过程中,会产生各种各样的事件 iOS中的事件可以分为3大类型:触摸事件.加速计事件.远程控制事件 在iOS中不是任何对象都能处理事件,只有继承了UIResponder的对象才能接收并处 ...

  5. HTML5学习笔记四 HTML文本格式化

    HTML 格式化标签 HTML 使用标签<b> 与<i> 对输出的文本进行格式, 如:粗体 or 斜体 这些HTML标签被称为格式化标签 通常标签 <strong> ...

  6. 设置Hyper-V下Linux机器的网卡(转载)

    今天需要再安装一台CentOS虚拟机,一时心血来潮,选择了一个basic server而不是之前选择的Desktop.安装之后依旧没有网卡,意料之中,呵呵.没有network,没有ifcfg-eth0 ...

  7. python的基础知识

    Python文件命名时不要有中文,不然在dos中不能执行 D:\Program Files\Py>Python hellyy.pyYear:2016Month(1-12):1Day(1-31): ...

  8. 【转】JavaScript中的原型和继承

    请在此暂时忘记之前学到的面向对象的一切知识.这里只需要考虑赛车的情况.是的,就是赛车. 最近我正在观看 24 Hours of Le Mans ,这是法国流行的一项赛事.最快的车被称为 Le Mans ...

  9. Oracle RAMN 备份解决方案一例

    以前在博客里面介绍了RMAN备份脚本一列分享,通过RMAN备份到本地路径,然后通过FTP将备份文件上传到FTP服务器. 下面简单介绍另外一例RMAN备份解决方案,下面是我简单画的一个图(很少画图,感觉 ...

  10. SQL Server修改数据库对象所有者(Owner)浅析

    在SQL Server数据库中如何修改数据库对象(表.视图.存储过程..)的所有者(Owner)呢?一般我们可以使用系统提供的系统存储过程sp_changeobjectowner来修改. 我们先看看s ...