Sqoop-将MySQL数据导入到hive orc表

sqoop创建并导入数据到hive orc表

sqoop import \

--connect jdbc:mysql://localhost:3306/spider \

--username root --password 1234qwer \

--table org_ic_track --driver com.mysql.jdbc.Driver \

--create-hcatalog-table \

--hcatalog-database spider_tmp \

--hcatalog-table org_ic_track \

--hcatalog-partition-keys batch \

--hcatalog-partition-values  \

--hcatalog-storage-stanza 'stored as orc tblproperties ("orc.compress"="SNAPPY")' \

-m

查看表结构

CREATE TABLE `org_ic_track`(

`id` int,

`info_id` int,

`company` varchar(),

`company_url` varchar(),

`invest_date` varchar(),

`invested_company` varchar(),

`invested_ratio` varchar(),

`update_time` string)

PARTITIONED BY (

`batch` string)

ROW FORMAT SERDE

'org.apache.hadoop.hive.ql.io.orc.OrcSerde'

STORED AS INPUTFORMAT

'org.apache.hadoop.hive.ql.io.orc.OrcInputFormat'

OUTPUTFORMAT

'org.apache.hadoop.hive.ql.io.orc.OrcOutputFormat'

LOCATION

'hdfs://hadoop1:8020/home/hive/warehouse/spider_tmp.db/org_ic_track'

TBLPROPERTIES (

'orc.compress'='SNAPPY',

'transient_lastDdlTime'='')

sqoop导入数据到已存在的hive orc表

sqoop import \

--connect jdbc:mysql://localhost:3306/spider \

--username root --password 1234qwer \

--table org_ic_track --driver com.mysql.jdbc.Driver \

--hcatalog-database spider_tmp \

--hcatalog-table org_ic_track \

--hcatalog-partition-keys batch \

--hcatalog-partition-values  \

-m

sqoop导入数据（query）到已存在的hive orc表

sqoop import \

--connect jdbc:mysql://localhost:3306/spider \

--username root --password 1234qwer \

--query "select * from org_ic_track where update_time between '2019-04-01 21:16:04' and '2019-04-01 21:16:05' and \$CONDITIONS" \

--driver com.mysql.jdbc.Driver \

--hcatalog-database spider_tmp \

--hcatalog-table org_ic_track \

--hcatalog-partition-keys batch \

--hcatalog-partition-values  \

-m

字段说明

connect    JDBC连接信息

username    JDBC验证用户名

password    JDBC验证密码

table    要导入的源表名

driver    指定JDBC驱动

create-hcatalog-table    指定需要创建表，若不指定则默认不创建，注意若指定创建的表已存在将会报错

hcatalog-database    目标库

hcatalog-table    目标表名

hcatalog-storage-stanza    指定存储格式，该参数值会拼接到create table的命令中。默认：stored as rcfile

hcatalog-partition-keys    指定分区字段，多个字段请用逗号隔开（hive-partition-key的加强版）

hcatalog-partition-values    指定分区值，多分区值请用逗号隔开（hive-partition-value的加强）

注：若不指定字段类型，MySQL中的varchar数据抽取至hive中也会是varchar类型，但是varchar类型在hive中操作会出现各种问题

　　1.抽取时长文本、含有特殊字符的文本抽取不全

　　2.hive操作orc表varchar类型的字段造成乱码

解决：抽取数据时指定字段类型

-map-column-hive company=String,company_url=String

Sqoop-将MySQL数据导入到hive orc表的更多相关文章

使用 sqoop 将mysql数据导入到hive表（import）
Sqoop将mysql数据导入到hive表中先在mysql创建表 CREATE TABLE `sqoop_test` ( `id` ) DEFAULT NULL, `name` varchar() ...
使用sqoop将mysql数据导入到hive中
首先准备工具环境:hadoop2.7+mysql5.7+sqoop1.4+hive3.1 准备一张数据库表: 接下来就可以操作了... 一.将MySQL数据导入到hdfs 首先我测试将zhaopin表 ...
使用sqoop把mysql数据导入hive
使用sqoop把mysql数据导入hive export HADOOP_COMMON_HOME=/hadoop export HADOOP_MAPRED_HOME=/hadoop cp /hive ...
Sqoop将mysql数据导入hbase的血与泪
Sqoop将mysql数据导入hbase的血与泪(整整搞了大半天) 版权声明:本文为yunshuxueyuan原创文章.如需转载请标明出处: https://my.oschina.net/yunsh ...
使用 sqoop 将mysql数据导入到hdfs（import）
Sqoop 将mysql 数据导入到hdfs(import) 1.创建mysql表 CREATE TABLE `sqoop_test` ( `id` ) DEFAULT NULL, `name` va ...
python脚本用sqoop把mysql数据导入hive
转:https://blog.csdn.net/wulantian/article/details/53064123 用python把mysql数据库的数据导入到hive中,该过程主要是通过pytho ...
Logstash学习之路（四）使用Logstash将mysql数据导入elasticsearch（单表同步、多表同步、全量同步、增量同步）
一.使用Logstash将mysql数据导入elasticsearch 1.在mysql中准备数据: mysql> show tables; +----------------+ | Table ...
sqoop将mysql数据导入hbase、hive的常见异常处理
原创不易,如需转载,请注明出处https://www.cnblogs.com/baixianlong/p/10700700.html,否则将追究法律责任!!! 一.需求: 1.将以下这张表(test_ ...
使用sqoop将mysql数据导入到hadoop
hadoop的安装配置这里就不讲了. Sqoop的安装也很简单. 完成sqoop的安装后,可以这样测试是否可以连接到mysql(注意:mysql的jar包要放到 SQOOP_HOME/lib 下): ...

随机推荐

JavaScript进阶之路初学者的开始
一:写在前面的问题和话一个javascript初学者的进阶之路! 背景:3年后端(ASP.NET)工作经验,javascript水平一般般,前端水平一般般.学习资料:犀牛书. 如有误导,或者错误的地 ...
angualar入门学习-- 作用域$scope
作用域$scope: 是ng执行环境,视图与controller之间的胶水,双向绑定的基础 $scope提供里$watch方法,监听数据模型变化 $scope提供里$apply方法,将数据模型变化更新 ...
160718、jsoup-1.8.1.jar操作html
导入jsoup-1.8.1.jarimport java.io.IOException;import org.jsoup.Connection;import org.jsoup.Jsoup;impor ...
Less-css基础扩展
//扩展Extend less的伪类,合并了选择器,放在与它引用匹配的选择器上 Use Method:以在study上扩展test的样式为例 .test{ color:#000000; font-si ...
php 汉字验证码
代码: captcha.php <?php //实现简单的验证码 //session_start session_start(); //画布 $image = imagecreatetrueco ...
墨菲定律（Murphy's Law）
https://baike.baidu.com/item/墨菲定律/746284?fr=aladdin 墨菲定律是一种心理学效应,是由爱德华·墨菲(Edward A. Murphy)提出的. 主要内 ...
link options and how g++ is invoked gcc g++
yum install gcc yum install gcc-c++ yum reinstall gcc gcc-c++ Downloading packages:(1/2): gcc-c++-4. ...
IO流入门-第三章-FileInputStream_FileOutputStream复制
利用FileInputStream和FileOutputStreamj进行复制粘贴 /* 文件复制粘贴 */ import java.io.*; public class FileInput_Outp ...
聊聊 Java 中日期的几种常见操作 —— 取值、转换、加减、比较
Java 的开发过程中免不了与 Date 类型纠缠,准备总结一下项目经常使用的日期相关操作,JDK 版本 1.7,如果能够帮助大家节约那么几分钟起身活动一下,去泡杯咖啡,便是极好的,嘿嘿.当然,我只提 ...
PHP数组遍历详解
一.PHP数组简介 1.PHP数组的分类按照下标的不同分为关联数组和索引数组①索引数组:下标从0开始依次增长②关联数组:下标为字符串格式,每个下标字符串与数组的值一一对应,(有点像对象的键值对) 下 ...

Sqoop-将MySQL数据导入到hive orc表

sqoop创建并导入数据到hive orc表

sqoop导入数据到已存在的hive orc表

sqoop导入数据（query）到已存在的hive orc表

字段说明

Sqoop-将MySQL数据导入到hive orc表的更多相关文章

随机推荐

热门专题