Hive导出复杂数据到csv文件
工作中经常遇到使用Hive导出数据到文本文件供数据分析时使用。Hive导出复杂数据到csv等文本文件时,有时会遇到以下几个问题:
- 导出的数据只有数据没有列名。
- 导出的数据比较复杂时,如字符串内包含一些制表符、换行符等。直接导出后,其它程序无法对数据进行正常的分割。若直接使用管道符号和sed指令的话,会导致分列出错。
- 数据分析师使用数据时使用R语言,加载数据时如果一个字段只有单引号或双引号时,会导致后续数据读为一行。
- 导出数据时空值在文本显示为\N,不是NULL。
- hive导出的数据生成若干个000000_0,000001_0这样的文件,可读性比较差,需要手工去合并
针对上述几个问题采取以下解决方案:
- 导出的数据不包含列名,使用hive -e 'use mydb;SET hive.cli.print.header=true; SELECT * FROM t_test LIMIT 0'方式获取列名。若抓取的为多张表的字段,需要对查询语句进行相应的调整。
- 根据具体的情况设置合适的分隔符,我这里使用一般极少用到的符号 '|' 作为分隔符。
- 对于出现的单引号和双引号,在经过分析师沟通后,对这些无实际意义的一个字段只有单引号或双引号的字段置空。若有其它需求也可以根据具体情况进行替换。
- 使用sed指令对\N字段进行替换。根据具体情况,注意确保不修改到字符串中的\N。可以把'|\N|'替换为'|NULL|',行首行尾的数据也要考虑到。我这里由于其它字段不包含'\N',就简化处理了。
- 000000_0文件聚合使用脚本进行解决。
下面为一个具体的示例的shell脚本:
#!/bin/bash
mkdir -p /tmp/project_1010/project #初始化结果存放的目录
hive -e "use mydb;
insert overwrite local directory '/tmp/project_1010/t_test/' #指定该表初步查询结果存放的目录
ROW FORMAT DELIMITED FIELDS TERMINATED BY '|' #指定字段分隔符
select t.* from t_test t JOIN #查询语句
t_test1 t1
on t1.test_id = t.test_id;
"
# 生成表头,替换表头前的't_test.'字段,并写入最终的csv文件中
hive -e 'use mydb;SET hive.cli.print.header=true; SELECT * FROM t_test LIMIT 0' | sed -e 's/\t/|/g;s/t_test\.//g' > /tmp/project_1010/project/t_test.csv
cat /tmp/project_1010/t_test/* >> /tmp/project_1010/project/t_test.csv #把000000_0,000001_0这样的文件通过追加的方式,写入最终的csv文件中
sed -i 's/\\N/NULL/g' /tmp/project_1010/project/t_test.csv #使用sed处理最终的csv文件,根据需求进行替换
sed -i "s/|'|/|NULL|/g" /tmp/project_1010/project/t_test.csv
sed -i 's/|"|/|NULL|/g' /tmp/project_1010/project/t_test.csv
本脚本假设抓取项目project中t_test表的数据。考虑到需求的变动,每次生产的项目目录加一个日期后缀,如“project_1010”。一般一个项目会抓取对个表,针对每个表都会创建一个子目录存储生产的000000_0,000001_0等数据。示意图如下:
project_1010/
├── project #项目名
│ ├── t_test.csv
│ ├── t_test1.csv
├── t_test #抓取的t_test表数据
│ ├── 000000_0
│ └── 000001_0
├── t_test1 #抓取的t_test1数据
│ ├── 000000_0
│ └── 000001_0
先抓取每张需要的表的数据,最后统一汇总在project的目录下,最终的数据就存储在project目录下。
在实际的使用环境中,可以再写shell脚本和一个配置文件(包括项目名、抓取的表的列表、需要执行的查询语句)直接生成上述的脚本,不需要一个个的手动生成。
Hive导出复杂数据到csv文件的更多相关文章
- PHP导出数据到CSV文件函数 csv_export()
后台往往需要导出各种数据到 Excel文档中.通常我们是导出 .csv文件格式,PHP导出函数参考代码如下: /** * 导出数据到CSV文件 * * @param array $data 二维数组( ...
- PHP导出数据到CSV文件函数/方法
如果不清楚什么是CSV文件,可看如下文章介绍 CSV格式的是什么文件?CSV是什么的缩写? /** * 导出数据到CSV文件 * @param array $data 数据 * @param arr ...
- PHP导出数据到CSV文件
后台往往需要导出各种数据到 Excel文档中.通常我们是导出 .csv文件格式,PHP导出函数参考代码如下: /** * 导出数据到CSV文件 * * @param array $data 二维数组( ...
- CSV文件数据如何读取、导入、导出到新的CSV文件中以及CSV文件的创建
CSV文件数据如何读取.导入.导出到新的CSV文件中以及CSV文件的创建 一.csv文件的创建 (1)新建一个文本文档: 打开新建文本文档,进行编辑. 注意:关键字与关键字之间用英文半角逗号隔开.第一 ...
- mysql导出数据到csv文件
在日常工作中经常会遇见导出表中的数据到csv文件的操作,这里就简单总结一下导出的操作. 下面对csv文件的描述是摘录: 据RFC4180文档设置的,该文档全称Common Format and MIM ...
- PHP导出MySQL数据到Excel文件
PHP导出MySQL数据到Excel文件 转载 常会碰到需要从数据库中导出数据到Excel文件,用一些开源的类库,比如PHPExcel,确实比较容易实现,但对大量数据的支持很不好,很容易到达PHP内存 ...
- php导出百万数据到csv
<?php set_time_limit(0); // 设置超时 ini_set('memory_limit', '100M'); // 设置最大使用的内存 header("Conte ...
- C# 将List中的数据导入csv文件中
//http://www.cnblogs.com/mingmingruyuedlut/archive/2013/01/20/2849906.html C# 将List中的数据导入csv文件中 将数 ...
- python操作txt文件中数据教程[3]-python读取文件夹中所有txt文件并将数据转为csv文件
python操作txt文件中数据教程[3]-python读取文件夹中所有txt文件并将数据转为csv文件 觉得有用的话,欢迎一起讨论相互学习~Follow Me 参考文献 python操作txt文件中 ...
随机推荐
- BootKit病毒——“异鬼Ⅱ”的前世今生
七月底,一种名为"异鬼Ⅱ"的木马在全网大肆传播.一个多月过去了,风声渐渐平息,之前本来准备专门就这个木马写一篇博客的,结果拖到现在,幸好时间隔得还不算太久.闲话不多说,回到正题. ...
- js学习--变量作用域和作用域链
作为一名菜鸟的我,每天学点的感觉还是不错的.今天学习闭包的过程中看到作用域与作用域链这两个概念,我觉得作为一名有追求的小白,有必要详细了解下. 变量的作用域 就js变量而言,有全局变量和局部变量.这里 ...
- 一,ESP8266下载和刷固件
用自己的小板测试...... 安排上呢 一, ESP8266下载和刷固件(Lua开发----体验一下lua开发的魅力所在) 二, 控制一个灯亮灭 三, TCP服务器 四, TCP客户端 五, UDP ...
- 第4阶段——制作根文件系统之分析init_post()如何启动第1个程序(1)
本章学习如何启动第一个应用程序 1.在前面的分析中我们了解到,在init进程中内核挂接到根文件系统之后,会开始启动第一个应用程序: kernel_init函数代码如下: static int __in ...
- 团队作业8——第二次项目冲刺(Beta阶段)--第三天
一.Daily Scrum Meeting照片 二.燃尽图 三.项目进展 学号 成员 贡献比 201421123001 廖婷婷 16% 201421123002 翁珊 16% 201421123004 ...
- 201521123053《Java程序设计》第八周学习总结
1. 本周学习总结 1.1 以你喜欢的方式(思维导图或其他)归纳总结集合与泛型相关内容. 2. 书面作业 1.List中指定元素的删除(题目4-1) 1.1 实验总结 答:先贴上主要代码: priva ...
- 201521123093 java 第四周学习总结
1.平面作业 1.1 尝试使用思维导图总结有关继承的知识点. 1.2 使用常规方法总结其他上课内容. 答:1.类与方法的注释 2.super关键字代表的是父类,super.方法表示调用的是父类 2. ...
- 201521123085 《java程序设计》 第9周学习总结
1. 本周学习总结 1.1 以你喜欢的方式(思维导图或其他)归纳总结异常相关内容. 2. 书面作业 本次PTA作业题集异常 常用异常 题目5-1 1.1 截图你的提交结果(出现学号) 1.2 自己以前 ...
- Caused by: java.sql.BatchUpdateException: You have an error in your SQL syntax; check the manual tha
使用了数据库的关键字index,如果有类似的错误,看看自己有没有使用关键字!
- JPA 注解的CascadeType属性
cascade表示级联操作,在表之间的关系映射时用到 CascadeType.MERGE级联更新:若items属性修改了那么order对象保存时同时修改items里的对象.对应EntityManage ...