转载请注明出处:http://www.cnblogs.com/zhengrunjian/p/4527220.html

所有源码在github上,https://github.com/lastsweetop/styhadoop

1简介

codec其实就是coder和decoder两个单词的词头组成的缩略词。CompressionCodec定义了压缩和解压接口,我们这里讲的codec就是实现了CompressionCodec接口的一些压缩格式的类,下面是这些类的列表:

2使用CompressionCodes解压缩

CompressionCodec有两个方法可以方便的压缩和解压。
压缩:通过createOutputStream(OutputStream out)方法获得CompressionOutputStream对象
解压:通过createInputStream(InputStream in)方法获得CompressionInputStream对象
压缩的示例代码
  1. package com.sweetop.styhadoop;
  2. import org.apache.hadoop.conf.Configuration;
  3. import org.apache.hadoop.io.IOUtils;
  4. import org.apache.hadoop.io.compress.CompressionCodec;
  5. import org.apache.hadoop.io.compress.CompressionOutputStream;
  6. import org.apache.hadoop.util.ReflectionUtils;
  7. /**
  8. * Created with IntelliJ IDEA.
  9. * User: lastsweetop
  10. * Date: 13-6-25
  11. * Time: 下午10:09
  12. * To change this template use File | Settings | File Templates.
  13. */
  14. public class StreamCompressor {
  15. public static void main(String[] args) throws Exception {
  16. String codecClassName = args[0];
  17. Class<?> codecClass = Class.forName(codecClassName);
  18. Configuration conf = new Configuration();
  19. CompressionCodec codec = (CompressionCodec) ReflectionUtils.newInstance(codecClass, conf);
  20. CompressionOutputStream out = codec.createOutputStream(System.out);
  21. IOUtils.copyBytes(System.in, out, 4096, false);
  22. out.finish();
  23. }
  24. }
从命令行接受一个CompressionCodec实现类的参数,然后通过ReflectionUtils把实例化这个类,调用CompressionCodec的接口方法对标准输出流进行封装,封装成一个压缩流,通过IOUtils类的copyBytes方法把标准输入流拷贝到压缩流中,最后调用CompressionCodec的finish方法,完成压缩。
再来看下命令行:
  1. echo "Hello lastsweetop" | ~/hadoop/bin/hadoop com.sweetop.styhadoop.StreamCompressor  org.apache.hadoop.io.compress.GzipCodec | gunzip -

使用GzipCodec类来压缩“Hello lastsweetop”,然后再通过gunzip工具解压。

我们来看一下输出:
  1. [exec] 13/06/26 20:01:53 INFO util.NativeCodeLoader: Loaded the native-hadoop library
  2. [exec] 13/06/26 20:01:53 INFO zlib.ZlibFactory: Successfully loaded & initialized native-zlib library
  3. [exec] Hello lastsweetop

3使用CompressionCodecFactory解压缩

如果你想读取一个被压缩的文件的话,首先你得先通过扩展名判断该用哪种codec,可以看下【hadoop】——压缩工具比较中得对应关系。
当然有更简便得办法,CompressionCodecFactory已经帮你把这件事做了,通过传入一个Path调用它得getCodec方法,即可获得相应得codec。我们来看下代码
  1. package com.sweetop.styhadoop;
  2. import org.apache.hadoop.conf.Configuration;
  3. import org.apache.hadoop.fs.FileSystem;
  4. import org.apache.hadoop.fs.Path;
  5. import org.apache.hadoop.io.IOUtils;
  6. import org.apache.hadoop.io.compress.CompressionCodec;
  7. import org.apache.hadoop.io.compress.CompressionCodecFactory;
  8. import java.io.IOException;
  9. import java.io.InputStream;
  10. import java.io.OutputStream;
  11. import java.net.URI;
  12. /**
  13. * Created with IntelliJ IDEA.
  14. * User: lastsweetop
  15. * Date: 13-6-26
  16. * Time: 下午10:03
  17. * To change this template use File | Settings | File Templates.
  18. */
  19. public class FileDecompressor {
  20. public static void main(String[] args) throws Exception {
  21. String uri = args[0];
  22. Configuration conf = new Configuration();
  23. FileSystem fs = FileSystem.get(URI.create(uri), conf);
  24. Path inputPath = new Path(uri);
  25. CompressionCodecFactory factory = new CompressionCodecFactory(conf);
  26. CompressionCodec codec = factory.getCodec(inputPath);
  27. if (codec == null) {
  28. System.out.println("No codec found for " + uri);
  29. System.exit(1);
  30. }
  31. String outputUri = CompressionCodecFactory.removeSuffix(uri, codec.getDefaultExtension());
  32. InputStream in = null;
  33. OutputStream out = null;
  34. try {
  35. in = codec.createInputStream(fs.open(inputPath));
  36. out = fs.create(new Path(outputUri));
  37. IOUtils.copyBytes(in,out,conf);
  38. } finally {
  39. IOUtils.closeStream(in);
  40. IOUtils.closeStream(out);
  41. }
  42. }
  43. }

注意看下removeSuffix方法,这是一个静态方法,它可以将文件的后缀去掉,然后我们将这个路径做为解压的输出路径。CompressionCodecFactory能找到的codec也是有限的,默认只有三种org.apache.hadoop.io.compress.GzipCodec,org.apache.hadoop.io.compress.BZip2Codec,org.apache.hadoop.io.compress.DefaultCodec,如果想添加其他的codec你需要更改io.compression.codecs属性,并注册codec。

 

4原生库

现在越来越多原生库的概念,hdfs的codec也不例外,原生库可以极大的提升性能比如gzip的原生库解压提高50%,压缩提高10%,但不是所有codec都有原生库的,而一些codec只有原生库。我们来看下列表:
linux下,hadoop以前提前编译好了32位的原生库和64位的原生库,我们看下:
  1. [hadoop@namenode native]$pwd
  2. /home/hadoop/hadoop/lib/native
  3. [hadoop@namenode native]$ls -ls
  4. total 8
  5. 4 drwxrwxrwx 2 root root 4096 Nov 14  2012 Linux-amd64-64
  6. 4 drwxrwxrwx 2 root root 4096 Nov 14  2012 Linux-i386-32

如果是其他平台的话,你就需要自己编译了,详细步骤请看这里http://wiki.apache.org/hadoop/NativeHadoop

java原生库的路径可以通过java.library.path指定,在bin目录下,hadoop的启动脚本已经指定,如果你不用这个脚本,那么你就需要在你的程序中指定了,hadoop脚本中指定原生库路径的片段:
  1. if [ -d "${HADOOP_HOME}/build/native" -o -d "${HADOOP_HOME}/lib/native" -o -e "${HADOOP_PREFIX}/lib/libhadoop.a" ]; then
  2. if [ -d "$HADOOP_HOME/build/native" ]; then
  3. JAVA_LIBRARY_PATH=${HADOOP_HOME}/build/native/${JAVA_PLATFORM}/lib
  4. fi
  5. if [ -d "${HADOOP_HOME}/lib/native" ]; then
  6. if [ "x$JAVA_LIBRARY_PATH" != "x" ]; then
  7. JAVA_LIBRARY_PATH=${JAVA_LIBRARY_PATH}:${HADOOP_HOME}/lib/native/${JAVA_PLATFORM}
  8. else
  9. JAVA_LIBRARY_PATH=${HADOOP_HOME}/lib/native/${JAVA_PLATFORM}
  10. fi
  11. fi
  12. if [ -e "${HADOOP_PREFIX}/lib/libhadoop.a" ]; then
  13. JAVA_LIBRARY_PATH=${HADOOP_PREFIX}/lib
  14. fi
  15. fi

hadoop会去查找对应的原生库,并且自动加载,你不需要关心这些设置。但某些时候你不想使用原生库,比如调试一些bug的时候,那么可以通过hadoop.native.lib设置为false来实现。

如果你用原生库做大量的压缩和解压的话可以考虑用CodecPool,有点像连接池,这样你就无需频繁的去创建codec对象。
  1. package com.sweetop.styhadoop;
  2. import org.apache.hadoop.conf.Configuration;
  3. import org.apache.hadoop.io.IOUtils;
  4. import org.apache.hadoop.io.compress.CodecPool;
  5. import org.apache.hadoop.io.compress.CompressionCodec;
  6. import org.apache.hadoop.io.compress.CompressionOutputStream;
  7. import org.apache.hadoop.io.compress.Compressor;
  8. import org.apache.hadoop.util.ReflectionUtils;
  9. /**
  10. * Created with IntelliJ IDEA.
  11. * User: lastsweetop
  12. * Date: 13-6-27
  13. * Time: 上午11:53
  14. * To change this template use File | Settings | File Templates.
  15. */
  16. public class PooledStreamCompressor {
  17. public static void main(String[] args) throws Exception {
  18. String codecClassName = args[0];
  19. Class<?> codecClass = Class.forName(codecClassName);
  20. Configuration conf = new Configuration();
  21. CompressionCodec codec = (CompressionCodec) ReflectionUtils.newInstance(codecClass, conf);
  22. Compressor compressor = null;
  23. try {
  24. compressor = CodecPool.getCompressor(codec);
  25. CompressionOutputStream out = codec.createOutputStream(System.out, compressor);
  26. IOUtils.copyBytes(System.in, out, 4096, false);
  27. out.finish();
  28. } finally {
  29. CodecPool.returnCompressor(compressor);
  30. }
  31. }
  32. }

代码比较容易理解,通过CodecPool的getCompressor方法获得Compressor对象,该方法需要传入一个codec,然后Compressor对象在createOutputStream中使用,使用完毕后再通过returnCompressor放回去。

输出结果如下:
  1. [exec] 13/06/27 12:00:06 INFO util.NativeCodeLoader: Loaded the native-hadoop library
  2. [exec] 13/06/27 12:00:06 INFO zlib.ZlibFactory: Successfully loaded & initialized native-zlib library
  3. [exec] 13/06/27 12:00:06 INFO compress.CodecPool: Got brand-new compressor
  4. [exec] Hello lastsweetop    

    转载请注明出处:http://blog.csdn.net/lastsweetop/article/details/9173061

【hadoop】——HDFS解压缩实现的更多相关文章

  1. [转]hadoop hdfs常用命令

    FROM : http://www.2cto.com/database/201303/198460.html hadoop hdfs常用命令   hadoop常用命令:  hadoop fs  查看H ...

  2. Hadoop HDFS安装、环境配置

    hadoop安装 进入Xftp将hadoop-2.7.3.tar.gz 复制到自己的虚拟机系统下的放软件的地方,我的是/soft/software 在虚拟机系统装软件文件里,进行解压缩并重命名 进入p ...

  3. Hadoop HDFS常用操作命令

    hadoop常用命令:hadoop fs查看Hadoop HDFS支持的所有命令 hadoop fs –ls列出目录及文件信息 hadoop fs –lsr循环列出目录.子目录及文件信息 hadoop ...

  4. 基于key/value+Hadoop HDFS 设计的存储系统的shell命令接口

    对于hadoop HDFS 中的全部命令进行解析(当中操作流程是自己的想法有不允许见欢迎大家指正) 接口名称 功能 操作流程 get 将文件拷贝到本地文件系统 . 假设指定了多个源文件,本地目的端必须 ...

  5. Hadoop HDFS 用户指南

    This document is a starting point for users working with Hadoop Distributed File System (HDFS) eithe ...

  6. Hadoop HDFS负载均衡

    Hadoop HDFS负载均衡 转载请注明出处:http://www.cnblogs.com/BYRans/ Hadoop HDFS Hadoop 分布式文件系统(Hadoop Distributed ...

  7. Hive:org.apache.hadoop.hdfs.protocol.NSQuotaExceededException: The NameSpace quota (directories and files) of directory /mydir is exceeded: quota=100000 file count=100001

    集群中遇到了文件个数超出限制的错误: 0)昨天晚上spark 任务突然抛出了异常:org.apache.hadoop.hdfs.protocol.NSQuotaExceededException: T ...

  8. Hadoop程序运行中的Error(1)-Error: org.apache.hadoop.hdfs.BlockMissingException

    15/03/18 09:59:21 INFO mapreduce.Job: Task Id : attempt_1426641074924_0002_m_000000_2, Status : FAIL ...

  9. Hadoop HDFS编程 API入门系列之HDFS_HA(五)

    不多说,直接上代码. 代码 package zhouls.bigdata.myWholeHadoop.HDFS.hdfs3; import java.io.FileInputStream;import ...

  10. Hadoop HDFS编程 API入门系列之简单综合版本1(四)

    不多说,直接上代码. 代码 package zhouls.bigdata.myWholeHadoop.HDFS.hdfs4; import java.io.IOException; import ja ...

随机推荐

  1. Java---Java的面试题(二)

    1 Switch能否用string做参数?在 Java 7 之前, switch 只能支持byte,short,char,int 或者其对应的封装类以及 Enum 类型.在JAVA 7中,String ...

  2. 泛函编程(30)-泛函IO:Free Monad-Monad生产线

    在上节我们介绍了Trampoline.它主要是为了解决堆栈溢出(StackOverflow)错误而设计的.Trampoline类型是一种数据结构,它的设计思路是以heap换stack:对应传统递归算法 ...

  3. HDU 5703 Desert 水题 找规律

    已知有n个单位的水,问有几种方式把这些水喝完,每天至少喝1个单位的水,而且每天喝的水的单位为整数.看上去挺复杂要跑循环,但其实上,列举几种情况之后就会发现是找规律的题了= =都是2的n-1次方,而且这 ...

  4. mysql 导入text 到数据库

    load data local infile 'f:/PhoneLocation_201601.327665.txt' into table sys_t_phone_area fields termi ...

  5. VirtualBox-Linux系统安装增强功能

    我们在安装之前,必须得先安装好它所需要的依赖包,不然安装过程必定会出现错误! 一.安装依赖包 #yum install kernel-headers #yum install kernel-devel ...

  6. ContentTools – 所见即所得(WYSIWYG)编辑器

    Content Tools是一个用于构建所见即所得编辑器(WYSIWYG)的 JavaScript 库.ContentTools 所见即所得的编辑器只需要几个简单的步骤就可以加入到任何的 HTML 页 ...

  7. 【精心推荐】几款极好的 JavaScript 文件上传插件

    文件上传功能作为网页重要的组成部分,几乎无处不在,从简单的单个文件上传到复杂的批量上传.拖放上传,需要开发者花费大量的时间和精力去处理,以期实现好用的上传功能.这篇文章向大家推荐几款很棒的 JavaS ...

  8. 总结CSS3新特性(Transition篇)

    CSS 过渡(transition), 是 CSS3 规范的一部分, 用来控制 CSS 属性的变化速率. 可以让属性的变化过程持续一段时间,而不是立即生效.比如,将元素的颜色从白色改为黑色,通常这个改 ...

  9. 微软正开发Office Reader和Office Lens

    据熟知微软Office计划的消息人士透露,微软目前正开发新Windows 8风格的Office应用程序,该应用程序代号被微软称为Office Reader,而为Windows Phone开发的应用程序 ...

  10. SharePoint 2013 Error - File names can't contain the following characters: & " ? < > # {} % ~ / \.

    错误截图: 错误信息: --------------------------- Message from webpage --------------------------- File names ...