Hadoop基础-通过IO流操作HDFS

　　　　　　　　　　　　　　　　　　Hadoop基础-通过IO流操作HDFS

　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　　作者：尹正杰

一.上传文件

 /*

 @author :yinzhengjie

 Blog:http://www.cnblogs.com/yinzhengjie/tag/Hadoop%E7%94%9F%E6%80%81%E5%9C%88/

 EMAIL:y1053419035@qq.com

 */

 package hdfs.yinzhengjie.org.cn;

 import org.apache.hadoop.conf.Configuration;

 import org.apache.hadoop.fs.*;

 import org.apache.hadoop.io.IOUtils;

 import java.io.File;

 import java.io.FileInputStream;

 import java.net.URI;

 public class HdfsClient {

     public static void main(String[] args) throws Exception {

         putFileToHDFS();

     }

     public static void putFileToHDFS() throws Exception{

         //配合Hadoop的环境变量，如果没有配置可能会抛异常：“ERROR util.Shell: Failed to locate the winutils binary in the hadoop binary path”，还有一件事就是你的HADOOP_HOME的bin目录下必须得有winutils.exe

          System.setProperty("hadoop.home.dir", "D:\\yinzhengjie\\softwares\\hadoop-2.7.3");

          //创建配置信息对象

         Configuration conf = new Configuration();

         //获取文件系统，需要传入hdfs的链接地址，conf对象，以及操作的用户名

        FileSystem fs = FileSystem.get(new URI("hdfs://node105.yinzhengjie.org.cn:8020"),conf,"hdfs");

         //创建输入流

         FileInputStream inStream = new FileInputStream(new File("D:\\yinzhengjie\\data\\yinzhengjie.txt"));

         //获取输出路径

         String putFileName = "hdfs://node105.yinzhengjie.org.cn:8020/user/yinzhengjie/2018-11-04.txt";

         Path writePath = new Path(putFileName);

         //创建输出流

         FSDataOutputStream outStream = fs.create(writePath);

         //流对接

         try{

             IOUtils.copyBytes(inStream, outStream, 4096, false);

         }catch(Exception e){

             e.printStackTrace();

         }finally{

             //关闭流，释放资源

             IOUtils.closeStream(inStream);

             IOUtils.closeStream(outStream);

         }

     }

 }

二.下载文件

 /*

 @author :yinzhengjie

 Blog:http://www.cnblogs.com/yinzhengjie/tag/Hadoop%E7%94%9F%E6%80%81%E5%9C%88/

 EMAIL:y1053419035@qq.com

 */

 package hdfs.yinzhengjie.org.cn;

 import org.apache.hadoop.conf.Configuration;

 import org.apache.hadoop.fs.FSDataInputStream;

 import org.apache.hadoop.fs.FileSystem;

 import org.apache.hadoop.fs.Path;

 import org.apache.hadoop.io.IOUtils;

 import java.io.File;

 import java.io.FileOutputStream;

 import java.net.URI;

 public class HdfsClient {

     public static void main(String[] args) throws Exception {

         getFileToHDFS();

     }

     public static void getFileToHDFS() throws Exception{

         //配合Hadoop的环境变量，如果没有配置可能会抛异常：“ERROR util.Shell: Failed to locate the winutils binary in the hadoop binary path”，还有一件事就是你的HADOOP_HOME的bin目录下必须得有winutils.exe

          System.setProperty("hadoop.home.dir", "D:\\yinzhengjie\\softwares\\hadoop-2.7.3");

          //创建配置信息对象

         Configuration conf = new Configuration();

         //获取文件系统，需要传入hdfs的链接地址，conf对象，以及操作的用户名

        FileSystem fs = FileSystem.get(new URI("hdfs://node105.yinzhengjie.org.cn:8020"),conf,"hdfs");

         //获取读取文件路径

         String filename = "hdfs://node105.yinzhengjie.org.cn:8020/user/yinzhengjie/2018-11-04.txt";

         //创建读取path

         Path readPath = new Path(filename);

         //创建建输入流

         FSDataInputStream inStream = fs.open(readPath);

         //创建输出流,指定本地路径

         FileOutputStream fos = new FileOutputStream(new File("D:\\yinzhengjie\\data\\output.txt"));

         try{

             //流对接输出到控制台

 //            IOUtils.copyBytes(inStream, System.out, 4096, false);

             //流对考输出到本地磁盘

             IOUtils.copyBytes(inStream,fos, conf);

         }catch(Exception e){

             e.printStackTrace();

         }finally{

             //释放资源

             IOUtils.closeStream(inStream);

             IOUtils.closeStream(fos);

             fos.close();

         }

     }

 }

三.定位读取文件

 /*

 @author :yinzhengjie

 Blog:http://www.cnblogs.com/yinzhengjie/tag/Hadoop%E7%94%9F%E6%80%81%E5%9C%88/

 EMAIL:y1053419035@qq.com

 */

 package hdfs.yinzhengjie.org.cn;

 import org.apache.hadoop.conf.Configuration;

 import org.apache.hadoop.fs.FSDataInputStream;

 import org.apache.hadoop.fs.FileSystem;

 import org.apache.hadoop.fs.Path;

 import org.apache.hadoop.io.IOUtils;

 import java.io.FileOutputStream;

 import java.net.URI;

 public class HdfsClient {

     public static void main(String[] args) throws Exception {

         readFileSeek1();

         readFileSeek2();

     }

     //读取第一个块大小，128M

     public static void readFileSeek1() throws Exception{

         //配合Hadoop的环境变量，如果没有配置可能会抛异常：“ERROR util.Shell: Failed to locate the winutils binary in the hadoop binary path”，还有一件事就是你的HADOOP_HOME的bin目录下必须得有winutils.exe

          System.setProperty("hadoop.home.dir", "D:\\yinzhengjie\\softwares\\hadoop-2.7.3");

          //创建配置信息对象

         Configuration conf = new Configuration();

         //获取文件系统，需要传入hdfs的链接地址，conf对象，以及操作的用户名

        FileSystem fs = FileSystem.get(new URI("hdfs://node105.yinzhengjie.org.cn:8020"),conf,"hdfs");

         //获取输入流路径

         Path path = new Path("hdfs://node105.yinzhengjie.org.cn:8020//yinzhengjie/cloudera-manager.tar.gz");

         //打开输入流

         FSDataInputStream fis = fs.open(path);

         //创建输出流

         FileOutputStream fos = new FileOutputStream("D:\\yinzhengjie\\data\\cloudera-manager-1.tar.gz");

         //定义缓冲区大小是1024

         byte[] buf = new byte[1024];

         //读取一个128M的文件

         for (int i = 0; i < 128 * 1024; i++) {

             //将数据从输入流读出然后在写入输出流。

             fis.read(buf);

             fos.write(buf);

         }

         //关闭流

         IOUtils.closeStream(fis);

         IOUtils.closeStream(fos);

     }

     //将128M后续的大小都读取出来

     public static void readFileSeek2() throws Exception{

         //配合Hadoop的环境变量，如果没有配置可能会抛异常：“ERROR util.Shell: Failed to locate the winutils binary in the hadoop binary path”，还有一件事就是你的HADOOP_HOME的bin目录下必须得有winutils.exe

         System.setProperty("hadoop.home.dir", "D:\\yinzhengjie\\softwares\\hadoop-2.7.3");

         //创建配置信息对象

         Configuration conf = new Configuration();

         //获取文件系统，需要传入hdfs的链接地址，conf对象，以及操作的用户名

         FileSystem fs = FileSystem.get(new URI("hdfs://node105.yinzhengjie.org.cn:8020"),conf,"hdfs");

         //获取输入流路径

         Path path = new Path("hdfs://node105.yinzhengjie.org.cn:8020//yinzhengjie/cloudera-manager.tar.gz");

         //打开输入流

         FSDataInputStream fis = fs.open(path);

         //创建输出流

         FileOutputStream fos = new FileOutputStream("D:\\yinzhengjie\\data\\cloudera-manager-2.tar.gz");

         //定位偏移量（第二块的首位,1024*1024就是1M，也就是说他的起始位置是从128M开始的！）

         fis.seek(1024 * 1024 * 128);

         //流对接

         IOUtils.copyBytes(fis, fos, 1024);

         //关闭资源

         IOUtils.closeStream(fis);

         IOUtils.closeStream(fos);

     }

 }

 /**

  *    将数据写入到本地后，可以使用cmd窗口进入到“D:\yinzhengjie\data”目录中，并执行：D:\yinzhengjie\data>type cloudera-manager-2.tar.gz >> cloudera-manager-1.tar.gz

  * 之后你可以拿到完整的数据，也可以解压该文件的详细信息。

  */

Hadoop基础-通过IO流操作HDFS的更多相关文章

io 流操作hdfs
hdfs 文件上传本地 --------> 文件系统对象 --------> hdfs 文件系统输入流 ...
Hadoop基础-MapReduce的Join操作
Hadoop基础-MapReduce的Join操作作者:尹正杰版权声明:原创作品,谢绝转载!否则将追究法律责任. 一.连接操作Map端Join(适合处理小表+大表的情况) no001 no002 ...
java基础之IO流（二）之字符流
java基础之IO流(二)之字符流字符流,顾名思义,它是以字符为数据处理单元的流对象,那么字符流和字节流之间的关系又是如何呢? 字符流可以理解为是字节流+字符编码集额一种封装与抽象,专门设计用来读写 ...
java基础之IO流（一）字节流
java基础之IO流(一)之字节流 IO流体系太大,涉及到的各种流对象,我觉得很有必要总结一下. 那什么是IO流,IO代表Input.Output,而流就是原始数据源与目标媒介的数据传输的一种抽象.典 ...
Java IO流操作汇总： inputStream 和 outputStream【转】
我们在进行Android java 开发的时候,经常会遇到各种IO流操作.IO流操作一般分为两类:字符流和字节流.以“Reader”结尾都是字符流,操作的都是字符型的数据:以“Stream”结尾的都是 ...
IO流----操作文件的9种方法代码实现
IO流----操作文件的9种方法代码实现: 1:使用字节流读写数据: 四种方式: method1: 每次读写一个字节,边读边写: /* * 复制文本文件. * * 数据源:从哪里来 ...
Java基础之IO流整理
Java基础之IO流 Java IO流使用装饰器设计模式,因此如果不能理清其中的关系的话很容易把各种流搞混,此文将简单的几个流进行梳理,后序遇见新的流会继续更新(本文下方还附有xmind文件链接) 抽 ...
python IO流操作
python IO流操作学习完本篇,你将会独立完成实现操作系统中文件及文件目录的拷贝功能. 将目标图片拷贝到指定的目录中实现一个自动阅卷程序, Right.txt保存正确答案,xx(学生姓名). ...
Hadoop学习(2)-java客户端操作hdfs及secondarynode作用
首先要在windows下解压一个windows版本的hadoop 然后在配置他的环境变量,同时要把hadoop的share目录下的hadoop下的相关jar包拷贝到esclipe 然后Build Pa ...

随机推荐

ContOS安装配置MySQL，redis
MySQL(MariaDB) 一,说明 MariaDB数据库管理系统是MySQL的一个分支,主要由开源社区在维护,采用GPL授权许可.开发这个分支的原因之一是:甲骨文公司收购了MySQL后,有将MyS ...
Codeforces963C Frequency of String 【字符串】【AC自动机】
题目大意: 给一个串s和很多模式串,对每个模式串求s的一个最短的子串使得这个子串中包含至少k个该模式串. 题目分析: 均摊分析,有sqrt(n)种长度不同的模式串,所以有关的串只有msqrt(n)种. ...
sublime3添加verilog自动补全代码段
前言 sublime默认的verilog自动补全十分垃圾,不过提供了代码段这个功能,你可以自己写个重用率高的代码段减轻工作量.写个模板当tb也很爽啦. 流程 1.打开user文件夹,创建verilog ...
【AGC002F】Leftmost Ball DP 数学
题目大意有$n$种颜色的球,每种$m$个.现在zjt把这$nm$个球排成一排,然后把每种颜色的最左边的球染成第$n+1$种颜色.求最终的颜色序列有多少种,对\(1000000007\ ...
Ionic开发遇到的坑整理
1.修改tabs页的图标,关键是 outline 在使用自定义图标的时候,需要修改 /theme/icons.scss 文件,但是如何定义选中前后的分别使用哪个图标呢定义选中前的状态 .ion-io ...
MT【259】2016天津压轴题之最佳逼近
(2016天津压轴题)设函数$f(x)=(x-1)^3-ax-b,x\in R$, 其中$a,b\in R$(1)求$f(x)$的单调区间.(2)若$f(x)$存在极值点$x_0$,且$f(x_1)= ...
Linux内核进程
公司数据库机器报警进程数高于1500,登进去ps命令看了一下,这么多进程并不认识,就在网上找了一些关于linux进程的资料,如下: idle 进程的pid=0,是由系统自动创建的第一个进程,也是唯一的 ...
【BZOJ1299】巧克力棒（博弈论，线性基）
[BZOJ1299]巧克力棒(博弈论,线性基) 题面 BZOJ 题解 $Nim$博弈的变形形式. 显然,如果我们不考虑拿巧克力棒出来的话,这就是一个裸的$Nim$博弈. 但是现在可以加入巧克力 ...
【BZOJ4868】[六省联考2017]期末考试（贪心）
[BZOJ4868][六省联考2017]期末考试(贪心) 题面 BZOJ 洛谷题解显然最终的答案之和最后一个公布成绩的课程相关. 枚举最后一天的日期,那么维护一下前面有多少天可以向后移,后面总共需 ...
SElinux解决web网站无法访问
SElinux解决web网站无法访问工具/原料centos 6.5系统httpd web服务器 SELinux 设置为enforcing:强制模式,代表 SELinux 运作中方法/步骤1. 1se ...

Hadoop基础-通过IO流操作HDFS

Hadoop基础-通过IO流操作HDFS的更多相关文章

随机推荐

热门专题