HDFS常用的Java Api详解

转自：http://blog.csdn.net/michaelwubo/article/details/50879832

一、使用Hadoop URL读取数据

package hadoop;

import java.io.InputStream;

import java.net.URL;

import org.apache.hadoop.fs.FsUrlStreamHandlerFactory;

import org.apache.hadoop.io.IOUtils;

public class URLCat {

    static {

        URL.setURLStreamHandlerFactory(new FsUrlStreamHandlerFactory());

    }

    public static void readHdfs(String url) throws Exception {

        InputStream in = null;

        try {

            in = new URL(url).openStream();

            IOUtils.copyBytes(in, System.out, 4096, false);

        } finally {

            IOUtils.closeStream(in);

        }

    }

    public static void main(String[] args) throws Exception {

        readHdfs("hdfs://192.168.49.131:9000/user/hadoopuser/input20120828/file01");

    }

}

其中，我使用到的jar包有：

hadoop-core的版本一定要和分布式环境上安装的hadoop版本保持一致，不然会报错：

12/09/11 14:18:59 INFO security.UserGroupInformation: JAAS Configuration already set up for Hadoop, not re-installing.
Exception in thread "main" java.lang.NoClassDefFoundError: org/apache/hadoop/thirdparty/guava/common/collect/LinkedListMultimap
at org.apache.hadoop.hdfs.SocketCache.<init>(SocketCache.java:48)
at org.apache.hadoop.hdfs.DFSClient.<init>(DFSClient.java:240)

分布式环境上安装的hadoop版本如下：

运行main方法，输出：hello world bye world 和hdfs中存储的文件信息是保持一致的：

二、使用FileSystem API 读取数据

package hadoop;

import java.io.IOException;

import java.io.InputStream;

import java.net.URI;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.FileSystem;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.IOUtils;

public class FileSystemCat {

    public static void readHdfs(String url) throws IOException {

        Configuration conf = new Configuration();

        FileSystem fs = FileSystem.get(URI.create(url), conf);

        InputStream in = null;

        try {

            in = fs.open(new Path(url));

            IOUtils.copyBytes(in, System.out, 4096, false);

        } finally {

            IOUtils.closeStream(in);

        }

    }

    public static void main(String[] args) throws IOException {

        readHdfs("hdfs://192.168.49.131:9000/user/hadoopuser/output20120828/part-00000");

    }

}

执行输出：

bye   2
hadoop   2
hello   2
world   2

三、创建目录

3.1 写数据 public boolean mkdirs(Path f) throws IOException 会按照客户端请求创建未存在的父目录

package hadoop;

import java.io.BufferedInputStream;

import java.io.FileInputStream;

import java.io.IOException;

import java.io.InputStream;

import java.io.OutputStream;

import java.net.URI;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.FileSystem;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.IOUtils;

import org.apache.hadoop.util.Progressable;

public class FileCopyWithProgress {

    public static void fileCopy(String localFile, String hdfsFile) throws IOException{

        InputStream in = new BufferedInputStream(new FileInputStream(localFile));

        Configuration conf = new Configuration();

        FileSystem fs = FileSystem.get(URI.create(hdfsFile),conf);

        OutputStream out  = fs.create(new Path(hdfsFile),new Progressable(){

            public void progress(){

                System.out.println("*");

            }

        });

        IOUtils.copyBytes(in, out, 4096,true);

    }

    public static void main(String[] args) throws IOException {

        fileCopy("D://heat2.txt", "hdfs://192.168.49.131:9000/user/hadoopuser/output20120911/");

    }

}

执行后会报错如下:

Exception in thread "main" org.apache.hadoop.security.AccessControlException: org.apache.hadoop.security.AccessControlException: Permission denied: user=libininfo, access=WRITE, inode="/user/hadoopuser":hadoopuser:supergroup:drwxr-xr-x

因为往hadoop写文件是权限不容许的，

解决方法：在hdfs-site.xml 中取消权限校验，即加入以下配置:

到服务器上修改hadoop的配置文件：conf/hdfs-core.xml, 找到 dfs.permissions 的配置项 , 将value值改为 false

再次运行，如果有以下报错：

Exception in thread "main" org.apache.hadoop.ipc.RemoteException: org.apache.hadoop.hdfs.server.namenode.SafeModeException: Cannot create file/user/hadoopuser/output20120911. Name node is in safe mode.
The reported blocks 6 has reached the threshold 0.9990 of total blocks 6. Safe mode will be turned off automatically in 5 seconds.

说明Hadoop的NameNode处在安全模式下，那什么是Hadoop的安全模式呢？
在分布式文件系统启动的时候，开始的时候会有安全模式，当分布式文件系统处于安全模式的情况下，文件系统中的内容不允许修改也不允许删除，直到安全模式结束。安全模式主要是为了系统启动的时候检查各个DataNode上数据块的有效性，同时根据策略必要的复制或者删除部分数据块。运行期通过命令也可以进入安全模式。在实践过程中，系统启动的时候去修改和删除文件也会有安全模式不允许修改的出错提示，只需要等待一会儿即可。
现在就清楚了，那现在要解决这个问题，我想让Hadoop不处在safe mode 模式下，能不能不用等，直接解决呢？
答案是可以的，只要在Hadoop的目录下输入：
bin/hadoop dfsadmin -safemode leave
也就是关闭Hadoop的安全模式，这样问题就解决了。如果不这么操作，我们可以等待几秒，然后再次执行程序，可以看到程序正常执行，有以下输出：

*
*
*
*
*
"*"，即上传进度，没写入64KB即输出一个"*"
然后查看hdfs的目录发现文件已经存在。

3.2 文件系统查询列出目录文件信息

package hadoop;

import java.io.IOException;

import java.net.URI;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.FileStatus;

import org.apache.hadoop.fs.FileSystem;

import org.apache.hadoop.fs.FileUtil;

import org.apache.hadoop.fs.Path;

public class ListStatus {

    public static void readStatus(String url) throws IOException {

        Configuration conf = new Configuration();

        FileSystem fs = FileSystem.get(URI.create(url), conf);

        Path[] paths = new Path[1];

        paths[0] = new Path(url);

        FileStatus[] status = fs.listStatus(paths);

        Path[] listedPaths = FileUtil.stat2Paths(status);

        for (Path p : listedPaths) {

            System.out.println(p);

        }

    }

    public static void main(String[] args) throws IOException {

        readStatus("hdfs://192.168.49.131:9000/user/hadoopuser/output20120828/");

    }

}

输出：

hdfs://192.168.49.131:9000/user/hadoopuser/output20120828/_SUCCESS
hdfs://192.168.49.131:9000/user/hadoopuser/output20120828/_logs
hdfs://192.168.49.131:9000/user/hadoopuser/output20120828/part-00000

HDFS常用的Java Api详解的更多相关文章

Hadoop框架：HDFS读写机制与API详解
本文源码:GitHub·点这里 || GitEE·点这里一.读写机制 1.数据写入客户端访问NameNode请求上传文件: NameNode检查目标文件和目录是否已经存在: NameNode响应客 ...
Java数据持久层框架 MyBatis之API学习八（Java API详解）
对于MyBatis的学习而言,最好去MyBatis的官方文档:http://www.mybatis.org/mybatis-3/zh/index.html 对于语言的学习而言,马上上手去编程,多多练习 ...
HDFS 05 - HDFS 常用的 Java API 操作
目录 0 - 配置 Hadoop 环境(Windows系统) 1 - 导入 Maven 依赖 2 - 常用类介绍 3 - 常见 API 操作 3.1 获取文件系统(重要) 3.2 创建目录.写入文件 ...
ElasticSearch Java api 详解_V1.0
/×××××××××××××××××××××××××××××××××××××××××/ Author:xxx0624 HomePage:http://www.cnblogs.com/xxx0624/ ...
Hbase Java API详解
HBase是Hadoop的数据库,能够对大数据提供随机.实时读写访问.他是开源的,分布式的,多版本的,面向列的,存储模型. 在讲解的时候我首先给大家讲解一下HBase的整体结构,如下图: HBase ...
Java 8 Streams API 详解
流式编程作为Java 8的亮点之一,是继Java 5之后对集合的再一次升级,可以说Java 8几大特性中,Streams API 是作为Java 函数式的主角来设计的,夸张的说,有了Streams A ...
Java 8 Stream API详解--转
原文地址:http://blog.csdn.net/chszs/article/details/47038607 Java 8 Stream API详解一.Stream API介绍 Java8引入了 ...
转】Mahout推荐算法API详解
原博文出自于: http://blog.fens.me/mahout-recommendation-api/ 感谢! Posted: Oct 21, 2013 Tags: itemCFknnMahou ...
Java 正则表达式详解_正则表达式
body{ font-family: "Microsoft YaHei UI","Microsoft YaHei",SimSun,"Segoe UI& ...

随机推荐

input propertychange(1)
input type=“text” 通过js改变输入框的value值是不会出发input propertychange事件
MySql安装成功后命令行进行必要的配置
1.1 首次用命令行登录用zip方式安装成功mysql,并通过net start mysql 命令正常启动mysql服务后,打开dos命令行窗口,输入“mysql -uroot -p”或“mysql ...
Apache Kudu
Apache Kudu是由Cloudera开源的存储引擎,可以同时提供低延迟的随机读写和高效的数据分析能力.Kudu支持水平扩展,使用Raft协议进行一致性保证,并且与Cloudera Impala和 ...
$《第一行代码：Android》读书笔记——第8章通知和手机多媒体
本章主要介绍了通知.短信.调用摄像头和相册.播放多媒体文件等内容. (一)通知的用法 1.通知的基本用法见如下代码(详细操作步骤在代码注释中): (1)先创建一个布局文件,其中只有一个名为“发送通知 ...
FTP下载
import java.io.BufferedInputStream;import java.io.BufferedOutputStream;import java.io.File;import ja ...
yii异常处理架构
使用方法: use \yii\base\ErrorException; try { exec("curl http://xxx",$out,$retno); if(0 !== $r ...
UnsatisfiedLinkError X.so is 64-bit instead of 32-bit之Android 64 bit SO加载机制
http://blog.csdn.net/canney_chen/article/details/50633982 今天用户反馈应用闪退崩溃了.然后找呀找… 过程原来是这样的: 还是说下项目背景应用 ...
【Head First Servlets and JSP】迷你MVC：JarDownload的完整实现
1.首先,写一个download.html放至D:\apache-tomcat-7.0.77\webapps\JarDownload-v1. <!DOCTYPE HTML> <htm ...
[POI2007]立方体大作战tet
题目 BZOJ 洛谷做法很巧妙的题,注意每种颜色只有两个消除一种颜色,其实就是看中间有多少个没有被消除的块,这种动态距离问题显然能用树状数组解决洛谷输出方案,暴力往下爬就行 My comple ...
linux+java+webdriver chrome handless无界面启动
网上现有的解决方案要么是windows下的,要么是python的,搞了一天终于解决了,记录如下. 1 下载chrome linux版和对应版本的webdriver,我这里使用的是chrome66和ch ...

HDFS常用的Java Api详解

HDFS常用的Java Api详解的更多相关文章

随机推荐

热门专题