[摘录自] https://www.yiibai.com/hadoop/hadoop_hdfs_operations.html#article-start

一、HDFS 使用基础

格式化配置HDFS文件系统,打开NameNode(HDFS服务器),然后执行  hadoop namenode -format

格式化HDFS后,启动分布式文件系统,  $ start-dfs.sh

找出文件列表中的目录,文件状态,可以传递一个目录或文件名作为参数:  hadoop fs -ls <args>

创建一个输入目录: hadoop fs -mkdir /user/input

传输本地数据文件存储Hadoop文件系统:  hadoop fs -put /home/file.txt /user/input

查看来自HDFS的数据:  hadoop fs -cat /user/output/outfile

从HDFS得到文件:  hadoop fs -get /user/output/ /home/hadoop_tp/

可以使用下面的命令关闭HDFS:  $ stop-dfs.sh

在“$HADOOP_HOME/bin/hadoop fs” 里有更多的命令。./bin/hadoop DFS 列出所有可以使用在FsShell系统上运行的命令。此外,$HADOOP_HOME/bin/hadoop fs -help 命令名称会显示一个简短的用法。

所有表的操作如下所示。以下是使用参数一般方式:

"<path>" means any file or directory name.
"<path>..." means one or more file or directory names.
"<file>" means any filename.
"<src>" and "<dest>" are path names in a directed operation.
"<localSrc>" and "<localDest>" are paths as above, but on the local file system.

所有其他文件和路径名是指HDFS内部的对象。

1.

ls <path>

列出路径指定的目录中的内容,示出了名称,权限,拥有者,大小和修改日期的每个条目。

2.

lsr <path>

行为类似于-ls,但递归显示路径的所有子目录项。

3.

du <path>

显示磁盘使用率,以字节为单位,对所有的文件,这些文件匹配的路径;文件名报告使用完整HDFS协议前缀。

4.

dus <path>

类似-du,但打印路径中的所有文件/目录的磁盘使用情况的摘要。

5.

mv <src><dest>

通过移动表示src到dest,在HDFS的文件或目录。

6.

cp <src> <dest>

在HDFS复制确定src中的文件或目录到dest。

7.

rm <path>

删除文件或路径标识的空目录。

8.

rmr <path>

删除路径标识的文件或目录。递归删除所有子条目(例如,文件或路径的子目录)。

9.

put <localSrc> <dest>

从本地localSrc文件系统中的DFS标识文件或目录内复制到dest。

10.

copyFromLocal <localSrc> <dest>

等同于-put

11.

moveFromLocal <localSrc> <dest>

从标识 localSrc本地文件系统中的文件或目录中HDFS复制到dest,然后删除本地副本上成功。

12.

get [-crc] <src> <localDest>

拷贝标识 src 来确定localDest本地文件系统路径HDFS文件或目录。

13.

getmerge <src> <localDest>

检索匹配的路径的src HDFS中的所有文件,并将它们复制合并文件到标识localDest本地文件系统中。

14.

cat <filen-ame>

显示在标准输出文件名的内容。

15.

copyToLocal <src> <localDest>

等同于 -get

16.

moveToLocal <src> <localDest>

工作方式类似于-get,但删除HDFS复制成功。

17.

mkdir <path>

在创建一个HDFS命名的目录路径。

创建任何父目录的路径丢失(例如,命令mkdir-p在Linux中)。

18.

setrep [-R] [-w] rep <path>

设置标识路径代表文件的目标文件复制因子。 (实际的复制因子会向着随着时间的推移目标移动)

19.

touchz <path>

创建在路径包含当前时间作为时间戳的文件。失败如果文件已经存在于路径,除非文件已经大小为0。

20.

test -[ezd] <path>

返回1,如果路径存在;长度为零;或者是一个目录,否则为0。

21.

stat [format] <path>

打印有关的路径信息。格式是接受块文件大小(%b),文件名(%n),块大小(%o),复制(%r)和修改日期(%y,%Y)的字符串。

22.

tail [-f] <file2name>

显示在标准输出文件的最后1KB。

23.

chmod [-R] mode,mode,... <path>...

变化符合路径标识的一个或多个对象关联的文件权限....递归执行变更与R.模式是3位八进制模式,或{augo}+/-{rwxX}。假设如果没有指定范围,则不适用umask。

24.

chown [-R] [owner][:[group]] <path>...

设置拥有用户和/或组标识路径的文件或目录....设置所有者递归,如果指定-R。

25.

chgrp [-R] group <path>...

设置所属组标识路径的文件或目录....设置组递归,如果指定-R。

26.

help <cmd-name>

返回使用上面列出的命令之一信息。必须省略了'-' 字符在cmd。

二、基于java的MapReduce job 例子

1. 新建java maven项目,添加如下依赖项:

<dependency>
  <groupId>org.apache.hadoop</groupId>
  <artifactId>hadoop-core</artifactId>
  <version>1.2.1</version>
</dependency>

2. 编写java code:

Hadoop 使用基础的更多相关文章

  1. hadoop rpc基础

    第一部分: hadoop rpc基础 RPC,远程程序调用,分布式计算中C/S模型的一个应用实例. 同其他RPC框架一样,Hadoop分为四个部分: 序列化层:支持多种框架实现序列化与反序列化 函数调 ...

  2. Hadoop(分布式系统基础架构)---Hive与HBase区别

    对于刚接触大数据的用户来说,要想区分Hive与HBase是有一定难度的.本文将尝试从其各自的定义.特点.限制.应用场景等角度来进行分析,以作抛砖引玉之用.  Hive是什么? Apache Hive是 ...

  3. Hadoop程序基础模板

    分布式编程相对复杂,而Hadoop本身蒙上大数据.云计算等各种面纱,让很多初学者望而却步.可事实上,Hadoop是一个很易用的分布式编程框架,经过良好封装屏蔽了很多分布式环境下的复杂问题,因此,对普通 ...

  4. Hadoop框架基础(五)

    ** Hadoop框架基础(五) 已经部署了Hadoop的完全分布式集群,我们知道NameNode节点的正常运行对于整个HDFS系统来说非常重要,如果NameNode宕掉了,那么整个HDFS就要整段垮 ...

  5. Hadoop 框架基础(四)

    ** Hadoop 框架基础(四) 上一节虽然大概了解了一下 mapreduce,徒手抓了海胆,不对,徒手写了 mapreduce 代码,也运行了出来.但是没有做更深入的理解和探讨. 那么…… 本节目 ...

  6. Hadoop框架基础(三)

    ** Hadoop框架基础(三) 上一节我们使用eclipse运行展示了hdfs系统中的某个文件数据,这一节我们简析一下离线计算框架MapReduce,以及通过eclipse来编写关于MapReduc ...

  7. Hadoop框架基础(二)

    ** Hadoop框架基础(二) 上一节我们讨论了如何对hadoop进行基础配置已经运行一个简单的实例,接下来我们尝试使用eclipse开发. ** maven安装 简单介绍:maven是一个项目管理 ...

  8. Hadoop框架基础(一)

    ** Hadoop框架基础(一)     学习一个新的东西,传统而言呢,总喜欢漫无目的的扯来扯去,比如扯扯发展史,扯扯作者是谁,而我认为这些东西对于刚开始接触,并以开发为目的学者是没有什么帮助的,反而 ...

  9. 【Hadoop离线基础总结】oozie的安装部署与使用

    目录 简单介绍 概述 架构 安装部署 1.修改core-site.xml 2.上传oozie的安装包并解压 3.解压hadooplibs到与oozie平行的目录 4.创建libext目录,并拷贝依赖包 ...

  10. 【Hadoop离线基础总结】Hue的简单介绍和安装部署

    目录 Hue的简单介绍 概述 核心功能 安装部署 下载Hue的压缩包并上传到linux解压 编译安装启动 启动Hue进程 hue与其他框架的集成 Hue与Hadoop集成 Hue与Hive集成 Hue ...

随机推荐

  1. tensorflow 中 feed的用法

    Feed 上述示例在计算图中引入了 tensor, 以常量或变量的形式存储. TensorFlow 还提供了 feed 机制, 该机制 可以临时替代图中的任意操作中的 tensor 可以对图中任何操作 ...

  2. HDU 5293 Tree chain problem

    树状数组 + dp 设$f_i$表示以$i$为根的子树中的能选取的最大和,$sum_x$表示$\sum_{f_y}$  ($y$是$x$的一个儿子),这样子我们把所有给出的链按照两点的$lca$分组, ...

  3. Entity Framework 6.0 Tutorials(11):Download Sample Project

    Download Sample Project: Download a sample project for Entity Framework 6 Database-First model below ...

  4. Convert HTML to PDF with New Plugin

    FROM:http://www.e-iceblue.com/Tutorials/Spire.PDF/Spire.PDF-Program-Guide/Convert-HTML-to-PDF-with-N ...

  5. Slf4j MDC 使用和 基于 Logback 的实现分析

    前言 如今,在 Java 开发中,日志的打印输出是必不可少的, 关于  有了日志之后,我们就可以追踪各种线上问题.但是,在分布式系统中,各种无关日志穿行其中,导致我们可能无法直接定位整个操作流程.因此 ...

  6. wpf附加属性理解

    WPF附加属性 http://www.cnblogs.com/tianyou/archive/2012/12/27/2835670.html WPF属性(二)附加属性 http://blog.csdn ...

  7. oracle 中 创建序列sequence

    drop sequence SEQ_YCXWP_CGD; create sequence SEQ_YCXWP_CGD increment start nomaxvalue;

  8. 搜索引擎Hoot的源码阅读(提供源码)

    开门见山,最近阅读了一下一款开源引擎的源码,受益良多(学到了一些套路).外加好久没有写博客了(沉迷吃鸡,沉迷想念姑娘),特别开一篇.Hoot 的源码地址, 原理介绍地址.外加我看过之后的注释版本,当然 ...

  9. 如何使用 channel

    如何使用 Channel 例子来自于Concurrency is not parallelism Google Search: A fake framework v1.0 var ( Web = fa ...

  10. IT学习资源

    介绍个人微信公众平台:Web开发笔记 含有免费学习资源,个人学习笔记,技术文章分享  资源篇 1.webapp书城开发 链接: https://pan.baidu.com/s/1pMHGKrh 密码: ...