一、设计思路

分布式文件系统

在Hadoop中文件系统是一个顶层的抽象。

分布式文件系统相当与对文件系统进行了一个扩展（类似于java中的接口）。

HDFS是分布式文件系统的一个实现，分布式文件系统还有许多其他的实现。

二、设计目标

1、硬件错误 是常态：特别是硬盘的损坏。所以存在副本机制。

2、数据流访问：所有的访问都是访问大量的数据，

					使用IO流一直操作。稳定而不是效率。

3、大数据集：存入到HDFS的数据都是海量的数据，不擅长处理小数据。

因为存入过多小数据，每个小数据都需要元数据，容易导致namenode宕机。

4、简单的相关模型：假定文件是一次写入，多次访问

5、移动计算比移动数据便宜

6、多种软硬件的可移植性

三 HDFS架构图

namenode:主要处理用户请求，维护元数据信息

secondarynode：辅助namenode维护元数据

datanode：存储数据

300M的文件需要划分为3个block块，实际的存储磁盘是300M，与block块个数没关系。

四、HDFS元数据管理

元数据分为两部分：

	fsimage 和edits

	fsimage ：保存着一份相对比较完整的元数据  。内存和磁盘中都有

	edits：保存着一段时间内的操作日志、元数据。 内存和磁盘中都有

	edits会在一些特定条件下（一段时间内，或者在文件达到多大）合并到fsimage中。

五、HDFS元数据合并

1、当达到条件后，secondarynode会通知namenode将要进行元数据合并，并让namenode进行edits切换。

2、secondarynode通过http的方式获取fsimage和edits

3、将fsimage和edits进行合并

4、将新的fsimage发送给namenide替换旧的fsimage

注意：

sencondarynode进行合并的时候是在内存中进行的，所以需要大的内存，部署的时候最好单独部署。

6、HDFS上传文件

1、client通知namenode需要上传文件

2、namenode检查是否有权限。namenode允许client上传文件

3、client将文件分割成block块，并访问namenode询问第一个block块存入何处。

4、namenode通过机架感知原理，找到离客户端最近的一台机器（跨交换机最少的机器），找到该机器可用的block块，返回给client

5、client找到对应的datanode以及对应的block的id ，建立RPC连接，通过rpc连接简历pipline进行数据传输。（数据传输是通过UDP进行包传输）。

6、当第一个block块传递完毕，数据校验。反向的校验机制会给client一个响应，client进行第二个block传递，直至所有block传递完毕

7、等数据传递完毕后，client通知namenode建立元数据

block复制策略：

第一个block存在namenode返回的datanode中

第二个存储在同一个交换机下的datanode

第三个存在不通的交换机

7、HDFS文件读取

1、client通知namenode读取数据

2、namenode检验权限，如果前线通过，那么namenode通过查找元数据，返回所有block块地址

		查找block规则：

								离client最近

								心跳机制（最近活跃的，namenode和datanode间存在心跳机制，datanode会一直返回给namenode自己的状态）

3、client并行访问datanode，读取所有block块并进行拼接。

注意

数据写入是串行：写入有ack机制，需要一个block块验证数据完整性后才能写入下一个。

数据读取是并行：读取不需要数据校验。

当一个block块读取到一般出现异常？

没有断点续传

client会到到副本中找，然后重新读取。

八、JAVA API

   public void hdfs() throws Exception {

        //注册驱动

        URL.setURLStreamHandlerFactory(new FsUrlStreamHandlerFactory());

        String url = "hdfs://node01:8020/install2.log";

        InputStream inputStream = new URL(url).openStream();

        FileOutputStream fileOutputStream = new FileOutputStream(new File("c:\\software\\hello1.txt"));

        IOUtils.copy(inputStream, fileOutputStream);

        IOUtils.closeQuietly(inputStream);

        IOUtils.closeQuietly(fileOutputStream);

    }

    @Test

    public void fileSystem01() throws IOException {

        Configuration configuration = new Configuration();

        configuration.set("fs.defaultFS", "hdfs://node01:8020");

        FileSystem fileSystem = FileSystem.get(configuration);

        System.out.println(fileSystem.toString());

        fileSystem.close();

    }

    @Test

    public void fileSystem02() throws URISyntaxException, IOException {

        Configuration configuration = new Configuration();

        FileSystem fileSystem = FileSystem.get(new URI("hdfs://node01:8020"), configuration);

        System.out.println(fileSystem.toString());

        fileSystem.close();

    }

    @Test

    public void fileSystem03() throws IOException {

        Configuration configuration = new Configuration();

        configuration.set("fs.defaultFS", "hdfs://node01:8020");

        FileSystem fileSystem = FileSystem.newInstance(configuration);

        System.out.println(fileSystem.toString());

        fileSystem.close();

    }

    @Test

    public void fileSystem04() throws IOException, URISyntaxException {

        Configuration configuration = new Configuration();

        FileSystem fileSystem = FileSystem.newInstance(new URI("hdfs://node01:8020"),configuration);

        System.out.println(fileSystem.toString());

        fileSystem.close();

    }

HDFS设计思想、元数据、简单JAVAAPI操作HDFS的更多相关文章

HDFS设计思想
HDFS设计思想 DataNode:用来在磁盘上存储数据 HDFS 数据存储单元( block ) 1 文件被切分成固定大小的数据block块 •默认数据块大小为 64MB(hadoop1.x版本6 ...
从一般分布式设计看HDFS设计思想与架构
要想深入学习HDFS就要先了解其设计思想和架构,这样才能继续深入使用HDFS或者深入研究源代码.懂得了"所以然"才能在实际使用中灵活运用.快速解决遇到的问题.下面这篇博文我们就先 ...
使用javaAPI操作hdfs
欢迎到https://github.com/huabingood/everyDayLanguagePractise查看源码. 一.构建环境在hadoop的安装包中的share目录中有hadoop所有 ...
使用Java Api 操作HDFS
如题我就是一个标题党就是使用JavaApi操作HDFS,使用的是MAVEN,操作的环境是Linux 首先要配置好Maven环境,我使用的是已经有的仓库,如果你下载的jar包速度慢,可以改变Ma ...
java操作hdfs到数据库或者缓存
使用hadoop工具将数据分析出来以后,须要做入库处理或者存到缓存中.不然就没了意义一下是使用javaAPI操作hdfs存入缓存的代码: <span style="font-fami ...
MyBatis 强大之处多环境多数据源 ResultMap 的设计思想是缓存算法跨数据库 spring boot rest api mybaits limit 传参
总结: 1.mybaits配置工2方面: i行为配置,如数据源的实现是否利用池pool的概念(POOLED – This implementation of DataSource pools JDBC ...
三张图片看懂ZKEACMS的设计思想
前言如果你还不知道ZKEACMS,不妨先了解一下. ASP.NET MVC 开源建站系统 ZKEACMS 推荐,从此网站“拼”起来官方地址:http://www.zkea.net/zkeacms ...
React中的响应式设计思想和事件绑定
这两个点是react入门非常重要的两个点,以前我们是直接操作dom的形式去做,react的设计思想和以前直接操作dom是完全不同的,react是一个响应式的框架,他在做编程的时候,强调的是我们不要直接 ...
2 weekend110的HDFS的JAVA客户端编写 + filesystem设计思想总结
HDFS的JAVA客户端编写现在,我们来玩玩,在linux系统里,玩eclipse 或者, 即,更改图标,成功这个,别慌.重新换个版本就好,有错误出错是好事. http://www.eclips ...

随机推荐

Codeforce 270D Greenhouse Effect
Emuskald is an avid horticulturist and owns the world's longest greenhouse - it is effectively infin ...
python——remove，del，pop三种删除元素方式的区别
记性不好,整理出来以作保存 1.remove ①直接删除元素,remove(obj),顺序删除第一个遇到的,所以想要全部删除 ,需要遍历 aList = [123, 'xyz', 'zara', 'a ...
使用Jexus 容器化您的 Blazor 应用程序
在本文中,我们将介绍如何将 Blazor 应用程序放入Jexus 容器以进行开发和部署.我们将使用 .NET Core CLI,因此无论平台如何,使用的命令都将是相同的. Blazor 托管模型 B ...
shell之路 shell核心语法【第三篇】运算
Bash 支持很多运算符,包括算数运算符.关系运算符.布尔运算符.字符串运算符和文件测试运算符. 原生bash不支持简单的数学运算,默认都是字符串操作,但是可以通过其他命令来实现算数运算 expr. ...
进程间通信之socketpair
socketpair是进程间通信的一种方式. API: ]); DEMO: #include <stdio.h> #include <stdlib.h> #include &l ...
网络流 + 欧拉回路 = B - Sightseeing tour POJ - 1637
B - Sightseeing tour POJ - 1637 https://blog.csdn.net/qq_36551189/article/details/80905345 首先要了解一下欧拉 ...
Golang 实现 Redis(5): 使用跳表实现 SortedSet
本文是使用 golang 实现 redis 系列的第五篇, 将介绍如何使用跳表实现有序集合(SortedSet)的相关功能. 跳表(skiplist) 是 Redis 中 SortedSet 数据结构 ...
SpringMVC源码学习：容器初始化+MVC初始化+请求分发处理+参数解析+返回值解析+视图解析
目录一.前言二.初始化 1. 容器初始化根容器查找的方法容器创建的方法加载配置文件信息 2. MVC的初始化文件上传解析器区域信息解析器 handler映射信息解析 3. Handler ...
FPGA代码优化方法和准则
LabVIEW(数据库连接)
Driver={Microsoft Access Driver (*.mdb)}; Dbq=路径; Uid=Admin; Pwd=密码; 插入: INSERT INTO xs(学号,姓名,专业名,性别 ...

HDFS设计思想、元数据、简单JAVAAPI操作HDFS

一、 设计思路

分布式文件系统

二、设计目标

三 HDFS架构图

四、HDFS元数据管理

五、HDFS元数据合并

6、HDFS上传文件

7、HDFS文件读取

八、JAVA API

HDFS设计思想、元数据、简单JAVAAPI操作HDFS的更多相关文章

随机推荐

热门专题

一、设计思路